Python3+Selenium+BeautifulSoup实现高效网页数据采集与存储
1. 项目概述最近在做一个需要从多个网站采集数据的项目经过对比各种技术方案最终选择了Python3SeleniumBeautifulSoup这套组合拳。这套方案最大的优势是既能处理动态加载的网页内容又能高效解析HTML结构最后还能把清洗好的数据存入MySQL数据库。下面我就详细分享一下整个实现过程包括环境搭建、核心代码实现以及实际踩过的坑。2. 环境准备与工具选型2.1 Python3环境配置建议使用Python 3.7及以上版本这个版本对异步IO的支持更好在处理大量网页请求时性能更优。我个人习惯用Anaconda管理Python环境conda create -n web_scraper python3.8 conda activate web_scraper2.2 必要库安装核心依赖库包括selenium用于浏览器自动化beautifulsoup4HTML解析mysql-connector-pythonMySQL数据库连接lxmlBeautifulSoup的解析器安装命令pip install selenium beautifulsoup4 mysql-connector-python lxml2.3 浏览器驱动配置Selenium需要对应的浏览器驱动。以Chrome为例查看Chrome浏览器版本从ChromeDriver官网下载匹配版本的驱动将驱动文件放在系统PATH路径下或者代码中指定路径注意浏览器和驱动版本必须严格匹配否则会报错3. 核心实现逻辑3.1 网页内容获取使用Selenium获取动态加载的页面内容from selenium import webdriver from selenium.webdriver.chrome.options import Options def get_page(url): chrome_options Options() chrome_options.add_argument(--headless) # 无头模式 chrome_options.add_argument(--disable-gpu) driver webdriver.Chrome(optionschrome_options) driver.get(url) # 等待动态内容加载 driver.implicitly_wait(10) page_source driver.page_source driver.quit() return page_source3.2 数据解析用BeautifulSoup解析HTML并提取目标数据from bs4 import BeautifulSoup def parse_html(html): soup BeautifulSoup(html, lxml) # 示例提取所有新闻标题和链接 news_list [] articles soup.select(.article-list li) for article in articles: title article.select_one(h3).text.strip() link article.select_one(a)[href] news_list.append({title: title, link: link}) return news_list3.3 数据存储将解析后的数据存入MySQLimport mysql.connector def save_to_mysql(data): conn mysql.connector.connect( hostlocalhost, useryour_username, passwordyour_password, databaseweb_data ) cursor conn.cursor() # 创建表如果不存在 create_table CREATE TABLE IF NOT EXISTS news ( id INT AUTO_INCREMENT PRIMARY KEY, title VARCHAR(255), link VARCHAR(255), created_at TIMESTAMP DEFAULT CURRENT_TIMESTAMP ) cursor.execute(create_table) # 插入数据 insert_sql INSERT INTO news (title, link) VALUES (%s, %s) for item in data: cursor.execute(insert_sql, (item[title], item[link])) conn.commit() cursor.close() conn.close()4. 实战技巧与优化4.1 反爬虫策略应对随机User-Agent每次请求使用不同的浏览器标识请求间隔设置随机延迟避免高频访问IP代理池使用代理IP轮换验证码识别对接第三方验证码识别服务4.2 性能优化使用Selenium Grid实现分布式爬取对BeautifulSoup解析过程进行性能分析优化CSS选择器MySQL批量插入代替单条插入# 批量插入示例 def batch_insert(data): # ...连接数据库代码同上... insert_sql INSERT INTO news (title, link) VALUES (%s, %s) cursor.executemany(insert_sql, [(item[title], item[link]) for item in data]) # ...提交和关闭连接代码同上...4.3 异常处理健壮的爬虫需要完善的异常处理from selenium.common.exceptions import TimeoutException, WebDriverException from mysql.connector import Error as MySQLError try: html get_page(url) data parse_html(html) save_to_mysql(data) except TimeoutException: print(页面加载超时) except WebDriverException as e: print(f浏览器异常: {str(e)}) except MySQLError as e: print(f数据库错误: {str(e)}) except Exception as e: print(f未知错误: {str(e)})5. 完整项目结构一个规范的爬虫项目建议这样组织web_scraper/ ├── config/ # 配置文件 │ ├── settings.py # 数据库配置等 │ └── user_agents.py # User-Agent列表 ├── spiders/ # 爬虫代码 │ ├── news_spider.py # 新闻爬虫 │ └── product_spider.py # 商品爬虫 ├── utils/ # 工具函数 │ ├── db.py # 数据库操作 │ └── proxy.py # 代理IP管理 ├── requirements.txt # 依赖文件 └── main.py # 主入口6. 常见问题解决6.1 Selenium元素定位失败可能原因页面未完全加载 - 增加等待时间或使用显式等待元素在iframe中 - 需要先切换到对应iframe元素是动态生成的 - 使用更稳定的定位方式解决方案from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC # 显式等待示例 element WebDriverWait(driver, 10).until( EC.presence_of_element_located((By.CSS_SELECTOR, .target-element)) )6.2 BeautifulSoup解析出错常见问题编码问题 - 指定正确的页面编码不完整的HTML - 使用更宽容的html.parser复杂的嵌套结构 - 使用更精确的CSS选择器解决方案# 处理编码问题 response requests.get(url) response.encoding utf-8 # 或根据实际情况调整 soup BeautifulSoup(response.text, lxml)6.3 MySQL连接问题排查步骤检查MySQL服务是否运行验证用户名密码是否正确检查是否有远程连接权限确认防火墙设置连接参数优化config { host: localhost, user: username, password: password, database: dbname, raise_on_warnings: True, pool_name: scraper_pool, pool_size: 5, # 连接池大小 connect_timeout: 30 # 连接超时时间 }7. 项目扩展思路添加定时任务使用APScheduler实现定时爬取数据可视化将MySQL数据用Pandas分析后生成报表分布式扩展使用Scrapy-Redis实现分布式爬取数据监控添加异常数据检测和报警机制API接口用Flask/Django提供数据查询接口# 定时任务示例 from apscheduler.schedulers.blocking import BlockingScheduler scheduler BlockingScheduler() scheduler.scheduled_job(interval, hours1) def scheduled_job(): # 执行爬取任务 pass scheduler.start()8. 个人实战经验在实际项目中我总结了以下几点经验对于大规模爬取一定要做好日志记录方便问题追踪数据库设计时要考虑字段的扩展性预留一些备用字段定期维护代理IP池免费的代理IP通常存活时间很短遵守robots.txt协议控制爬取频率避免给目标网站造成负担重要数据一定要做好备份可以使用MySQL的定时备份功能一个实用的日志记录配置示例import logging from logging.handlers import RotatingFileHandler def setup_logger(name): logger logging.getLogger(name) logger.setLevel(logging.INFO) # 文件日志最大10MB保留3个备份 file_handler RotatingFileHandler( scraper.log, maxBytes10*1024*1024, backupCount3 ) file_handler.setFormatter(logging.Formatter( %(asctime)s - %(name)s - %(levelname)s - %(message)s )) logger.addHandler(file_handler) return logger

相关新闻

LLM长对话记忆管理:协作式分页与关键词书签技术解析

LLM长对话记忆管理:协作式分页与关键词书签技术解析

1. 项目概述:当LLM对话变长,我们如何记住一切?如果你和我一样,深度使用过大语言模型进行过长时间的对话,无论是用它来辅助编程、进行复杂的头脑风暴,还是撰写一篇长文,你肯定遇到过这个令人头疼…

2026/10/5 13:59:30 阅读更多 →
微电网群共享储能优化配置与调度策略研究

微电网群共享储能优化配置与调度策略研究

1. 项目背景与核心挑战光伏发电作为清洁能源的重要组成部分,近年来在分布式能源领域快速发展。然而在实际运行中,光伏发电的间歇性和波动性给电网稳定运行带来了显著挑战。特别是在分布式光伏高渗透率区域,如何有效消纳光伏发电量成为行业痛点…

2026/9/28 19:22:10 阅读更多 →
Kotlin接口设计原理与多继承实践指南

Kotlin接口设计原理与多继承实践指南

1. Kotlin接口的本质与设计哲学Kotlin接口远不止是Java接口的简单升级,它重新定义了多继承的实现方式。在Java中,接口只能包含抽象方法声明,而Kotlin接口可以包含:抽象方法(没有方法体)具体方法&#xff08…

2026/10/11 0:25:00 阅读更多 →

最新新闻

geo-sleuth如何用街景验证位置:DINOv2+SIFT双阶段匹配原理与实践

geo-sleuth如何用街景验证位置:DINOv2+SIFT双阶段匹配原理与实践

【免费下载链接】geo-sleuth An agent skill that finds where a photo was taken — OpenStreetMap geometry, elevation skylines, satellite imagery and street view — and shows its work. Works with Claude Code, Codex, Cursor, Gemini CLI, OpenCode and GitHub Copi…

2026/10/12 5:11:02 阅读更多 →
Android图书阅读器源码解析:从MVC分层到TXT导入与自动书签实现

Android图书阅读器源码解析:从MVC分层到TXT导入与自动书签实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 5:11:01 阅读更多 →
Java 8 Lambda 与 Stream 实战:从语法细节到集合处理重构

Java 8 Lambda 与 Stream 实战:从语法细节到集合处理重构

1. 为什么 Lambda 和 Stream 值得认真用一次1.1 先看一组对比:传统写法 vs Lambda/StreamJava 8 发布已经超过十年,Lambda 和 Stream 早就不是新鲜东西了。但我这几年做代码评审,发现很多团队的老代码里还在用十年前那种写法:明明…

2026/10/12 5:11:01 阅读更多 →
街机小游戏网页源码解析:从贪吃蛇到俄罗斯方块的实现技巧

街机小游戏网页源码解析:从贪吃蛇到俄罗斯方块的实现技巧

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 5:11:01 阅读更多 →
SQL Server数据库修复实战:DBCC CHECKDB检查与数据抢救指南

SQL Server数据库修复实战:DBCC CHECKDB检查与数据抢救指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 5:11:01 阅读更多 →
Oracle EBS AR发票管理全链路解析:从开票到核销的底层逻辑与避坑指南

Oracle EBS AR发票管理全链路解析:从开票到核销的底层逻辑与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 5:10:01 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →