python-mini-projects 实战:基于 BeautifulSoup 的 moneycontrol 金融新闻多页爬虫
python-mini-projects 实战基于 BeautifulSoup 的 moneycontrol 金融新闻多页爬虫【免费下载链接】python-mini-projectsA collection of simple python mini projects to enhance your python skills项目地址: https://gitcode.com/gh_mirrors/py/python-mini-projects本文以 python-mini-projects 仓库中的 News_website_scraper 项目为对象完整讲解如何用 Python 的requestsBeautifulSoup 4定制一款面向印度金融新闻网站 moneycontrol.com 的新闻爬虫。读完本文你将掌握「解析分页导航 → 逐页抓取标题/日期/图片 → 按日期命名输出 JSON」的完整爬虫开发链路并能直接运行或改造成其他新闻站点的通用抓取方案。项目概览一个为 moneycontrol 量身定制的新闻抓取器本项目位于仓库的 projects/News_website_scraper/ 目录其官方定位见 README.md是A scraper made using beautiful soup 4 in python. Tailor made for extracting news from moneycontrol.com.它不是一个通用爬虫而是针对 moneycontrol.com 新闻页的页面结构深度定制的实现核心入口为「Technical Call」技术分析栏目程序会从该栏目首页出发自动发现分页按钮中的下一页链接逐页抓取每篇新闻的标题title、日期date与配图链接img_src最后将全部数据按「页码 → 字段」的结构写入以当天日期命名的 JSON 文件。仓库作者还在 README 中明确表示Issue pull request for different scrapers即鼓励贡献者以此为模板为其他新闻网站编写各自的定制爬虫——这也是本篇文章希望帮你达成的能力。下图是该栏目页的真实形态即爬虫的起始抓取页面运行环境与依赖准备项目主体只有一个文件 moneycontrol_scrapper.py无独立 requirements.txt依赖全部集中在文件顶部 import 中依赖库用途对应源码行requests发送 HTTP 请求获取页面 HTML 文本moneycontrol_scrapper.pybs4BeautifulSoup解析 HTML定位节点并提取数据moneycontrol_scrapper.pylxmlBeautifulSoup 的底层解析器lxmlmoneycontrol_scrapper.pytqdm分页抓取时显示进度条moneycontrol_scrapper.pyre用正则过滤分页链接中的void无效项moneycontrol_scrapper.pyjson/datetime序列化结果、生成按日期命名的文件名moneycontrol_scrapper.pydefaultdictcollections以页号为 key 构建结果字典moneycontrol_scrapper.py在运行前安装依赖建议在虚拟环境中执行pip install requests beautifulsoup4 lxml tqdm适用前提本脚本依赖 Python 3 环境且需要可访问目标站点的网络lxml解析器要求系统能正常编译/安装该二进制包。源码结构与核心工作流从源码看脚本按「三步流水线」组织并在文件末尾顺序调用moneycontrol_scrapper.pysetup(src_url) # ① 解析分页导航收集所有页面的 URL 并逐页触发抓取 json_dump(submission) # ③ 将全局结果字典写入 JSON 文件 └─ ② scrap(url, idx) # 被 setup 回调抓取单页标题/日期/图片全局数据容器submission defaultdict(list)第 9 行以页号为 key、字段列表为 value贯穿整个流程。下面按函数逐一拆解。setup()从分页按钮反推全部页面链接setup()第 14-24 行是整个爬虫的调度入口它做两件事定位分页容器并提取链接requests.get(url).text拿到 HTML 后交给 BeautifulSoup 解析通过src.find(div, attrs{class: pagenation})定位分页条再用findAll(a, {href: re.compile(^((?!void).)*$)})找出所有分页a标签。这里的正则^((?!void).)*$是一个负向前瞻匹配——排除hrefjavascript:void(0)这类无实际跳转的占位链接只保留真实的分页地址。拼接完整 URL 并逐页抓取moneycontrol 的分页链接是站内相对路径源码用https://www.moneycontrol.com link手工拼出完整地址第 24 行随后用tqdm包裹循环在终端实时展示分页抓取进度。下图为分页按钮区域的实际形态含数字页码与 First / / / Last 导航按钮正是div.pagenation所解析的 DOM 结构scrap()单页新闻的「一鱼两吃」式数据提取scrap(url, idx)第 27-42 行负责单个新闻列表页的内容抽取其最精妙之处在于用一张img标签同时拿到标题与图片链接定位内容容器src.find(ul, {id: cagetory})注意 moneycontrol 此栏目页的新闻列表容器 id 是cagetory原文拼写非category说明该选择器是针对站点当前 DOM 硬编码的提取图片findAll(img)后取每个标签的src属性作为配图地址提取标题同一批img标签的alt属性恰好被站点设置为新闻标题因此[i.attrs[alt] for i in img]一行即可得到全部标题——源码注释第 34 行明确说明了这一站点特性提取日期findAll(span)并取get_text()得到每条新闻的时间戳文本。提取结果按页号存入全局字典第 40-42 行submission[str(idx)].append({title: titles}) submission[str(idx)].append({date: date}) submission[str(idx)].append({img_src: imgs})json_dump()按当天日期命名并落盘 JSONjson_dump()第 45-48 行负责把内存中的submission字典序列化到磁盘date datetime.date.today().strftime(%B %d, %Y) with open(moneycontrol_ str(date) .json, w) as outfile: json.dump(submission, outfile)文件名使用%B %d, %Y格式的完整英文日期例如运行于 2020 年 6 月 21 日时产出moneycontrol_June 21, 2020.json——这样每次运行都会生成带日期戳的新文件天然避免覆盖历史数据。输出数据结构以页号为索引的 JSON最终 JSON 的顶层 key 是页号字符串0、1、2…每个页号下依次挂载title、date、img_src三个字段的列表结构示意如下{ 0: [ {title: [Bank Nifty forms short term base at 20k..., ...]}, {date: [June 21, 2020 12:38 PM IST, ...]}, {img_src: [https://.../image1.jpg, ...]} ], 1: [ ... ] }下图为脚本实际运行后终端输出的 JSON 结果文件名moneycontrol_June 21, 2020.json可见标题与日期均已按列表结构完整抓取从源码结构看当前设计将同一页的标题、日期、图片分开存放在三个独立字段中而非按「一条新闻一个对象」组织字段间依靠列表下标对齐关联若后续需要可以在此基础上改造成[{title: ..., date: ..., img_src: ...}, ...]的按条目聚合结构更便于数据分析与入库。运行方式在 projects/News_website_scraper/ 目录下直接执行python moneycontrol_scrapper.py脚本会依次完成请求起始栏目页 → 解析分页 → 带进度条地逐页抓取 → 在当前目录生成moneycontrol_当月 日, 年.json。注意起始 URL 硬编码于源码 第 11 行https://www.moneycontrol.com/news/technical-call-221.htmlREADME 明确标注The main page to start scraping from如需抓取其他栏目可修改该变量后观察新页面 DOM 是否与现有选择器匹配。注意事项与局限基于源码的审慎提示以下几点均由源码实现推断而来使用前请务必知悉强依赖站点 DOM 结构div.pagenation、ul#cagetory、img[alt]等选择器都是对 moneycontrol 当前页面结构的硬编码见 setup 与 scrap。若网站改版、改 id 或不再把标题写入alt脚本将直接失效需要同步更新选择器无反爬与容错处理脚本未设置请求头、延时或重试机制直接连续请求多页实际部署时建议补充User-Agent、time.sleep与异常捕获合规边界本项目定位为学习型迷你项目请仅用于个人学习与技术验证抓取前应尊重目标站点的服务条款与 robots 协议控制请求频率避免对目标服务器造成压力。扩展方向从定制爬虫到通用方案README 提出的Issue pull request for different scrapers明确了该项目的扩展路径——你完全可以复用本脚本的「分页发现 列表抽取 JSON 落盘」三段式骨架仅替换选择器与字段映射即可快速适配其他新闻站点。可参考仓库内同类的抓取实践例如 Scrape_Hacker_News、Scrape_quotes、Web_scraping_a_youtube_comment对比不同站点在选择器策略上的取舍。以本文剖析的三函数结构为模板你便能举一反三为任意列表型网页快速构建属于自己的 JSON 数据管道。【免费下载链接】python-mini-projectsA collection of simple python mini projects to enhance your python skills项目地址: https://gitcode.com/gh_mirrors/py/python-mini-projects创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

航天科技PPT模板设计全攻略:从深空配色到版面规划

航天科技PPT模板设计全攻略:从深空配色到版面规划

简介:航天科学技术演示文稿模板,专为航天科技主题展示而设计,适用于科普讲座、高校教学、学术会议及商务汇报等场景。模板包含封面、目录、章节页与图文内容页等常用版式,深蓝星空搭配科技线条,风格专业稳重&#xff0…

2026/9/22 1:58:13 阅读更多 →
AI协作写作的效能感与产出质量:实验设计与量化评估

AI协作写作的效能感与产出质量:实验设计与量化评估

简介:ChatGPT任务续写对二语写作效能感与产出质量的影响是该论文的核心议题,研究面向外语教学研究者、教育技术从业者及关注AI辅助写作的师生。论文采用实验与问卷调查相结合的混合研究方法,通过对比分析人工智能参与写作前后参与者的效能感变…

2026/9/22 1:57:53 阅读更多 →
oMLX分层KV缓存实战:SSD当后备存储,32GB内存跑32K上下文

oMLX分层KV缓存实战:SSD当后备存储,32GB内存跑32K上下文

先说结论:在 Apple Silicon 的机器上,把 SSD 当成 KV 缓存的后备存储,是让 32GB 内存跑 30B 级别模型并撑住上万 token 上下文的性价比方案。我这几个月一直在折腾 oMLX 的分层 KV 缓存,拿它当 Claude Code 的本地后端&#xff0c…

2026/9/22 1:57:53 阅读更多 →

最新新闻

手机qq音乐避坑指南:5个必改的Bug让代码跑通

手机qq音乐避坑指南:5个必改的Bug让代码跑通

手机qq音乐避坑指南:5个必改的Bug让代码跑通 刚毕业进组,对着文档敲下的代码运行直接报错,心里慌得一批?别急,这是每个新手的必经之路。 今天不讲虚的,只聊怎么把复制来的手机QQ音乐API调用代码调通。…

2026/9/22 1:59:04 阅读更多 →
搞懂健身教练要求这3点,前端实战项目不再踩坑

搞懂健身教练要求这3点,前端实战项目不再踩坑

搞懂健身教练要求这3点,前端实战项目不再踩坑 刚入行前端,或者从其他行业转行过来,是不是经常陷入这种尴尬:语法背得滚瓜烂熟,LeetCode 刷了大半本,但一让你做一个 实战项目 ,脑子就一片空白?…

2026/9/22 1:59:04 阅读更多 →
3步搞定WMF格式解析,一文搞懂原理与实战避坑

3步搞定WMF格式解析,一文搞懂原理与实战避坑

3步搞定WMF格式解析,一文搞懂原理与实战避坑 刚入职那会儿,我接手一个老旧政府系统的文档转换需求,结果在WMF格式上卡了整整三天。 配置环境就卡半天…

2026/9/22 1:59:04 阅读更多 →
瓜帅考试避坑指南:5个面试必问底层原理

瓜帅考试避坑指南:5个面试必问底层原理

瓜帅考试避坑指南:5个面试必问底层原理 看了一堆瓜帅教程还是不会写项目?别急,这锅不全是你的。很多技术老手在复盘时发现,卡住你的往往不是语法,而是那些 面试必问…

2026/9/22 1:59:04 阅读更多 →
网易云下载源码深扒:3个坑让你不再配置半天,面试必问

网易云下载源码深扒:3个坑让你不再配置半天,面试必问

网易云下载源码深扒:3个坑让你不再配置半天,面试必问 配置环境就卡半天,依赖装不上、协议解析错、登录态失效,这几乎是所有尝试逆向网易云下载的人共同的噩梦。别急,今天咱们不聊虚的,直接拆开 NeteaseCloudMusicApi…

2026/9/22 1:59:03 阅读更多 →
儿童网页设计入门到精通:别再只背语法,直接上项目

儿童网页设计入门到精通:别再只背语法,直接上项目

儿童网页设计入门到精通:别再只背语法,直接上项目 看了一堆教程还是不会写项目?这大概是很多想入行前端或者做少儿编程教育的转岗伙伴最大的困惑。…

2026/9/22 1:58:03 阅读更多 →

日新闻

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天 配置环境就卡半天?别怪机器慢,多半是你没选对工具链。在Java、Go或Python的项目现场, 手写实现…

2026/9/22 0:00:41 阅读更多 →
剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑 面试被问原理答不上来,是不是常态?别慌。很多开发者对着 GitHub 开源仓库里的代码发呆,看似简单实则暗藏玄机。今天这份【剑帝加点】速查手册,直接带你拆解核心实现,把面试必考的原理讲透。…

2026/9/22 0:00:41 阅读更多 →
手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优 复制来的代码跑不通不知道怎么调?别慌,这种“复制粘贴地狱”在开发圈太常见了。尤其是做 图片压缩网站…

2026/9/22 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →