【Python爬虫从入门到实战】Requests库与XPath解析详解(附豆瓣Top250抓取案例)
前言在Python爬虫的世界里requests和lxml (XPath)是一对黄金搭档。前者负责高效地获取网页数据后者负责精准地提取目标信息。本文将结合豆瓣电影Top250实战案例带你彻底掌握这两个核心工具。第一部分基础知识体系1. Requests 库HTTP 请求的利器requests是一个基于urllib3封装的 HTTP 客户端库被称为“给人类使用的 HTTP 库”。核心特点API 简洁直观自动处理连接管理、Cookie 持久化。支持多种协议支持 Keep-Alive 和连接池。安全性支持 SSL 证书验证、Session 会话保持。自动解码内置 JSON 解码器自动处理压缩响应。关键概念URL互联网上某个资源的地址如https://www.baidu.com/s?wdpython。Headers (请求头)伪装浏览器的关键。User-Agent告诉服务器你是谁浏览器版本、操作系统。如果不加这个很容易被服务器识别为爬虫并拦截403 Forbidden。常用方法与属性方法/属性说明示例requests.get()发送 GET 请求response requests.get(url, headersheaders)requests.post()发送 POST 请求requests.post(url, datadata)response.text获取字符串形式的响应内容用于解析 HTMLresponse.content获取二进制响应内容用于下载图片、视频response.status_code获取状态码200 (成功), 404 (未找到), 500 (服务器错误)response.encoding设置/获取编码格式response.encoding utf-8IP 代理 (Proxies)当访问频率过高导致 IP 被封时需要使用代理 IP 来隐藏真实身份或突破访问限制。proxies { http: http://106.14.170.158:18, https: http://106.14.170.158:18 } requests.get(url, proxiesproxies)2. XPath 解析器精准的数据提取XPath (XML Path Language) 是一种在 XML/HTML 文档中查找信息的语言。相比于正则表达式它更适合处理结构化的 DOM 树。XPath解析器获取XPath解析器是浏览器的插件或者拓展在浏览器的插件或者拓展商城就能找到推荐下载XPath Helper以下以Microsoft拓展商城为例在我们想要获取其内容路径的页面打开XPath解析器按住shift键移动鼠标到想要的内容如果将鼠标移动到内容上面没有路径显示就单击一下左键这时就会出现相关内容。节点关系根节点整个文档的源头。父/子/兄弟节点描述元素之间的层级关系。文本节点包含在标签内的文字内容。路径表达式绝对路径从根节点开始写如/html/body/div[1]/div...不推荐太脆弱。相对路径使用//开头从全文档搜索匹配节点如//div[classitem]推荐。常用语法速查语法说明示例/选取直接子节点/div/a//选取所有后代节点不考虑位置//div//span.选取当前节点常用于循环内部继续查找..选取父节点选取属性//a/hreftext()选取文本内容//div/text()[]谓语条件筛选//div[idmain]进阶函数与轴下面通过一个本地 HTML 文件hello.html来演示 XPath 的进阶用法。该文件包含一个ul列表里面有多个带有不同id属性的li标签内容如下!DOCTYPE html html langen head meta charsetUTF-8 / title学习Xpath/title /head body ul li idlhfPython爬虫/li lirequests库/li li idzlgxqXpath解析器/li liget请求/li lipost请求/li li idzwq classc1Hello World/li /ul /body /htmlfrom lxml import etree 解析本地文件 html_etree etree.parse(D:\PYTHON基础\python\Python_spider\hello.html) 1. 查找 ul 下面的 li 标签 —— 多种路径写法 li_list1 html_etree.xpath(/html/body/ul/li/text()) # 绝对路径 li_list2 html_etree.xpath(//ul/li/text()) # 相对路径 li_list3 html_etree.xpath(//li/../text()) # 父节点 li_list4 html_etree.xpath(//li/./text()) # 当前节点 2. 查询所有带 id 属性的 li 标签 li_list5 html_etree.xpath(//ul/li[id]/text()) 3. 查找 id 为 zwq 的标签的 class 属性值 li_list6 html_etree.xpath(//ul/li[idzwq]/class) 4. 查找 id 为 zwq 的 li 标签的文本 li_list7 html_etree.xpath(//ul/li[idzwq]/text())运行输出演示# li_list1绝对路径和 li_list2相对路径输出相同 [Python爬虫, requests库, Xpath解析器, get请求, post请求, Hello World] li_list5所有带 id 属性的 li 标签文本 [Python爬虫, Xpath解析器, Hello World] li_list6id 为 zwq 的标签的 class 属性值 [c1] li_list7id 为 zwq 的 li 标签文本 [Hello World]contains()模糊匹配属性检查字符串是否包含子字符串。例如//div[contains(class, btn)]可以匹配 class 为btn-primary的标签。示例查找 id 中包含字母l的 li 标签。li_list8 html_etree.xpath(//ul/li[contains(id,l)]/text())输出[Python爬虫, Hello World]starts-with()匹配以某字符串开头的属性。示例查找 id 中以l开头的 li 标签。li_list9 html_etree.xpath(//ul/li[starts-with(id,l)]/text())输出[Python爬虫]string-length()根据字符串长度筛选。示例查找 id 长度等于 3 的 li 标签。li_list10 html_etree.xpath(//ul/li[string-length(id)3]/text())输出[Python爬虫, Hello World]逻辑运算符 or组合多个条件。示例查找 id 为lhf或zwq的 li 标签注意正确写法需要把or条件放在同一个谓语[]内而不是写成两个独立的li[...]。li_list11 html_etree.xpath(//ul/li[idlhf or idzwq]/text())输出[Python爬虫, Hello World]position() 与 last()根据位置筛选。示例查找前 3 个 li、最后一个 li、以及第 1 个 li。li_list12 html_etree.xpath(//ul/li[position()4]/text()) li_list13 html_etree.xpath(//ul/li[last()]/text()) li_list14 html_etree.xpath(//ul/li[1]/text())输出# li_list12前 3 个 li [Python爬虫, requests库, Xpath解析器] li_list13最后一个 li [Hello World] li_list14第 1 个 li [Python爬虫]索引注意 XPath 的索引是从1开始的而不是 0。例如//li[1]是第一个 li。第二部分实战演练——爬取豆瓣电影 Top2501. 需求分析目标抓取电影名称、导演、主演、年份、国家、类型、评分、评价人数及引言。存储保存为 CSV 文件。难点分页处理URL 规律。数据清洗文本中包含大量\xa0空格和换行符。异常处理防止程序中断。2. 完整代码实现from lxml import etree import requests import csv import time 配置区 1. 构造请求头伪装成浏览器 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 } 2. 准备CSV文件 with open(douban_250.csv, w, encodingutf-8-sig, newline) as file: writer csv.writer(file) # 写入表头 writer.writerow([电影名称, 导演, 主演, 年份, 国家, 类型, 评分, 评价人数, 引言]) # 循环抓取区 # 豆瓣Top250共10页每页25部start参数每次增加25 for start in range(0, 250, 25): url fhttps://movie.douban.com/top250?start{start} print(f正在抓取第 {start // 25 1} 页: {url}) try: # 3. 发送请求 response requests.get(urlurl, headersheaders, timeout10) # 检查响应状态非200会抛出异常 response.raise_for_status() # 设置编码防止乱码 response.encoding utf-8 except Exception as e: print(f页面请求失败{e}) continue 4. 解析 HTML html etree.HTML(response.text) 获取所有电影项的列表定位到每一个电影的容器 items html.xpath(//div[classitem]) 数据提取与清洗区 for item in items: try: # --- 提取电影名称 --- # .// 表示在当前 item 节点下查找 title_list item.xpath(.//span[classtitle][1]/text()) title title_list[0].strip() if title_list else 暂无名称 # --- 提取详细信息导演/主演/年份等 --- # 这里获取的是 p 标签下的所有文本列表通常包含两行 info_lines item.xpath(.//div[classbd]/p[1]/text()) # 初始化变量 director actors year country movie_type 暂无数据 if info_lines: # 清洗数据去除首尾空白和 \xa0 (不间断空格) # replace(\xa0, ) 是关键步骤 clean_line_1 info_lines[0].strip().replace(\xa0, ).replace(\n, ) # 解析第一行导演和主演 if 主演: in clean_line_1: parts clean_line_1.split(主演:) director parts[0].replace(导演:, ).strip() actors parts[1].strip() elif 导演: in clean_line_1: director clean_line_1.replace(导演:, ).strip() # 解析第二行年份 / 国家 / 类型 if len(info_lines) amp;amp;gt; 1: line_2 info_lines[1].strip().replace(\xa0, ).replace(\n, ) # 使用 split(/) 分割注意有些数据可能缺失 details [x.strip() for x in line_2.split(/)] if len(details) amp;amp;gt; 3: year details[0] country details[1] movie_type details[2] elif len(details) 2: year details[0] country details[1] # --- 提取评分 --- rating_list item.xpath(.//span[classrating_num]/text()) rating rating_list[0].strip() if rating_list else 暂无评分 # --- 提取评价人数 --- # 这里的 xpath 路径可能需要根据实际网页微调通常是 span[4] 或者通过 text 内容判断 rating_num_raw item.xpath(.//div[classstar]/span[4]/text()) rating_num rating_num_raw[0].replace(人评价, ).strip() if rating_num_raw else 0 # --- 提取引言 --- quote_list item.xpath(.//p[classquote]/span/text()) quote quote_list[0].strip() if quote_list else 暂无引言 # 5. 写入 CSV writer.writerow([title, director, actors, year, country, movie_type, rating, rating_num, quote]) except Exception as e: print(f解析单条数据出错: {e}) continue 礼貌爬取休眠 2 秒 time.sleep(2) print(抓取完成数据已保存至 douban_250.csv)3. 代码关键点解析避坑指南关于\xa0的处理在实战中你会发现打印出来的字符串里有很多\xa0。这是 HTML 中的“不间断空格”Non-breaking space。问题直接使用.split()有时无法完美分割或者导致字符串看起来很乱。解决使用replace(\xa0, )将其替换为普通空格然后再进行strip()和split()操作。XPath 的相对路径在for item in items:循环内部提取具体字段时XPath 必须以.开头例如.//span...。错误写法//span[classtitle]—— 这会去整个网页找所有的 title导致每次循环都拿到第一部电影的名字。正确写法.//span[classtitle]—— 只在当前的item范围内查找。异常捕获的重要性网络请求和数据处理都非常容易出错比如某个电影没有引言或者网络突然断开。使用try-except包裹请求代码防止因一次 404 导致整个程序崩溃。使用try-except包裹解析代码防止因某部电影数据结构特殊缺字段导致报错中断。总结通过本案例我们不仅复习了requests发送请求和XPath解析数据的语法更重要的是学习了如何处理脏数据。爬虫不仅仅是把网页下载下来更核心的价值在于将非结构化的网页数据转化为结构化的、干净的数据。希望这篇教程对你的学习有所帮助如有问题欢迎在评论区交流。

相关新闻

UReport2报表图片加载优化:动态URL参数重写与防裂图实践

UReport2报表图片加载优化:动态URL参数重写与防裂图实践

1. 项目概述:当报表图片加载遇到“拦路虎”最近在折腾一个老项目,里面用到了UReport2这个报表引擎。需求很简单,就是要在报表里动态插入一些图片,比如用户头像、产品示意图或者公司Logo。按理说,UReport2本身是支持图片…

2026/8/3 4:37:13 阅读更多 →
如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译

如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译

如何快速配置XUnity.AutoTranslator实现游戏文本自动翻译 【免费下载链接】XUnity.AutoTranslator 项目地址: https://gitcode.com/gh_mirrors/xu/XUnity.AutoTranslator XUnity.AutoTranslator是一款强大的Unity游戏本地化工具,能够自动翻译游戏内文本&…

2026/8/3 4:37:13 阅读更多 →
学习日记 8.1

学习日记 8.1

前言前一篇文章讲了图片读取与显示,今天继续看图像运算、阈值处理和噪声去除。主要涉及:图像运算:图像的加法运算与加权融合阈值处理:二值化、截断等阈值操作,以及图像边框的填充噪声去除:椒盐噪声的生成与…

2026/8/3 4:37:13 阅读更多 →

最新新闻

AI论文网站哪个最好?2026实测

AI论文网站哪个最好?2026实测

"开题报告改5版仍被打回""文献综述堆30篇却毫无逻辑""格式排版耗3天还不符合学校要求""AI生成内容被AIGC检测标红"——2026年高校AI学术规范全面收紧的背景下,毕业生选AI写作软件的核心诉求已从"快速出稿"转向&q…

2026/8/3 6:12:59 阅读更多 →
SSH连接失败:no matching MAC found 问题诊断与安全配置指南

SSH连接失败:no matching MAC found 问题诊断与安全配置指南

1. 问题初探:当SSH握手说“我们不匹配”如果你在尝试连接一台远程服务器时,终端突然弹出一句no matching MAC found. Their offer: hmac-sha2-512,然后连接被无情地拒绝,心里多半会咯噔一下。这不仅仅是连接失败,更像是…

2026/8/3 6:12:59 阅读更多 →
【AI时代生存指南】:掌握这7项劳动技能,3个月内重塑职场竞争力

【AI时代生存指南】:掌握这7项劳动技能,3个月内重塑职场竞争力

更多请点击: https://kaifayun.com 第一章:AI时代劳动技能重塑的认知革命 当大语言模型能自动生成可运行的API服务,当视觉模型在毫秒级完成工业缺陷识别,传统“熟练工—专家”的技能成长路径正被彻底解构。认知革命的核心不在于工…

2026/8/3 6:12:59 阅读更多 →
C语言函数编程实战:从基础到高级优化技巧

C语言函数编程实战:从基础到高级优化技巧

1. 函数基础与核心价值函数是C语言中实现代码复用的基本单元,也是构建复杂程序的核心工具。一个典型的函数定义包含四个关键部分:返回类型 函数名(参数列表) {// 函数体return 返回值; }在实际工程中,我习惯将函数控制在50行以内。超过这个规…

2026/8/3 6:12:59 阅读更多 →
企业 AI Agent 应用场景全景:十大高频落地场景与 ROI 深度分析

企业 AI Agent 应用场景全景:十大高频落地场景与 ROI 深度分析

一、AI Agent 企业落地现状与趋势 2024 年以来,AI Agent从概念验证快速走向规模化落地。据行业调研数据显示,超过 60% 的企业已经在至少一个业务场景中部署了 AI Agent,其中 23% 的企业实现了多场景规模化应用。金融、科技互联网、零售电商三…

2026/8/3 6:12:59 阅读更多 →
BeautifulSoup4实战:HTML解析与Python爬虫数据提取

BeautifulSoup4实战:HTML解析与Python爬虫数据提取

1. BeautifulSoup:HTML/XML解析利器解析作为Python生态中最受欢迎的HTML/XML解析库,BeautifulSoup凭借其"人性化"的API设计改变了网络数据提取的体验。不同于正则表达式的晦涩难懂,也不同于XPath的复杂语法,它允许开发者…

2026/8/3 6:11:59 阅读更多 →

日新闻

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南

3个让你工作效率翻倍的Umi-OCR实战技巧:免费离线文字识别完全指南 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。…

2026/8/3 0:00:47 阅读更多 →
[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

[具身智能-181]:PC+服务器+具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构

PC服务器具身机器人:构建具身智能从仿真到量产的闭环迭代混合架构一、前言:具身智能需要“混合算力闭环系统”传统人工智能依赖云端静态数据集训练,不具备物理交互能力,无法适应真实世界的不确定性。具身智能(Embodied…

2026/8/3 0:00:47 阅读更多 →
[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

[具身智能-181]:大分布式通信模型对比:看懂为什么 DDS 是 ROS2 底层通信最优解

前言构建机器人、具身智能这类分布式实时系统,通信底座直接决定整套系统的实时性、容错性、组网能力。分布式领域长期存在 4 类经典通信架构:点对点模式、Broker 中间代理模式、广播模式、以数据为中心(DDS)模式。很多开发者疑惑&…

2026/8/3 0:00:47 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/3 4:58:13 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/3 1:53:31 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/3 4:36:35 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/2 6:34:16 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/3 5:19:38 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/2 0:23:22 阅读更多 →