Python 使用 XPath 查找元素基本用法实战指南
前言在爬虫、网页数据提取场景中解析HTML常用两种方案CSS选择器、XPath。XPath 功能更强大支持父子层级、属性模糊匹配、文本匹配、多条件筛选是 Python 爬虫主流解析方式。很多同学刚开始使用 XPath 经常遇到路径写错、找不到元素、匹配规则失效等问题。本文基于lxml最常用库讲解 XPath 在 Python 中的基础语法、常用案例、避坑要点所有代码可直接运行。说明本文使用XPath 1.0lxml 仅支持 XPath 1.0部分 XPath2.0 函数无法使用。一、环境准备安装依赖pip install lxml基础载入模板from lxml import etree html html body div idbox h2 classtitlePython XPath教程/h2 div classitem文章1/div div classitem文章2/div div idc_001ID以c开头的区块/div div idd_001普通区块/div a hrefhttps://www.baidu.com百度/a /div /body /html # 构建解析对象 tree etree.HTML(html)二、绝对路径 vs 相对路径1. 绝对路径不推荐从根节点一层层往下写结构一旦变动直接失效。# 查找h2文本 res tree.xpath(/html/body/div/h2/text()) print(res)2. 相对路径日常开发首选//标签名全局搜索任意位置查找该标签.//标签名在当前节点内部搜索重点# 全局查找所有h2 res tree.xpath(//h2/text()) # 先拿到box节点再在box内部查找所有div box_node tree.xpath(//div[idbox])[0] items box_node.xpath(.//div/text()) print(items)⚠️ 高频踩坑在节点对象上调用xpath如果不加.//依旧会全局搜索不会限定在当前节点三、获取文本、属性、节点对象1./text()获取标签内直接文本# 获取h2内部文本 title tree.xpath(//h2/text())[0] print(title)2.属性名获取属性值# 获取a标签href链接 href tree.xpath(//a/href)[0] print(href)3. 不使用/text()直接获取元素对象想要打印元素完整HTML源码时必须拿到节点对象不能提取文本h2_node tree.xpath(//h2)[0] # 输出完整标签HTML html_str etree.tostring(h2_node, encodingutf-8).decode(utf-8) print(html_str)四、属性筛选语法最常用4.1 属性精确匹配//div[idbox] //h2[classtitle]python示例node tree.xpath(//div[idbox])坑点class 内存在多余空格时精确匹配会失败例如classelement-header 4.2 模糊匹配三大核心函数lxml支持XPath1.0内置三个函数starts-with(属性, 开头字符)属性以指定内容开头# 查找id以c开头的div c_divs tree.xpath(//div[starts-with(id, c)])contains(属性, 关键词)属性包含关键词# class包含item的div item_divs tree.xpath(//div[contains(class, item)])ends-with()不支持属于XPath2.0lxml无法使用。4.3 多条件组合and / or# classitem 并且文本包含文章 res tree.xpath(//div[classitem and contains(text(), 文章)]/text())五、层级关系筛选/直接子节点//div[idbox]/h2只匹配box下直接子元素h2孙子层级不会匹配//后代所有节点子、孙、曾孙//div[idbox]//div匹配第N个元素[position()]# 第一个class为item的div first_item tree.xpath(//div[classitem][1]/text()) # 最后一个 last_item tree.xpath(//div[classitem][last()]/text())六、文本匹配技巧匹配标签内文本# 文本完全等于 res tree.xpath(//h2[text()Python XPath教程]/text()) # 文本包含关键词 res tree.xpath(//h2[contains(text(), XPath)]/text())注意标签存在换行、空格时text()精确匹配容易失败优先使用contains七、实战通用模板模板1在指定节点内部循环提取元素# 拿到父节点 box tree.xpath(//div[idbox])[0] # 在父节点内查找所有item item_list box.xpath(.//div[classitem]) for item in item_list: text item.xpath(./text())[0] print(text)模板2获取元素完整HTMLdef get_html(elem): return etree.tostring(elem, encodingutf-8).decode(utf-8) item_node tree.xpath(//div[classitem][0])[0] print(get_html(item_node))八、高频踩坑清单在节点对象使用xpath忘记加.box.xpath(//div)全局搜索box.xpath(.//div)才是内部搜索class带有多余空格直接使用classxxx精确匹配失败改用contains想打印HTML却写了/text()拿到字符串而不是元素对象混淆/和//需要后代却只写直接子节点/试图使用ends-with()、lower-case()函数lxml不支持XPath2.0xpath匹配结果为空列表直接[0]取值触发报错建议增加判断result tree.xpath(//h2/text()) if result: print(result[0])九、补充Selenium / DrissionPage 兼容说明如果你使用 DrissionPage、SeleniumXPath语法完全通用# DrissionPage示例 items page.xpath(.//div[starts-with(id,c)])区别selenium获取文本使用.text属性不再依赖/text()。总结.//xxx限定当前节点内部查找//xxx全局查找精确匹配用属性值模糊匹配优先starts-with、contains需要HTML源码就不要加/text()保留元素对象优先使用相对路径避免脆弱的绝对路径lxml只支持XPath1.0不要使用XPath2.0专属函数。掌握以上基础用法可以覆盖80%网页数据提取场景。复杂爬虫筛选需求都可以在这套基础语法上进行组合扩展。

相关新闻

985取消长聘制引热议,学术圈要迎来短期主义时代?

985取消长聘制引热议,学术圈要迎来短期主义时代?

最近一段时间,一家知名985大学取消“长聘制”的消息刷屏朋友圈,甚至冲上热搜,一所全国知名的重点学府此次的大改革为什么会引发如此大的争议?我们到底该怎么看?一、知名985大学取消“长聘制”惹争议据《中国新闻周刊》…

2026/10/10 17:41:43 阅读更多 →
猫抓资源嗅探扩展使用路线图:3个成长阶段,把网页视频音频图片全拿下

猫抓资源嗅探扩展使用路线图:3个成长阶段,把网页视频音频图片全拿下

猫抓资源嗅探扩展使用路线图:3个成长阶段,把网页视频音频图片全拿下 【免费下载链接】cat-catch 猫抓 浏览器资源嗅探扩展 / cat-catch Browser Resource Sniffing Extension 项目地址: https://gitcode.com/GitHub_Trending/ca/cat-catch 猫抓资…

2026/10/10 17:41:45 阅读更多 →
fSpy-Blender 终极拆解:一张照片如何在几分钟内重建出透视精准的 3D 场景

fSpy-Blender 终极拆解:一张照片如何在几分钟内重建出透视精准的 3D 场景

fSpy-Blender 终极拆解:一张照片如何在几分钟内重建出透视精准的 3D 场景 【免费下载链接】fSpy-Blender Official fSpy importer for Blender 项目地址: https://gitcode.com/gh_mirrors/fs/fSpy-Blender fSpy-Blender 是 fSpy 官方出品的 Blender 导入插件…

2026/10/10 17:41:48 阅读更多 →

最新新闻

太阳能电池板YOLO高变焦检测:24577张数据集训练实战

太阳能电池板YOLO高变焦检测:24577张数据集训练实战

简介:面向太阳能光伏板检测与YOLO模型训练的实际需求,这份压缩包针对高变焦太阳能电池板图像场景,提供了带有标签的光伏板检测标注数据集,能帮助开发者和研究人员快速获得规范标注样本,降低从图像采集、清洗到标注的重…

2026/10/11 0:31:53 阅读更多 →
GANMaster人脸矫正实战:从模糊脸到公安标准证件照

GANMaster人脸矫正实战:从模糊脸到公安标准证件照

简介:本资源是一份面向深度学习初学者与计算机视觉实践者的GAN人脸生成与矫正实战教程,聚焦生成对抗网络原理落地与Python代码实现。资源包含4个核心文件(2个Python脚本、1份Markdown说明文档、1份LICENSE),总大小仅9K…

2026/10/11 0:31:53 阅读更多 →
FCOM参考PDF解析:从性能表到插值函数的工程化指南

FCOM参考PDF解析:从性能表到插值函数的工程化指南

简介:这是一份面向飞行机组、飞行学员及航空爱好者的FCOM(飞行操作手册)参考指南,聚焦B737机型日常运行中的关键操作程序与处置规范。内容涉及驾驶舱区域分工、起降标准动作、着陆后刹车冷却表查算、放行与天气及杰普逊资料认读、…

2026/10/11 0:31:52 阅读更多 →
Spring Boot实战:智慧养老院管理系统的架构设计与权限控制

Spring Boot实战:智慧养老院管理系统的架构设计与权限控制

从需求到落地:我如何用Spring Boot搭起一套智慧养老院管理系统去年年初接手了一个养老院管理系统的开发任务,机构那边的情况比较典型:三百多张床位,护理人员几十号人,老人的健康档案还停留在纸质登记,家属想…

2026/10/11 0:31:52 阅读更多 →
端侧AI导览实战:鸿蒙+蓝耘MaaS的离线多模态落地

端侧AI导览实战:鸿蒙+蓝耘MaaS的离线多模态落地

1. 项目概述:这不是一个App,而是一次端侧AI能力的现场压力测试“鸿蒙AI:国庆我在故宫用了把‘AI 导游’”——这个标题里藏着三个被大众忽略但极其关键的信号:时间(国庆)、空间(故宫&#xff09…

2026/10/11 0:31:52 阅读更多 →
PLC动态加密功能块实战:S7-1200/1500程序防复制与授权管理

PLC动态加密功能块实战:S7-1200/1500程序防复制与授权管理

干自动化这些年,最扎心的场景不是现场调试到凌晨,而是设备刚交出去半年,就发现客户厂里多了一台和你做的设备一模一样的机器,运行逻辑连定时器参数都没改。S7-1200/1500 在国内项目里太常见,上载、反编译、复制项目的门…

2026/10/11 0:30:51 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 5:23:50 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/9 21:32:20 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/10 10:38:42 阅读更多 →