3个坑搞定安居客二手数据抓取,一文搞懂
3个坑搞定安居客二手数据抓取,一文搞懂 配置环境就卡半天?别急,这行代码救你。 很多兄弟一提到【安居客二手】房源数据抓取,第一反应就是头疼。不是被反爬拦截,就是解析出来的字段乱七八糟。我在掘金技术社区看到不少帖子吐槽,说用 Scrapy 跑半天,IP 封了,Cookie 失效了,最后连个完整的户型图都拿不全。 其实,问题往往不出在“抓”这个动作上,而出在你对“安居客二手”页面结构的理解上。这篇干货,带你从源码层面拆解它的核心逻辑,不整虚的,直接上代码,帮你把环境跑通,把数据拿稳。 入口定位:找到真正的数据源 很多人一上来就 requests.get(url),然后直接解析 HTML。这是最原始的做法,也是最容易挂的做法。 安居客的页面是前后端分离的架构,尤其是【安居客二手】板块。你打开浏览器 F12 看 Network 标签页,会发现页面初始加载的 HTML 里,很多动态数据其实是空壳,或者是通过 JS 渲染出来的。 真正的数据源,往往藏在 __NEXT_DATA__ 或者特定的 API 接口里。 关键点:不要依赖初始 HTML:初始 HTML 可能只包含第一页的静态内容,或者关键数据被 JS 加密。 寻找 JSON 接口:安居客很多页面背后都有一个 /api/ 开头的接口,返回的是结构化的 JSON 数据,比解析 HTML 稳定得多。 观察 JS 逻辑:如果找不到直接的 API,就得看 JS 文件里是怎么组装请求参数的。举个例子,你去抓【安居客二手】的列表页,URL 可能是 https://sh.anjuke.com/ershoufang/。如果你直接解析这个页面的 HTML,你可能会发现很多房源信息是缺失的,或者分页链接是动态生成的。 这时候,你需要打开浏览器开发者工具,切换到 Network,筛选 XHR 或 Fetch 请求。你会发现,当页面滚动或点击“下一页”时,会发起一个类似 /ershoufang/list/ 的异步请求,返回的 JSON 里包含了所有你需要的房源 ID、价格、面积等字段。 核心片段:解析 __NEXT_DATA__ 安居客很多页面采用了 Next.js 框架,这意味着数据会嵌入在 HTML 中的一个 script id=__NEXT_DATA__ type=application/json 标签里。这是最快、最稳定的数据来源。 下面是一段基于 Python 和 BeautifulSoup 的核心解析代码,专门针对【安居客二手】页面的这种结构: import requests import json from bs4 import BeautifulSoup import redef fetch_anjuke_data(url):获取安居客二手房源数据:param url: 目标URL:return: 解析后的数据列表headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36','Referer': url}# 1. 发送请求,注意设置超时和重试try:response = requests.get(url, headers=headers, timeout=10)response.raise_for_status()except requests.RequestException as e:print(f请求失败: {e})return []# 2. 解析 HTML,找到 __NEXT_DATA__ 标签soup = BeautifulSoup(response.text, 'html.parser')script_tag = soup.find('script', id='__NEXT_DATA__')if not script_tag:print(未找到 __NEXT_DATA__,页面结构可能已变化)return []# 3. 提取 JSON 字符串并解析try:data_json = json.loads(script_tag.string)except json.JSONDecodeError:print(JSON 解析错误)return []# 4. 深入字典结构,定位到房源列表# 注意:安居客的数据结构可能会变,这里以常见结构为例props = data_json.get('props', {}).get('pageProps', {})list_data = props.get('list', {}).get('list', [])return list_data# 使用示例 # url = https://sh.anjuke.com/ershoufang/ # data = fetch_anjuke_data(url) # print(len(data))逐行注释解析:headers 设置:必须模拟浏览器请求,否则很容易被拦截。Referer 很重要,它告诉服务器你是从哪个页面跳转过来的。 response.raise_for_status():如果状态码不是 200,直接抛出异常,避免后续解析报错。 soup.find('script', id='__NEXT_DATA__'):这是核心。安居客把关键数据塞在这个 script 标签里,而不是普通的 div 或 span 中。 json.loads(script_tag.string):script_tag.string 获取的是标签内的文本内容,即 JSON 字符串。 data_json.get('props', {}).get('pageProps', {}):这是典型的 Next.js 数据结构。数据层层嵌套,你需要根据实际抓到的 JSON 结构来调整 key。如果这里取不到数据,用 print(data_json.keys()) 看看顶层有哪些 key,一步步往里挖。 list_data:最终的目标是拿到这个列表,里面每个元素就是一个房源对象。设计思想:为什么选择 JSON 而非 HTML? 很多初学者喜欢用正则表达式或者 XPath 去匹配 HTML 里的标签,比如 div class=price。这种做法在【安居客二手】这种高变动频率的网站上,极其脆弱。 设计思想的核心是:数据与展示分离。 安居客的前端工程师在重构页面时,可能会把 class=price 改成 class=item-price,或者把价格拆分成整数和小数两部分显示。你的 XPath 脚本瞬间就会失效,报错 no match。 但是,API 接口的数据结构通常比前端展示层更稳定。因为后端要对接其他系统,接口的字段名一旦确定,不会轻易改动。即使前端页面大改版,只要后端 API 没变,你的数据抓取逻辑依然有效。 优势对比:特性 HTML 解析 (XPath/BS4) JSON 解析 (API/Next Data)稳定性 低,易受前端改版影响 高,依赖后端接口契约数据完整性 可能缺失动态加载数据 通常包含完整数据集解析速度 慢,需要解析整个 DOM 树 快,直接处理结构化数据反爬难度 低,容易被识别为爬虫 高,需要模拟签名或 Cookie所以,在写代码之前,先花 5 分钟研究一下页面的 Network 请求和 __NEXT_DATA__,这比写 100 行正则表达式要有价值得多。 手写简化版:构建一个健壮的抓取器 前面的代码只是基础,实际使用中,你需要处理分页、异常重试和数据清洗。下面是一个简化但实用的版本,包含了分页逻辑和简单的数据清洗: import time import randomdef extract_property_info(item):从单个房源字典中提取关键信息:param item: 房源字典:return: 清洗后的房源信息字典# 安居客的数据字段名可能略有不同,需根据实际情况调整title = item.get('title', '未知')price = item.get('price', 0)area = item.get('area', 0)rooms = item.get('rooms', '未知')orientation = item.get('orientation', '未知')floor = item.get('floor', '未知')link = item.get('detailUrl', '')# 简单清洗:去除标题中的多余空格和特殊符号title = re.sub(r'\s+', ' ', title).strip()return {'title': title,'price': price,'area': area,'rooms': rooms,'orientation': orientation,'floor': floor,'link': link}def crawl_anjuke_pages(base_url, max_pages=3):抓取多页数据:param base_url: 基础URL,不包含页码:param max_pages: 最大抓取页数:return: 所有房源数据的列表all_properties = []for page in range(1, max_pages + 1):# 构造带页码的 URL,安居客的页码通常在 URL 末尾current_url = f{base_url}page{page}/ if page 1 else base_urlprint(f正在抓取第 {page} 页: {current_url})# 调用之前的 fetch 函数获取原始数据raw_data = fetch_anjuke_data(current_url)if not raw_data:print(f第 {page} 页抓取失败或无数据,停止)break# 处理数据for item in raw_data:cleaned_item = extract_property_info(item)all_properties.append(cleaned_item)# 模拟人工操作,随机等待 1-3 秒,避免被封wait_time = random.uniform(1, 3)print(f等待 {wait_time:.2f} 秒...)time.sleep(wait_time)return all_properties# 使用示例 # base_url = https://sh.anjuke.com/ershoufang/ # results = crawl_anjuke_pages(base_url, max_pages=2) # print(f共抓取到 {len(results)} 条房源)关键改进点:数据清洗函数:extract_property_info 将复杂的原始字典转换为干净的业务字段。这样后续存库或分析时,不需要每次都处理复杂的嵌套结构。 分页逻辑:通过循环生成不同页码的 URL。注意安居客的 URL 结构,有些是 ?page=2,有些是 /page2/,务必在浏览器里确认清楚。 随机延迟:time.sleep(random.uniform(1, 3)) 是模拟人类浏览习惯。固定的 sleep(2) 很容易被反爬系统识别为机器人。 异常处理:如果某一页抓取失败,直接 break 退出循环,避免无效请求。应用场景与避坑指南 这套方案适用于大多数基于 Next.js 或 Vue SSR 的前端框架网站。但对于【安居客二手】这种大型商业网站,你还会遇到几个典型的坑。 坑一:IP 封锁 安居客对高频访问非常敏感。如果你发现请求突然返回 403 或 429 状态码,说明 IP 被暂时封锁了。 解决方案:使用代理 IP 池,每次请求换一个 IP。 降低请求频率,增加随机延迟。 不要并发请求,串行执行最安全。坑二:Cookie 失效 有些数据需要登录才能看到,或者需要特定的 Cookie 才能访问完整接口。 解决方案:手动登录浏览器,复制完整的 Cookie 字符串,放到 headers 里。 使用 requests.Session() 对象,自动管理 Cookie。 注意 Cookie 的有效期,定期更新。坑三:数据字段变化 安居客可能会调整 JSON 里的字段名,比如把 price 改成 totalPrice。 解决方案:在代码中加入字段存在性检查,如果关键字段缺失,记录日志并跳过该条数据,而不是直接报错崩溃。 定期运行脚本,监控数据完整性。如果发现某个字段大量为空,说明接口可能变了,需要重新分析。合规提醒: 抓取数据用于个人学习、研究或非商业用途是允许的。但如果用于商业盈利、大规模数据倒卖,或者对服务器造成严重负担,可能会触犯法律或违反网站服务条款。请遵守《网络安全法》和网站的用户协议,控制抓取频率,尊重开发者劳动成果。 你公司项目里是怎么处理这类动态页面的?是直接用 Selenium 模拟点击,还是像我这样深挖 JSON 接口?欢迎在评论区分享你的经验和踩过的坑,咱们一起交流。

相关新闻

把 OpenClaw 的模型通道指向 TaoToken,付费技能才敢下单

把 OpenClaw 的模型通道指向 TaoToken,付费技能才敢下单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/23 12:46:30 阅读更多 →
3个坑坑住转岗人,手写实现阮玲玉故居查询接口优化

3个坑坑住转岗人,手写实现阮玲玉故居查询接口优化

3个坑坑住转岗人,手写实现阮玲玉故居查询接口优化 是不是也这样:看了一堆阮玲玉故居相关的开发教程,视频里的代码敲得飞快,一回到自己电脑,面对真实的业务场景就傻眼?特别是那种涉及跨省数据同步、历史档案检索的复杂项目,教程里全是理想化的…

2026/9/23 12:46:39 阅读更多 →
3个血泪教训:搞定我的时间,源码解析让你面试不慌

3个血泪教训:搞定我的时间,源码解析让你面试不慌

3个血泪教训:搞定我的时间,源码解析让你面试不慌 上周陪一个做后端的兄弟模拟面试,面试官轻描淡写地问了一句:“你项目里用的 LocalDateTime 和 Date 到底有啥区别?为什么 Java 8 要重构时间…

2026/9/23 12:46:44 阅读更多 →

最新新闻

默纳克11KW底座原理图详解:从主回路到IGBT驱动与故障检修

默纳克11KW底座原理图详解:从主回路到IGBT驱动与故障检修

简介:汇川默纳克十一千瓦底座原理图是一份专供电路板维修使用的PDF电路图,面向变频器、电梯驱动及伺服控制设备的维修与技术支持人员,用于理解十一千瓦电机驱动系统中各电气组件和连接方式。图中详细标注了电容、电阻、二极管、晶体管、电感、…

2026/9/23 15:01:29 阅读更多 →
Python+MediaPipe+OpenCV手势识别课设:从关键点检测到音乐播放与鼠标控制

Python+MediaPipe+OpenCV手势识别课设:从关键点检测到音乐播放与鼠标控制

简介:这是一套面向高校计算机及相关专业学生的手势识别系统开发成果,适用于课程设计、期末大作业与毕业项目等实践环节,也可作为个人提升计算机视觉技能的实战训练材料。项目以Python为开发语言,结合MediaPipe与OpenCV构建&#x…

2026/9/23 15:01:29 阅读更多 →
三菱plc编程一文搞懂:从配置卡顿到稳定运行

三菱plc编程一文搞懂:从配置卡顿到稳定运行

三菱plc编程一文搞懂:从配置卡顿到稳定运行 刚打开GX Works2,是不是感觉CPU占用率瞬间飙满?导入一个旧项目,进度条卡在99%半天不动,鼠标指针都转圈了?这种 配置环境就卡半天…

2026/9/23 15:01:29 阅读更多 →
雷长喜入门到精通:3个致命坑让你从0到1少走5年弯路

雷长喜入门到精通:3个致命坑让你从0到1少走5年弯路

雷长喜入门到精通:3个致命坑让你从0到1少走5年弯路 刚毕业那会儿,我盯着屏幕上的 Hello World 发呆,语法书翻烂了,变量类型背得滚瓜烂熟,可一旦要动手搭个完整项目,脑子立马一片空白。这种“学会语法却不知怎么搭项目”的断崖式落差,…

2026/9/23 15:01:28 阅读更多 →
Nginx UI 重置初始管理员密码:reset-password 命令完整指南

Nginx UI 重置初始管理员密码:reset-password 命令完整指南

后端前端运维MCP 服务 【免费下载链接】nginx-ui Yet another WebUI for Nginx 项目地址: https://gitcode.com/gh_mirrors/ngi/nginx-ui 点击查看 免费下载 reset-password 是 Nginx UI 提供的官方命令行工具,用于在忘记初始管理员密码或初始账户被禁用…

2026/9/23 15:01:28 阅读更多 →
退款率怎么算:3个致命坑点与避坑指南

退款率怎么算:3个致命坑点与避坑指南

退款率怎么算:3个致命坑点与避坑指南 上周参加某大厂后端面试,二面官指着白板问:“你们系统的退款率是怎么算的?分母到底包不包含已取消的订单?”我愣了三秒,脑子里全是 COUNT(1)…

2026/9/23 15:00:27 阅读更多 →

日新闻

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A…

2026/9/23 0:00:23 阅读更多 →
2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我 刚把开发环境的显示器从1080P换到2K,跑老项目直接报错,版本升级后 API…

2026/9/23 0:01:25 阅读更多 →
3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点 官方文档翻了三遍还是云里雾里?别急,美眉图在实战项目中常被用来做数据可视化,但它的原理比你想的简单。今天咱们直接上手,用一个完整的小项目把美眉图跑通,不再死磕那些冗长的理论说明。…

2026/9/23 0:01:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →