我把采集流程重构了一遍,现在几秒就能拿到结构化数据
文章目录前言重构采集流程完整工程代码更多采集场景SERP API网页采集 API通用采集 API数据集市场Dashboard 控制台总结前言大家好我是颜颜yan_。最近在做视频数据采集项目时遇到了各种实际问题。页面大量使用动态加载数据并不在初始 HTML 中需要分析页面结构或调用内部接口。更麻烦的是页面结构经常变化之前写好的解析规则过一段时间就会失效。批量采集时网络异常问题更加明显IP 限制、频率控制、浏览器环境检测接连出现。为了应对这些又得维护代理池、请求重试、Cookie 管理等一堆基础设施。重构采集流程重新调整方案后稳定性和效率都提升了不少。现在我的整个流程变成搜索关键词→ 获取视频链接 → 提交采集任务 → 获取结构化数据 → 进入分析流程。我把最重要的采集部分交给了 Dataify只在工程里保留搜索入口 链接提取这部分逻辑。我在Dataify中把对应链接设置好设置好参数。右侧就会出现对应的代码直接把这个模板代码接入到我的工程代码里面。importrequests urlhttps://scraperapi.dataify.com/builderheaders{Authorization:你的API key,Content-Type:application/x-www-form-urlencoded,}data{spider_name:youtube.com,spider_id:youtube_video_by-url,spider_parameters:[{url:https://www.youtube.com/watch?v_SdpvpvVrLY}],spider_universal:{resolution:360p,video_codec:vp9,audio_format:opus,bitrate:320,subtitles_language:ab,selected_only:false},spider_errors:true,file_name:{{TasksID}},}responserequests.post(url,headersheaders,datadata)print(response.text)我运行后在Dataify任务列表就可以看到对应任务。完成任务后在 Dashboard 点击下载可导出 JSON、CSV、XLSX 三种格式的结果。从请求到最终结果只需要几秒钟方便多了。返回的元数据是已经清洗好的结构化字段包括标题、视频 ID、缩略图、播放量、发布时间、点赞数、频道信息、时长、描述、字幕状态、分辨率等。完整工程代码importargparseimportjsonimportosimportrefromhtmlimportunescapefromurllib.parseimporturlencodefromurllib.requestimportRequest,urlopen SEARCH_URLhttps://www.youtube.com/results?search_query%E9%AA%91%E8%A1%8C%E7%AC%AC%E4%B8%80%E8%A7%86%E8%A7%92DATAIFY_URLhttps://scraperapi.dataify.com/builderDATAIFY_TOKENos.getenv(DATAIFY_TOKEN,APIkey)DEFAULT_SCROLL_PAGES10VIDEO_ID_PATTERNre.compile(r/watch\?v([a-zA-Z0-9_-]{11}))API_KEY_PATTERNre.compile(rINNERTUBE_API_KEY\s*:\s*([^]))CLIENT_NAME_PATTERNre.compile(rINNERTUBE_CLIENT_NAME\s*:\s*([^]))CLIENT_VERSION_PATTERNre.compile(rINNERTUBE_CLIENT_VERSION\s*:\s*([^]))defmake_watch_url(video_id):returnfhttps://www.youtube.com/watch?v{video_id}defunique_links(video_links):links[]seenset()forlinkinvideo_links:iflinkinseen:continueseen.add(link)links.append(link)returnlinksdefextract_video_links(html):Return unique YouTube watch URLs in first-seen order.htmlunescape(html.replace(\\u0026,))returnunique_links(make_watch_url(video_id)forvideo_idinVIDEO_ID_PATTERN.findall(html))defextract_json_object(text,start_index):depth0in_stringFalseescapedFalseforindexinrange(start_index,len(text)):chartext[index]ifin_string:ifescaped:escapedFalseelifchar\\:escapedTrueelifchar:in_stringFalsecontinueifchar:in_stringTrueelifchar{:depth1elifchar}:depth-1ifdepth0:returntext[start_index:index1]raiseValueError(Could not find the end of the JSON object.)defextract_yt_initial_data(html):markerytInitialDatamarker_indexhtml.find(marker)ifmarker_index-1:returnNonestart_indexhtml.find({,marker_index)ifstart_index-1:returnNonereturnjson.loads(extract_json_object(html,start_index))defwalk_json(value):ifisinstance(value,dict):yieldvalueforchildinvalue.values():yieldfromwalk_json(child)elifisinstance(value,list):forchildinvalue:yieldfromwalk_json(child)defextract_video_links_from_data(data):video_ids[]foriteminwalk_json(data):videoitem.get(videoRenderer)ifnotisinstance(video,dict):continuevideo_idvideo.get(videoId)ifvideo_id:video_ids.append(video_id)returnunique_links(make_watch_url(video_id)forvideo_idinvideo_ids)defextract_continuation_token(data):foriteminwalk_json(data):commanditem.get(continuationCommand)ifisinstance(command,dict)andcommand.get(token):returncommand[token]continuationitem.get(nextContinuationData)ifisinstance(continuation,dict)andcontinuation.get(continuation):returncontinuation[continuation]returnNonedefextract_innertube_config(html):api_keyAPI_KEY_PATTERN.search(html)client_nameCLIENT_NAME_PATTERN.search(html)client_versionCLIENT_VERSION_PATTERN.search(html)return{api_key:api_key.group(1)ifapi_keyelseNone,client_context:{client:{clientName:client_name.group(1)ifclient_nameelseWEB,clientVersion:client_version.group(1)ifclient_versionelse2.20240701.00.00,}},}deffetch_search_html(search_url):headers{Accept-Language:zh-CN,zh;q0.9,en;q0.8,User-Agent:(Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0.0.0 Safari/537.36),}requestRequest(search_url,headersheaders)withurlopen(request,timeout30)asresponse:charsetresponse.headers.get_content_charset()orutf-8returnresponse.read().decode(charset,errorsreplace)deffetch_continuation_data(token,client_context,api_key):ifnotapi_key:raiseValueError(Could not find YouTube INNERTUBE_API_KEY in the search page.)bodyjson.dumps({context:client_context,continuation:token,}).encode(utf-8)requestRequest(fhttps://www.youtube.com/youtubei/v1/search?key{api_key},databody,headers{Content-Type:application/json,User-Agent:(Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0.0.0 Safari/537.36),},methodPOST,)withurlopen(request,timeout30)asresponse:charsetresponse.headers.get_content_charset()orutf-8returnjson.loads(response.read().decode(charset,errorsreplace))defget_search_video_links(search_url,limitNone,scroll_pages10,fetch_htmlfetch_search_html,fetch_continuationfetch_continuation_data,):htmlfetch_html(search_url)initial_dataextract_yt_initial_data(html)configextract_innertube_config(html)ifinitial_data:linksextract_video_links_from_data(initial_data)continuationextract_continuation_token(initial_data)else:linksextract_video_links(html)continuationNonefor_inrange(1,max(scroll_pages,1)):ifnotcontinuation:breakpage_datafetch_continuation(continuation,config[client_context],config[api_key])linksunique_links(linksextract_video_links_from_data(page_data))continuationextract_continuation_token(page_data)iflimitandlen(links)limit:breakiflimit:returnlinks[:limit]returnlinksdefbuild_spider_parameters(video_links):returnjson.dumps([{url:url}forurlinvideo_links],ensure_asciiFalse)defsubmit_to_dataify(video_links):ifnotvideo_links:raiseValueError(No YouTube video links found.)headers{Authorization:fBearer{DATAIFY_TOKEN},Content-Type:application/x-www-form-urlencoded,}data{spider_name:youtube.com,spider_id:youtube_video-post_by-url,spider_parameters:build_spider_parameters(video_links),spider_errors:true,file_name:{{TasksID}},}encoded_dataurlencode(data).encode(utf-8)requestRequest(DATAIFY_URL,dataencoded_data,headersheaders,methodPOST)withurlopen(request,timeout60)asresponse:charsetresponse.headers.get_content_charset()orutf-8returnresponse.read().decode(charset,errorsreplace)defprompt_scroll_pages(defaultDEFAULT_SCROLL_PAGES):whileTrue:valueinput(f请输入滚动页数直接回车默认{default}页: ).strip()ifnotvalue:returndefaulttry:pagesint(value)exceptValueError:print(请输入大于 0 的整数。)continueifpages0:returnpagesprint(请输入大于 0 的整数。)defparse_args():parserargparse.ArgumentParser(descriptionExtract YouTube search-result video links and submit them to Dataify.)parser.add_argument(--search-url,defaultSEARCH_URL,helpYouTube search result URL.)parser.add_argument(--limit,typeint,helpOnly submit the first N video links.)parser.add_argument(--scroll-pages,typeint,helpHow many search-result pages to read, including the initial page.,)parser.add_argument(--dry-run,actionstore_true,helpPrint links without submitting.)returnparser.parse_args()defmain():argsparse_args()scroll_pagesargs.scroll_pagesorprompt_scroll_pages()video_linksget_search_video_links(args.search_url,args.limit,scroll_pages)print(fFound{len(video_links)}video links:)forlinkinvideo_links:print(link)ifargs.dry_run:returnprint(submit_to_dataify(video_links))if__name____main__:main()更多采集场景SERP API除了视频数据Dataify 还覆盖了其他几类常见场景SERP API用于实时获取搜索引擎结果Google、Bing、DuckDuckGo 等包括自然搜索结果、广告位、People Also Ask 等 SERP Feature适合 SEO 监控、关键词排名和竞品分析。网页采集 API网页采集 API适合商品详情页、新闻文章、企业黄页等内容提交 URL 后可以处理 JS 渲染、反爬和数据返回输出格式支持 HTML、Markdown 或结构化 JSON。通用采集 API通用采集 API是长尾站点的兜底方案适合没有专门模板的站点。对于无法套用预置模板的网站可以通过通用接口发起请求由平台处理访问路由、浏览器指纹、JS 渲染和验证码等复杂流程。数据集市场Dataify 还提供数据集市场公开了 1000 数据集覆盖电商、社交媒体、音视频、AI 训练、金融、医疗、法律等多个方向。如果不想自己采集可以直接使用现成的数据集进行分析或训练。数据集类型使用场景电商数据集商品监控、评论分析、选品研究社交媒体数据集达人分析、内容趋势、舆情监测视频数据集视频推荐、内容理解、账号分析行业数据集AI 训练、行业研究、知识库构建Dashboard 控制台Dashboard 控制台集成了 API 管理创建、轮换 API Key查看调用配额、任务管理提交、查询和管理采集任务、数据集市场、代理资源监控和账单日志。整体来看它像是采集任务的驾驶舱能查看任务状态、响应时间、成功率、积分消耗和历史日志方便后续排查问题和评估采集稳定性。总结在视频数据采集项目中真正耗时是维护那些基础设施动态加载处理、页面结构适配、反爬应对、代理管理这些底层工作占据了大量精力。把这部分交给 Dataify 之后整个流程变得很直接搜索关键词、提取链接、提交任务、拿到结构化数据然后进入业务分析开发重心终于回到核心逻辑上。如果你也在做类似的数据采集项目不妨试试 Dataify。立即体验https://dataify.com?utm_sourceyyyanutm_term01我是颜颜yan_觉得好的话点个赞吧

相关新闻

从论文到代码:ProGen2论文核心观点与开源实现的完美结合

从论文到代码:ProGen2论文核心观点与开源实现的完美结合

从论文到代码:ProGen2论文核心观点与开源实现的完美结合 【免费下载链接】progen Official release of the ProGen models 项目地址: https://gitcode.com/gh_mirrors/pr/progen ProGen2是蛋白质工程领域的突破性语言模型,由官方发布的开源项目提…

2026/8/6 2:12:54 阅读更多 →
Grafana_Zabbix_ImageRenderer_部署与前端操作手册

Grafana_Zabbix_ImageRenderer_部署与前端操作手册

Grafana Zabbix Plugin Image Renderer 离线部署与前端操作手册适用环境:Kylin V10 SP3 部署方式:离线 RPM 离线插件安装 文档版本:v1.0一、环境信息项目版本/说明操作系统Kylin V10 SP3Grafana10.4.19(Enterprise)…

2026/8/4 23:30:32 阅读更多 →
三. 和利时 MODBUSTCP 主站/从站协议

三. 和利时 MODBUSTCP 主站/从站协议

一. 什么是 MODBUSTCP MODBUS TCP 使用服务器与客户机的通信方式,由客户机对服务器的数据进行操作访问(读/写),服务器响应客户机的读写操作 ‌ Modbus TCP确实使用网线进行通信‌。Modbus TCP是基于TCP/IP协议的应用层协议…

2026/8/4 23:30:32 阅读更多 →

最新新闻

C语言进阶学习笔记:内存函数、结构体、共用体与文件操作

C语言进阶学习笔记:内存函数、结构体、共用体与文件操作

前言近期完成C语言后半段进阶内容学习,从内存拷贝函数,到结构体对齐、枚举共用体,再到基础文件操作,把容易踩坑的知识点整理复盘,配套练习代码上传仓库。代码仓库:https://gitcode.com/gcw_RyL6LF93/study-…

2026/8/6 2:12:54 阅读更多 →
RimSort:让上百个环世界MOD有序运行的智能管理解决方案

RimSort:让上百个环世界MOD有序运行的智能管理解决方案

RimSort:让上百个环世界MOD有序运行的智能管理解决方案 【免费下载链接】RimSort RimSort is an open source mod manager for the video game RimWorld. There is support for Linux, Mac, and Windows, built from the ground up to be a reliable, community-man…

2026/8/6 2:12:54 阅读更多 →
2026年「AI搜索优化服务商推荐」动向:确定性出稿与数据白盒成关键

2026年「AI搜索优化服务商推荐」动向:确定性出稿与数据白盒成关键

2026年,AI搜索优化服务商推荐领域出现新动态:昊GEO优化系统(ForesightNext)推出基于14维知识库的确定性出稿与白盒数据交付方案,面向企业客户落地GEO标准化服务。其自研AIV Monitor监测系统已直连豆包、Kimi、DeepSeek等六大主流AI平台&#…

2026/8/6 2:12:54 阅读更多 →
3步解锁苹果字体:PingFangSC让Windows也能拥有Mac级中文体验

3步解锁苹果字体:PingFangSC让Windows也能拥有Mac级中文体验

3步解锁苹果字体:PingFangSC让Windows也能拥有Mac级中文体验 【免费下载链接】PingFangSC PingFangSC字体包文件、苹果平方字体文件,包含ttf和woff2格式 项目地址: https://gitcode.com/gh_mirrors/pi/PingFangSC 你是否曾经羡慕过Mac电脑上那优雅…

2026/8/6 2:12:54 阅读更多 →
Langfuse实战:LLM应用可观测性平台部署与Agent评估全解析

Langfuse实战:LLM应用可观测性平台部署与Agent评估全解析

这次我们来看一个面向大模型面试和Agent项目落地的实战工具——Langfuse。对于正在准备大模型相关岗位面试,或者需要在企业中落地Agent、RAG(检索增强生成)等应用的开发者来说,如何追踪、评估和观测这些AI系统的表现,是…

2026/8/6 2:12:54 阅读更多 →
Obsidian AI助手WorkBuddy:零配置集成GPT,提升笔记管理效率

Obsidian AI助手WorkBuddy:零配置集成GPT,提升笔记管理效率

如果你正在使用 Obsidian 管理海量笔记,却苦于手动整理、关联和总结的低效,那么是时候让 AI 来接管一部分工作了。今天要介绍的不是一个需要复杂配置的本地大模型,而是一个能直接嵌入 Obsidian 的 AI 助手——WorkBuddy。它的核心目标很简单&…

2026/8/6 2:11:54 阅读更多 →

日新闻

深入解析LimboAI C++内核:架构设计与性能优化实战

深入解析LimboAI C++内核:架构设计与性能优化实战

1. 项目概述:为什么我们需要深入LimboAI的C内核?如果你是一名使用Godot引擎的游戏开发者,尤其是对AI行为逻辑有较高要求的项目,那么LimboAI这个名字你大概率不会陌生。它作为Godot 4生态中一个备受瞩目的行为树与状态机插件&#…

2026/8/6 0:00:06 阅读更多 →
Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

Unity 2D游戏敌人AI系统:基于PlayMaker状态机与2D Toolkit的实战开发

1. 项目概述与核心思路大家好,我是老张,一个在游戏开发一线摸爬滚打了十多年的老码农。今天咱们接着聊《空洞骑士》风格2D动作游戏的Demo制作。上一期我们搭好了基础框架,处理了角色移动和碰撞,这一期,我们要让游戏世界…

2026/8/6 0:00:06 阅读更多 →
被动防火门市场前景发展趋势

被动防火门市场前景发展趋势

被动防火门依靠材质结构、密闭构造阻隔烟火蔓延,无需电控启动,是建筑被动消防系统核心构件,行业依托新规管控、城市更新、工业安全升级迎来稳定扩容,整体朝着合规化、专项化、低碳化、智能化方向发展。现阶段 GB12955‑2024 新版国…

2026/8/6 0:00:06 阅读更多 →

周新闻

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

最大流算法详解:从水管网络到Ford-Fulkerson与Dinic实战

1. 从水管网络到最大流:一个核心问题的诞生想象一下,你是一个城市供水系统的总工程师。你的城市有多个水源(水库),需要通过一个复杂的地下管道网络,将水输送到各个居民区。每条管道都有其最大通水能力&…

2026/8/5 15:00:43 阅读更多 →
基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

基于Springboot的企业门户网站(源码+LW+调试文档+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/5 13:13:56 阅读更多 →
MATLAB xcorr函数详解:从互相关原理到四大实战应用

MATLAB xcorr函数详解:从互相关原理到四大实战应用

1. 从一次信号“找茬”说起:为什么我们需要互相关几年前,我在处理一组声学传感器数据时遇到了一个棘手的问题。我有两个麦克风记录了一段相同的音频信号,理论上它们接收到的声音波形应该非常相似,只是由于麦克风位置不同&#xff…

2026/8/5 10:20:36 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/5 23:28:39 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/5 21:00:14 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/5 23:46:51 阅读更多 →