MediaCrawler 七平台数据采集完整教程改 4 个配置跑通 3 个真实任务【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler什么时候用 MediaCrawler先说它能干嘛MediaCrawler 是一个开源的自媒体数据采集工具覆盖小红书、抖音、快手、B站、微博、百度贴吧、知乎 7 个平台。它能按关键词、指定帖子、创作者主页三种方式抓取笔记/视频的正文与互动数据连同一级、二级评论一起落成 json、csv、excel 或数据库文件。典型使用者是两类人运营做竞品声量摸底时用它替代手动一篇篇点开复制开发者想要现成的多平台爬虫框架又不想从零啃各家的 JS 加密签名。原理速览它不逆向靠什么跑MediaCrawler 的思路是不破解平台的加密签名算法而是用 Playwright 驱动一个真实浏览器完成登录和页面请求签名参数比如小红书的 x-s由页面环境自己算出来你只管收数据。更进一步它默认开启 CDP 模式ENABLE_CDP_MODE与CDP_CONNECT_EXISTING直接接管你日常在用的 Chrome复用真实 Cookie、扩展和浏览历史——相当于拿着真身份从前门进门平台很难把这次请求和普通用户区分开。只有两个例外抖音、知乎的签名逻辑依赖 Node.js 运行时v16 及以上对应libs/douyin.js、libs/zhihu.js两个脚本其余平台纯 Python 即可。从 0 到跑通环境、4 个配置项、首跑准备环境Python ≥3.11爬抖音、知乎需另装 Node.js ≥v16CDP 模式需要带远程调试能力的 Chrome建议 144 以上。克隆并装依赖uv sync一条命令完成git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv sync开启 Chrome 远程调试地址栏输入chrome://inspect/#remote-debugging勾选 Allow remote debugging看到Server running at: 127.0.0.1:9222即成功CDP_DEBUG_PORT默认就是 9222。细节见 CDP模式使用指南。打开config/base_config.py只需改 4 个配置项PLATFORM xhs # xhs|dy|ks|bili|wb|tieba|zhihu KEYWORDS 平价精华 # 多关键词用英文逗号分隔 CRAWLER_TYPE search # search|detail|creator SAVE_DATA_OPTION json # json|jsonl|csv|excel|sqlite|postgres运行python main.py浏览器弹出后扫码登录LOGIN_TYPE默认qrcode也支持 phone、cookie。登录态会存到本平台的浏览器数据目录第二次起免扫码。结果落在data/目录按平台分子文件夹。如果你更喜欢界面操作项目内置了 Web 控制台webui/api/可视化配参数、看实时日志能力地图能干嘛、改哪个变量能力改哪个变量说明关键词搜索CRAWLER_TYPE searchKEYWORDS搜索结果页的笔记/视频列表及评论条数由CRAWLER_MAX_NOTES_COUNT控制默认 15指定帖子CRAWLER_TYPE detail 各平台*_SPECIFIED_*_LIST单条内容完整字段 评论小红书链接必须带xsec_token参数创作者主页CRAWLER_TYPE creator 各平台*_CREATOR_*_LIST该创作者发布的全部内容评论采集ENABLE_GET_COMMENTS/CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES/ENABLE_GET_SUB_COMMENTS默认抓一级评论、单篇 10 条二级评论默认关评论词云ENABLE_GET_WORDCLOUDSTOP_WORDS_FILE仅 json/jsonl 存储下生成停用词表在 docs/hit_stopwords.txt用法见 词云图使用配置媒体下载ENABLE_GET_MEDIA默认关开则下载封面/视频支持 xhs/dy/ks/bili/wb多格式存储SAVE_DATA_OPTION入库模式自动建表不会报表不存在详见 数据存储指南代理 IP 池ENABLE_IP_PROXYIP_PROXY_PROVIDER_NAME启动拉 IP、逐个验证后轮换失效自动补新内置快代理、豌豆 HTTP、极速 HTTP 及静态代理STATIC_PROXY_URL服务商密钥走环境变量见 代理文档三个真实任务走一遍任务一小红书新品上市前的竞品声量摸底输入竞品关键词如某某面霜,修护精华操作PLATFORM xhs、CRAWLER_TYPE search、KEYWORDS填关键词CRAWLER_MAX_NOTES_COUNT调到 50ENABLE_GET_WORDCLOUD开True跑python main.py产出data/下 json 含标题、点赞/收藏/评论数、发布时间、正文评论抓完后自动多出词云图一眼看出用户在意的卖点和槽点任务二B站竞品账号的更新节奏监控输入竞品账号主页 URLspace.bilibili.com链接或直接填 UID操作PLATFORM bili、CRAWLER_TYPE creator把主页链接追加进 config/bilibili_config.py 的BILI_CREATOR_ID_LIST产出该账号视频列表标题、播放量、发布时间每周跑一次入库用发布时间排序即可对比更新频率和内容方向变化任务三抖音视频的评论区深挖输入一条抖音视频链接支持v.douyin.com短链或完整 URL操作PLATFORM dy、CRAWLER_TYPE detail链接填进 config/dy_config.py 的DY_SPECIFIED_ID_LISTCRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES调到 100产出视频完整字段 100 条一级评论SAVE_DATA_OPTION改csv后文件可直接丢给同事用 Excel 打开分析翻车点与排查4 个高频问题现象一小红书扫码后反复弹滑块登录卡死确认ENABLE_CDP_MODE、CDP_CONNECT_EXISTING都是True走真实浏览器而不是临时窗口HEADLESS保持False重启后在弹出的浏览器里手动过一次滑块仍不行删掉平台对应的浏览器数据目录如xhs_user_data_dir重新登录现象二报 execjs 或 ProgramError集中在抖音、知乎终端执行node -v确认 Node.js 已装且版本 ≥v16未安装则去 Node.js 官网装对应系统版本重启终端后重新python main.py现象三前几天还正常现在抓不到数据或报错先判断是否账号触发风控最常见原因相同代码突然失效基本是它调CRAWLER_MAX_SLEEP_SEC到 3~5 秒、调小CRAWLER_MAX_NOTES_COUNT降强度仍不行就ENABLE_IP_PROXY True并设IP_PROXY_PROVIDER_NAME分散 IP密钥环境变量配置参考下图现象四playwright TimeoutError 或连不上 9222 端口确认 Chrome 处于打开状态且远程调试开关已勾选页面必须显示Server running at: 127.0.0.1:9222没有该行说明端口没起来浏览器若弹出确认对话框点接受——程序会等人工确认BROWSER_LAUNCH_TIMEOUT默认 60 秒内不确认就会超时让它更稳的清单开跑前过一遍CRAWLER_MAX_SLEEP_SEC默认 2 秒大批量任务加到 3~5 秒用请求强度换账号安全MAX_CONCURRENCY_NUM从 1 起步稳定后再上调盲目并发是触发风控的第一大原因SAVE_LOGIN_STATE保持True一次登录长期免扫码想换账号直接删对应{平台}_user_data_dirENABLE_GET_MEDIA只取元数据就保持关闭省带宽也省磁盘AUTO_CLOSE_BROWSER调试期设False留着浏览器现场方便看卡在哪一步SAVE_DATA_OPTION一次性分析用 json/csv长期反复采同一批对象用 sqlite/postgres 入库天然去重收尾改配置、跑命令、拿数据MediaCrawler 的全部流程就是改config/base_config.py里几个变量 跑python main.py两步。建议先用小红书关键词搜索 json 存储跑通第一条链路再按需求逐项打开评论、词云和代理池。现在就克隆仓库、改好那 4 个配置项去看data/目录里你的第一份数据。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考