Crawl4AI 完整指南:10分钟把网页转成大模型可用的Markdown
Crawl4AI 完整指南10分钟把网页转成大模型可用的Markdown【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4aiCrawl4AI 是一个开源的网页爬虫与抓取器面向构建 RAG、AI Agent 和数据管道的开发者。它用真实浏览器默认无头 Chromium加载页面自动处理 JavaScript 动态内容并把结果直接输出为干净、可喂给大模型的 Markdown。通过 pip 免费安装简单任务几行 Python 即可跑通。它要解决的核心问题是把杂乱的 HTML 变成模型和数据库能直接使用的结构化数据。它解决什么问题用 requests 这类库抓 JS 渲染的页面只拿到一份空骨架 HTML自己写浏览器自动化又要手工调等待时间和元素定位。页面里混着导航栏、广告、推荐位从原始 HTML 整理成干净文本工作量常常比抓取本身更大。想从列表页批量提取标题、价格这类字段但每个站点的 HTML 结构都不一样解析规则得反复重写。它做得最好的三件事真实浏览器渲染动态内容。AsyncWebCrawler默认启动一个无头 Chromium页面里的 JS 会真实执行对加载更多按钮、无限滚动这类交互可以在CrawlerRunConfig里注入js_code点击或用scan_full_pageTrue模拟滚动lazy-load 图片和 iframe 内容也会被等完、抓全。效果是一个需要点三次下一页才显示完的列表页不需要你写一套 Selenium 脚本。自动产出干净的 Markdown。抓取完成后DefaultMarkdownGenerator把 HTML 转成带标题层级和表格的 Markdown挂上PruningContentFilter或BM25ContentFilter后result.markdown.fit_markdown会再裁掉低相关噪音页面链接也会被转成带编号的引用列表。对 RAG 场景来说这份输出不需要再经过一轮清洗。双轨结构化提取。需要 JSON 时有两条路JsonCssExtractionStrategy用 CSS/XPath 选择器加 schema 直接取字段不花一分钱 token而且支持用 LLM 一次性生成可复用的 schemaLLMExtractionStrategy则接入底层 litellm 支持的任意模型openai/gpt-4o或本地ollama/llama3.3按 Pydantic schema 校验输出。结构规整的页面走前者结构杂乱的页面走后者可以混用。十分钟上手pip install -U crawl4ai crawl4ai-setup # 自动安装 Playwright 浏览器 crawl4ai-doctor # 检查环境是否就绪装完后跑最短示例import asyncio from crawl4ai import AsyncWebCrawler async def main(): async with AsyncWebCrawler() as crawler: result await crawler.arun(urlhttps://example.com) print(result.markdown) asyncio.run(main())逐行说明async with AsyncWebCrawler()启动默认无头浏览器并在结束时自动关闭arun()抓取页面并等待渲染完成result.markdown就是转换后的 Markdown。不想写 Python 时终端里crwl https://example.com -o markdown一条命令等价于上面的脚本。注意缓存默认是CacheMode.BYPASS每次取新鲜内容要提速可显式改成CacheMode.ENABLED。跑一个真实任务任务从产品列表页批量提取标题 价格落成 JSON。输入是一个页面 URL或抓好的 HTML。配置只需一份 schemabaseSelector指定重复块的定位fields里每个字段一个选择器。schema { name: Products, baseSelector: div.item, fields: [ {name: title, selector: h2, type: text}, {name: price, selector: .price, type: text} ] } async with AsyncWebCrawler() as crawler: config CrawlerRunConfig(extraction_strategyJsonCssExtractionStrategy(schema)) result await crawler.arun(urlproduct_url, configconfig) print(json.loads(result.extracted_content))输出是extracted_content里的 JSON 字符串每个商品一个对象可直接入库。schema 可以先用JsonCssExtractionStrategy.generate_schema()让 LLM 根据样本 HTML 生成一次之后批量跑就不依赖模型了。如果列表藏在站点深处再挂一个BFSDeepCrawlStrategy(max_depth2, max_pages50, include_externalFalse)控制范围和数量v0.8.0 起还支持prefetchTrue只做 URL 发现官方标注比完整处理快 5–10 倍和resume_state断点续爬。值不值得用方案适合短板requests 解析库纯静态页面开销最低不执行 JS动态页面拿到空骨架手写 Selenium/Playwright交互流程高度定制的场景等待、定位、HTML 清洗全部手写付费抓取 API不想维护任何基础设施订阅费用数据经第三方Crawl4AI动态页面 LLM 友好输出浏览器启动有开销静态页批量抓取时偏重比较适合搭建 RAG 知识库、监控结构经常变动的页面、从半结构化网页提取字段。不太适合目标只有几个纯静态页面且追求极致吞吐启动浏览器不划算以及目标站点有严格反爬的情况——它提供proxy_config、stealth 模式和反爬检测加代理轮换v0.8.5但代理池需要你自己准备不是开箱即用的服务。资料与入口快速上手教程docs/md_v2/core/quickstart.md深度爬取BFS/DFS/BestFirstdocs/md_v2/core/deep-crawling.md非 LLM 提取策略docs/md_v2/extraction/no-llm-strategies.md官方示例目录docs/examples/含 hello_world.py、extraction_strategies_examples.py 等命令行用法docs/md_v2/core/cli.md需要源码时git clone https://gitcode.com/GitHub_Trending/craw/crawl4aiCrawl4AI 的价值在于把抓到页面到数据可用之间的距离压缩到一次配置。下一步建议先在终端用crwl抓一个你常用的动态页面检查输出的 Markdown 质量再决定要不要把它接进自己的数据管道。【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4ai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

城市级具身智能实践:ROS2导航与数据闭环解析

城市级具身智能实践:ROS2导航与数据闭环解析

走在城市街头,遇到的不再只是行人和车辆,还有一台台正在执行配送、巡检、清扫等任务的机器人。机器人从实验室走向真实城市环境,背后依靠的是一个被称为“具身智能”的技术方向。本文以城市级具身智能实验为切入点,拆解这类系统背…

2026/8/30 11:11:32 阅读更多 →
Hoppscotch 多语言指南:3 条路径配好界面语言,附语言包扩展方法

Hoppscotch 多语言指南:3 条路径配好界面语言,附语言包扩展方法

Hoppscotch 多语言指南:3 条路径配好界面语言,附语言包扩展方法 【免费下载链接】hoppscotch Open-Source API Development Ecosystem • https://hoppscotch.io • Offline, On-Prem & Cloud • Web, Desktop & CLI • Open-Source Alternative…

2026/8/30 11:11:17 阅读更多 →
Mermaid.js 接入 Confluence:3 步搭起一套用文本维护的图表知识库

Mermaid.js 接入 Confluence:3 步搭起一套用文本维护的图表知识库

Mermaid.js 接入 Confluence:3 步搭起一套用文本维护的图表知识库 【免费下载链接】mermaid Generation of diagrams like flowcharts or sequence diagrams from text in a similar manner as markdown 项目地址: https://gitcode.com/GitHub_Trending/me/mermai…

2026/8/29 9:13:00 阅读更多 →

最新新闻

RTK过滤器开发最佳实践:四大策略压缩命令输出,节省60-90% Token

RTK过滤器开发最佳实践:四大策略压缩命令输出,节省60-90% Token

RTK过滤器开发最佳实践:四大策略压缩命令输出,节省60-90% Token 【免费下载链接】rtk CLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies 项目地址: https://gitcode.com/GitHu…

2026/8/30 11:11:34 阅读更多 →
开放权重AI本地部署全指南:从模型选型到生产级API服务

开放权重AI本地部署全指南:从模型选型到生产级API服务

这几年 AI 圈有个说法很扎心:未来属于那些能买断顶级算力的巨头,而普通开发者和中小团队,大概率只能拿到开放权重模型(Open Weight AI),注意,还不一定保证有得用。这话带着调侃,但确…

2026/8/30 11:11:34 阅读更多 →
零基础嵌入式学习路线:从C语言到Linux的完整进阶路径

零基础嵌入式学习路线:从C语言到Linux的完整进阶路径

最近看到一套针对零基础转行嵌入式的学习内容,覆盖了C语言、单片机、FreeRTOS、Linux四个部分,介绍里说制作周期超过了5个月。这类宣传语我本来已经免疫了,但这次让我多看了几秒的原因,是这四个关键词刚好串成了很多新手一直没看清…

2026/8/30 11:11:34 阅读更多 →
全栈应用上线配置的收口方法

全栈应用上线配置的收口方法

全栈应用上线配置的收口方法全栈项目从原型走向上线时,最容易遗漏的不是某个功能,而是配置散在太多地方:前端构建变量、服务端环境变量、镜像参数、反向代理和 CDN 各自保存一份默认值。发布成功只说明进程启动了,不能说明它连接了…

2026/8/30 11:11:34 阅读更多 →
MetaboLLM:用大语言模型构建代谢组学知识图谱的实践指南

MetaboLLM:用大语言模型构建代谢组学知识图谱的实践指南

做代谢组学的人,大概都经历过这样一种崩溃:你在 PubMed 摘要里盯着一篇关键文献,里面出现了同一个代谢物的三种写法,HMDB 里是标准名,KEGG 里是另一种别称,METLIN 里又给你来一套不同的标注;再往…

2026/8/30 11:11:34 阅读更多 →
如何快速安装并使用 PowerShell 7:跨平台自动化完整入门指南

如何快速安装并使用 PowerShell 7:跨平台自动化完整入门指南

如何快速安装并使用 PowerShell 7:跨平台自动化完整入门指南 【免费下载链接】PowerShell PowerShell for every system! 项目地址: https://gitcode.com/GitHub_Trending/po/PowerShell PowerShell 是微软开源的跨平台命令行自动化工具,一条 pws…

2026/8/30 11:10:34 阅读更多 →

日新闻

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

2026/8/30 0:00:01 阅读更多 →
数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

2026/8/30 0:00:01 阅读更多 →
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

2026/8/30 0:00:01 阅读更多 →

周新闻

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

2026/8/30 0:00:01 阅读更多 →
数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

2026/8/30 0:00:01 阅读更多 →
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

2026/8/30 0:00:01 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/29 4:34:53 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/28 17:43:04 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/29 2:05:18 阅读更多 →