LlamaIndex 系列【41】数据连接器:LlamaParse、LiteParse
文章目录1. 数据连接器1.1 概述1.2 集成包1.3 使用方式1.4 部分模块1.5 模块指南2. LlamaParse2.1 一分钟获取解析结果2.2 可用文档 API2.2.1 Parse2.2.2 Extract2.2.3 Index2.2.4 Classify2.2.5 Split2.3 代码示例3. LiteParse3.1 能力清单3.2 快速开始1. 数据连接器1.1 概述数据连接器也称为Reader读取器用于从不同数据源、不同数据格式中读取数据并将其转换为统一的Document文档对象包含文本与基础元数据。 提示数据完成摄入后你可以基于文档构建索引通过查询引擎提问或使用对话引擎进行多轮对话。在之前我们已经学习过最简单的SimpleDirectoryReader这是LlamaIndex最常用的数据加载入口读取器用来批量读取本地或对象存储磁盘上的各类文件统一输出Document对象列表是RAG流水线数据加载阶段的主力工具。1.2 集成包每个数据连接器独立打包发布你只需按需安装需要的包。全部连接器源码存放于LlamaIndex仓库的readers目录PyPI上包命名规则为llama-index-readers-source。1.3 使用方式快速上手示例fromllama_index.readers.googleimportGoogleDocsReader loaderGoogleDocsReader()documentsloader.load_data(document_ids[...])更多细节查看完整使用模式指南。1.4 部分模块部分数据连接器示例本地文件目录读取器SimpleDirectoryReader支持解析多种文件类型.pdf、.jpg、.png、.docx等NotionNotionPageReaderGoogle DocsGoogleDocsReaderSlackSlackReaderDiscordDiscordReaderApify ActorsApifyActor可爬虫抓取网页、提取文本内容下载PDF、图片、Word等文件更多内容参考模块指南1.5 模块指南Simple Directory ReaderPsychic ReaderDeeplake ReaderQdrant ReaderDiscord ReaderMongoDB ReaderChroma ReaderMyScale ReaderFAISS ReaderObsidian ReaderSlack ReaderWebpage ReaderPathway ReaderMBox ReaderMilvus ReaderNotion ReaderGithub ReaderGoogle Docs ReaderDatabase ReaderTwitter ReaderWeaviate ReaderMake ReaderDeplot ReaderDocling ReaderGoogle AlloyDB ReaderGoogle Cloud SQL for PostgreSQL Reader2. LlamaParseLlamaParse是商用SaaS付费服务不是开源软件但每月提供免费额度可以免费试用。LlamaParse是LlamaIndex推出的文件解析服务可高效解析并结构化各类文件配合LlamaIndex框架实现检索与上下文增强。你可以注册免费使用LlamaParse支持数十种文档类型包括PDF、Word、PPT、Excel等。入门教程请查看 LlamaParse 官方文档。2.1 一分钟获取解析结果一套API Key、一套SDK五大能力模块。获取密钥、安装SDK运行示例代码即可。快速入门获取API密钥2.2 可用文档 API所有API共用同一个密钥与SDK。可串联调用例如先Split分段再Extract提取也可单独使用。2.2.1 Parse智能Agentic OCR支持130文件格式。把PDF、扫描件、表格、图表转换成整洁的Markdown、纯文本或JSON。# 季度报表 | 区域 | 营收 | | ---- | ---- | | 北部 | 1,240 | | 南部 | 980 |2.2.2 Extract从文档中提取强类型、符合自定义Schema的结构化数据并附带原文页码引用。{name:Jordan Lee,email:jordanexample.com,skills:[Python,SQL]}2.2.3 Index托管的数据摄入、向量化与检索服务面向文档集快速搭建RAG。2.2.4 Classify使用自然语言规则对文档分类无需训练数据集。示例输出INV-2041.pdf发票置信度0.97scan_0312.jpg收据置信度0.91msa-final.docx合同置信度0.99po-88210.pdf采购订单置信度0.942.2.5 Split在解析/提取之前将合并的长文档切分为逻辑章节。示例输出发票 · 第1–3页合同 · 第4–8页收据 · 第9–10页2.3 代码示例配置好环境变量LLAMA_CLOUD_API_KEY示例代码可直接运行。fromllama_cloudimportLlamaCloud clientLlamaCloud()# 自动读取环境变量 LLAMA_CLOUD_API_KEY# 上传并解析文档fileclient.files.create(filedocument.pdf,purposeparse)resultclient.parsing.parse(file_idfile.id,tieragentic,versionlatest,expand[markdown],)# 获取Markdown结果print(result.markdown.pages[0].markdown)importLlamaCloudfromllamaindex/llama-cloud;importfsfromfs;constclientnewLlamaCloud();// 读取环境变量 LLAMA_CLOUD_API_KEY// 上传并解析文档constfileawaitclient.files.create({file:fs.createReadStream(document.pdf),purpose:parse,});constresultawaitclient.parsing.parse({file_id:file.id,tier:agentic,version:latest,expand:[markdown]});// 获取Markdown结果console.log(result.markdown.pages[0].markdown);# 上传文档curl-XPOST\https://api.cloud.llamaindex.ai/api/v1/beta/files\-HAccept: application/json\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEY\-Fpurposeparse\-Ffile/path/to/your/file.pdf;typeapplication/pdf# 使用返回的file_id启动Parse任务curl-XPOST\https://api.cloud.llamaindex.ai/api/v2/parse\-HAccept: application/json\-HContent-Type: application/json\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEY\--data{ file_id: file_id, tier: agentic, version: latest }# 任务完成后获取Markdowncurl-XGET\https://api.cloud.llamaindex.ai/api/v2/parse/job_id?expandmarkdown\-HAccept: application/json\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEYfrompydanticimportBaseModel,Fieldfromllama_cloudimportLlamaCloud# 定义SchemaclassResume(BaseModel):name:strField(description候选人全名)email:strField(description邮箱地址)skills:list[str]Field(description技术技能)clientLlamaCloud()# 上传并执行提取fileclient.files.create(fileresume.pdf,purposeextract)jobclient.extract.run(file_inputfile.id,configuration{data_schema:Resume.model_json_schema(),tier:agentic,},)print(job.extract_result)importLlamaCloudfromllamaindex/llama-cloud;import{z}fromzod;importfsfromfs;// 使用Zod定义SchemaconstResumeSchemaz.object({name:z.string().describe(候选人全名),email:z.string().describe(邮箱地址),skills:z.array(z.string()).describe(技术技能),});constclientnewLlamaCloud();// 上传并执行提取constfileawaitclient.files.create({file:fs.createReadStream(resume.pdf),purpose:extract,});letjobawaitclient.extract.run({file_input:file.id,configuration:{data_schema:z.toJSONSchema(ResumeSchema),tier:agentic,},});console.log(job.extract_result);# 上传文档curl-XPOST\https://api.cloud.llamaindex.ai/api/v1/beta/files\-HContent-Type: multipart/form-data\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEY\-Ffile/path/to/file\-Fpurposeextract# 传入JSON Schema执行Extract提取curl-XPOST\https://api.cloud.llamaindex.ai/api/v2/extract?project_id{PROJECT_ID}\-Haccept: application/json\-HContent-Type: application/json\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEY\-d{ file_input: {FILE_ID}, configuration: { tier: agentic, data_schema: { type: object, properties: { name: { type: string, description: 候选人全名 }, email: { type: string, description: 邮箱地址 }, skills: { type: array, items: { type: string, description: 技术技能 } } } } } }fromllama_cloudimportLlamaCloud clientLlamaCloud()# 上传文档fileclient.files.create(filedocument.pdf,purposeclassify)# 通过自然语言规则进行文档分类resultclient.classifier.classify(file_ids[file.id],rules[{type:invoice,description:包含发票号、明细条目和总金额的文档},{type:receipt,description:简短收银小票包含商户与总金额},{type:contract,description:包含条款与签章的法律协议},],modeFAST,# 视觉类文档可使用 MULTIMODAL)foriteminresult.items:print(f文档类型:{item.result.type}, 置信度:{item.result.confidence})importLlamaCloudfromllamaindex/llama-cloud;importfsfromfs;constclientnewLlamaCloud();// 上传文档constfileawaitclient.files.create({file:fs.createReadStream(document.pdf),purpose:classify,});// 通过自然语言规则进行文档分类constresultawaitclient.classifier.classify({file_ids:[file.id],rules:[{type:invoice,description:包含发票号、明细条目和总金额的文档,},{type:receipt,description:简短收银小票包含商户与总金额,},{type:contract,description:包含条款与签章的法律协议,},],mode:FAST,// 视觉类文档可使用 MULTIMODAL});for(constitemofresult.items){if(item.result){console.log(文档类型:${item.result.type}, 置信度:${item.result.confidence});}}importtimefromllama_cloudimportLlamaCloud clientLlamaCloud()# 上传合并的PDF长文档fileclient.files.create(filecombined.pdf,purposesplit)# 切分为逻辑章节jobclient.beta.split.create(document_input{type:file_id,value:file.id},configuration{categories:[{name:invoice,description:包含明细与总金额的商业单据},{name:contract,description:包含条款与签章的法律协议},]},)# 轮询等待任务结束Split任务状态为小写resultclient.beta.split.get(job.id)whileresult.statusin(pending,processing):time.sleep(2)resultclient.beta.split.get(job.id)forsegmentinresult.result.segments:print(f页码范围{segment.pages}:{segment.category}置信度{segment.confidence_category})importLlamaCloudfromllamaindex/llama-cloud;importfsfromfs;constclientnewLlamaCloud();// 上传合并的PDF长文档constfileawaitclient.files.create({file:fs.createReadStream(combined.pdf),purpose:split,});// 切分为逻辑章节constjobawaitclient.beta.split.create({document_input:{type:file_id,value:file.id},configuration:{categories:[{name:invoice,description:包含明细与总金额的商业单据,},{name:contract,description:包含条款与签章的法律协议,},],},});// 轮询等待任务结束Split任务状态为小写letresultawaitclient.beta.split.get(job.id);while(result.statuspending||result.statusprocessing){awaitnewPromise((resolve)setTimeout(resolve,2000));resultawaitclient.beta.split.get(job.id);}for(constsegmentofresult.result.segments){console.log(页码范围${segment.pages}:${segment.category}置信度${segment.confidence_category});}# 上传合并PDFcurl-XPOST\https://api.cloud.llamaindex.ai/api/v1/beta/files\-Haccept: application/json\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEY\-Fpurposesplit\-Ffile/path/to/your/file.pdf;typeapplication/pdf# 启动Split分段任务curl-XPOST\https://api.cloud.llamaindex.ai/api/v1/beta/split/jobs\-Haccept: application/json\-HContent-Type: application/json\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEY\-d{ document_input: { type: file_id, value: YOUR_FILE_ID }, configuration: { categories: [ { name: invoice, description: 包含明细与总金额的商业单据 }, { name: contract, description: 包含条款与签章的法律协议 } ] } }# 轮询查询任务状态直至完成curl-XGET\https://api.cloud.llamaindex.ai/api/v1/beta/split/jobs/YOUR_JOB_ID\-Haccept: application/json\-HAuthorization: Bearer$LLAMA_CLOUD_API_KEY在线调试面板3. LiteParse描述高性能本地PDF解析库支持空间文本解析、OCR与文本包围盒。LiteParse是开源文档解析库可保留空间布局信息与文本包围盒。使用Rust编写兼顾速度与稳定性完全本地运行无云端依赖、不依赖大模型、无需 API 密钥。LiteParse专为需要快速、高精度文本解析的场景设计实时应用、编码Agent、本地工作流。提供简易CLI与库API支持PDF、Office文档、图片解析内置OCR。3.1 能力清单解析 PDF 并保留精确空间布局还原文本在页面上的位置输出 Markdown包含标题、表格、列表、图片、链接产出适合LLM与RAG流水线的结构化内容提取每行文本的包围盒便于后续处理与可视化OCR 识别扫描件内置Tesseract也可接入自定义OCR服务解析 Office 文档与图片支持DOCX、XLSX、PPTX、PNG、JPG等自动转换处理将 PDF 页面导出高清图片适配多模态LLM流程提取 PDF 内嵌资源内嵌图片、矢量图、批注、表单域、标签结构树解析前评估文档复杂度可自动将扫描件、多栏文档路由至对应处理管线多语言接入Node.js/TypeScript、Python、Rust浏览器WASM适配你的技术栈3.2 快速开始入门指南安装LiteParse解析你的第一个文档Markdown输出输出干净结构化Markdown提取配置按需开启图片、表单域、批注等提取文档复杂度检测提前识别扫描件、多栏、大表格页面库调用示例TypeScript/Python代码调用浏览器WASM运行浏览器内直接解析无需后端Agent技能让Claude Code、Cursor、Codex具备本地文档解析能力CLI命令参考完整命令与参数手册API参考Rust底层API文档类型定义适用于所有语言绑定

相关新闻

springbootAI智能法律援助小程序16783-计算机课程设计、毕业设计

springbootAI智能法律援助小程序16783-计算机课程设计、毕业设计

前言 ✨ 博主介绍:一线全栈工程师,毕设实战引路人。技术栈覆盖Java、Python、C#、PHP、Node.js及UniApp跨端开发,擅长多语言项目落地与架构设计。持续分享毕设源码、开题报告、技术选型心得与职场踩坑经验。用工程化思维写代码,帮…

2026/10/1 2:35:26 阅读更多 →
Apache Flink 流式管道实战指南:基于 data-engineer-handbook 的 PyFlink + Kafka + PostgreSQL 全链路搭建

Apache Flink 流式管道实战指南:基于 data-engineer-handbook 的 PyFlink + Kafka + PostgreSQL 全链路搭建

数据工程文档教程 【免费下载链接】data-engineer-handbook This is a repo with links to everything youd ever want to learn about data engineering 项目地址: https://gitcode.com/GitHub_Trending/da/data-engineer-handbook 点击查看 免费下载 本篇技术指南…

2026/9/30 2:28:49 阅读更多 →
动手学深度学习:注意力评分函数(掩蔽Softmax、加性注意力与缩放点积注意力)

动手学深度学习:注意力评分函数(掩蔽Softmax、加性注意力与缩放点积注意力)

人工智能深度学习机器学习教程 【免费下载链接】d2l-zh 《动手学深度学习》:面向中文读者、能运行、可讨论。中英文版被70多个国家的500多所大学用于教学。 项目地址: https://gitcode.com/GitHub_Trending/d2/d2l-zh 点击查看 免费下载 导读 在《动手…

2026/10/1 2:34:55 阅读更多 →

最新新闻

科研第二曲线:实验卡壳时如何继续推进课题进度

科研第二曲线:实验卡壳时如何继续推进课题进度

“课题进度总卡在实验上?你可能忽略了科研的‘第二曲线’”说实话,我见过太多人把“科研进度”和“实验进度”直接画等号了。实验一不顺利,整个人就进入“等待模式”:做不出来就干等着,等仪器、等样品、等表征、等结果…

2026/10/1 4:46:09 阅读更多 →
安全约束机组组合(SCUC)模型:交直流潮流方程与Pyomo求解实践

安全约束机组组合(SCUC)模型:交直流潮流方程与Pyomo求解实践

简介:面向电力系统调度与优化研究人员的MATLAB实现代码包,聚焦安全约束机组组合问题,基于交流与直流潮流方程建模。交流潮流方程可精确计算节点电压、电流与功率损耗,直流潮流方程则简化求解复杂度,适合大规模电网分析…

2026/10/1 4:46:09 阅读更多 →
SpringBoot+Vue医院资源管理系统毕设源码搭建全指南

SpringBoot+Vue医院资源管理系统毕设源码搭建全指南

我去年帮一个学弟从头到尾过了一遍他买的这套"SpringBootVue医院资源管理系统"毕设源码,当时他花了两周都没跑起来,最后我陪他把数据库脚本、后端接口、前端路由全捋了一遍,又对着接口文档做了两轮自测,才把项目完整交上…

2026/10/1 4:46:09 阅读更多 →
跨卡通信决定算力天花板:千卡集群如何像一颗超级芯片

跨卡通信决定算力天花板:千卡集群如何像一颗超级芯片

训练一个千亿参数模型,调度器告诉你分到了800张卡。满怀期待起任务,跑起来一看GPU利用率只有70%,剩下30%的时间都在等别人传数据。这种场景我见过太多次。所以业内一直有句话我很认同:跨卡通信才是算力天花板。单芯片的峰值算力再…

2026/10/1 4:46:09 阅读更多 →
一个人用AI搭建电商内容全自动化流水线的实战拆解

一个人用AI搭建电商内容全自动化流水线的实战拆解

一个人把电商内容全包了这件事,放在三年前我想都不敢想。文案、设计、排版、发布,每一个环节单独拎出来都是一门手艺,一个人很难全点满。但这两年不一样了,AI把“技能门槛”硬生生拉到了“会用提示词”的水平。我现在一个人维护着…

2026/10/1 4:46:09 阅读更多 →
业务Agent评测实战:从轨迹评测到CI集成的全流程指南

业务Agent评测实战:从轨迹评测到CI集成的全流程指南

1. 业务Agent评测到底在评什么1.1 从“模型评测”到“Agent评测”的认知转变很多人第一次接触Agent评测,脑子里浮现的还是那套跑分逻辑:拿一个测试集,跑一遍,算准确率、召回率、F1,然后出一张榜单。这套方法在纯LLM评测…

2026/10/1 4:45:09 阅读更多 →

日新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 18:13:06 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →