RAG管线四件套:从原始文档到可检索知识
一、概念什么是 RAG 管线四件套把原始文档变成可检索知识需要经过四步原始文档 ──①──→ 标准文档 ──②──→ 文档片段 ──③──→ 嵌入向量 ──④──→ 向量索引 Loader Splitter Embedding VectorStore每一步对应一个组件#组件职责输入输出①Document Loader从数据源加载文档文件路径 / URLlist[Document]②Text Splitter把长文档切成小片段list[Document]list[Document]更短③Embedding Model把文本转成向量strlist[float]④Vector Store存储向量并支持搜索文档 向量相似文档列表四步串起来就是 RAG 的离线索引管线。一句话总结四件套是原始文档 → 可检索知识的 ETL 管线——加载、切分、嵌入、存储每一步都有标准抽象。二、价值为什么需要标准化管线1. 数据源千差万别PDF、Word、Markdown、HTML、Notion、Slack、数据库……格式各异。Document Loader 把所有来源统一成Document(page_content, metadata)。2. 长文档必须切分一个 42K 字符的 PDF 超出多数模型的上下文窗口。即使塞进去模型也会注意力涣散。切分让每个片段独立可检索、大小可控。3. 语义搜索需要向量关键词搜索无法理解同义词。退货和退换意思相近但词不同。嵌入向量把语义映射到空间距离近义词自然靠近。4. 向量库是检索的基石有了向量索引才能毫秒级返回与查询最相似的文档片段。不同向量库Chroma、FAISS、Pinecone各有适用场景但接口统一。核心价值四件套把数据接入变成标准化 ETL 管线让你专注业务而非数据格式。三、用法四件套逐一实战① Document Loader加载数据# PDF from langchain_community.document_loaders import PyPDFLoader docs PyPDFLoader(report.pdf).load() # Markdown from langchain_community.document_loaders import UnstructuredMarkdownLoader docs UnstructuredMarkdownLoader(guide.md).load() # 网页 from langchain_community.document_loaders import WebBaseLoader docs WebBaseLoader(https://example.com/faq).load() # 纯文本 from langchain_community.document_loaders import TextLoader docs TextLoader(notes.txt, encodingutf-8).load() # CSV每行一个文档 from langchain_community.document_loaders import CSVLoader docs CSVLoader(data.csv).load()每个 Loader 返回list[Document]Document 有两个核心字段page_content: str — 文本内容metadata: dict — 元数据来源文件名、页码、URL 等② Text Splitter切分文档from langchain_text_splitters import RecursiveCharacterTextSplitter splitter RecursiveCharacterTextSplitter( chunk_size1000, # 每个片段最大 1000 字符 chunk_overlap200, # 相邻片段重叠 200 字符 separators[\n\n, \n, 。, , , , ], # 中文友好 add_start_indexTrue, # 记录每个片段在原文的起始位置 ) chunks splitter.split_documents(docs) print(f原文档: {len(docs)} 个, 切分后: {len(chunks)} 个片段)关键参数chunk_size片段上限。太大→噪声多太小→上下文断裂。经验值 500-1500chunk_overlap重叠区。保证片段边界不丢信息。经验值 chunk_size 的 10-20%separators切分优先级。RecursiveCharacterTextSplitter依次尝试每个分隔符直到片段足够小其他 SplitterSplitter适用场景RecursiveCharacterTextSplitter通用文本推荐默认MarkdownHeaderTextSplitter按标题层级切分 MarkdownPythonCodeTextSplitter按函数/类切分 Python 代码TokenTextSplitter按 token 数切分③ Embedding Model文本转向量from langchain_huggingface import HuggingFaceEmbeddings # 推荐多语言 中文优化 embeddings HuggingFaceEmbeddings( modelBAAI/bge-m3, ) # 嵌入单条文本 vector embeddings.embed_query(退货政策) print(f维度: {len(vector)}) # 通常 768 或 1024 # 批量嵌入 vectors embeddings.embed_documents([退货政策, 换货流程])选型指南模型维度特点安装BAAI/bge-m31024多语言中文优秀langchain-huggingfaceBAAI/bge-small-zh-v1.5512中文专用轻量langchain-huggingfacetext-embedding-3-small1536OpenAI需联网langchain-openai国内用户推荐bge-m3中文效果好、离线可用、免费。④ Vector Store存储 搜索from langchain_chroma import Chroma # 创建 索引一次性 vectorstore Chroma.from_documents( documentschunks, embeddingembeddings, collection_namemy_docs, persist_directory./chroma_db, # 持久化到磁盘 ) # 后续加载不用重新索引 vectorstore Chroma( collection_namemy_docs, embedding_functionembeddings, persist_directory./chroma_db, ) # 相似度搜索 docs vectorstore.similarity_search(退货政策, k3) # 带分数 docs_with_scores vectorstore.similarity_search_with_score(退货政策, k3) for doc, score in docs_with_scores: print(f分数: {score:.4f} | {doc.page_content[:80]})向量库选型向量库特点适用场景Chroma嵌入式零配置支持持久化开发/小规模部署FAISSFacebook 开源纯内存极快大规模内存检索Pinecone全托管云服务生产环境、免运维Milvus开源分布式支持 GPU超大规模生产QdrantRust 实现性能好中大规模生产完整管线从文件到可检索 Agentfrom langchain_community.document_loaders import PyPDFLoader from langchain_text_splitters import RecursiveCharacterTextSplitter from langchain_huggingface import HuggingFaceEmbeddings from langchain_chroma import Chroma from langchain.tools.retriever import create_retriever_tool from langchain.agents import create_agent # ① 加载 docs PyPDFLoader(company_policy.pdf).load() # ② 切分 chunks RecursiveCharacterTextSplitter( chunk_size1000, chunk_overlap200 ).split_documents(docs) # ③ 嵌入 ④ 存储 embeddings HuggingFaceEmbeddings(modelBAAI/bge-m3) vectorstore Chroma.from_documents(chunks, embeddings, persist_directory./db) # 接入 Agent retriever_tool create_retriever_tool( vectorstore.as_retriever(search_kwargs{k: 3}), namesearch_docs, description搜索公司政策文档, ) agent create_agent(deepseek:deepseek-chat, tools[retriever_tool]) result agent.invoke({ messages: [{role: user, content: 公司年假多少天}] })四、原理管线各步的内部机制1. Document Loader 的统一接口所有 Loader 继承BaseLoader实现load()→list[Document]class BaseLoader: def load(self) - list[Document]: ... def lazy_load(self) - Iterator[Document]: ... # 懒加载省内存大文件用lazy_load()避免一次性加载到内存。2. RecursiveCharacterTextSplitter 的递归策略原文: 第一章\n\n第一节\n\n内容A...\n\n第二节\n\n内容B... ↓ 尝试用 \n\n 切分 [第一章, 第一节\n\n内容A..., 第二节\n\n内容B...] ↓ 某段超过 chunk_size? 继续用 \n 切 ↓ 还超过? 用 。 切 ↓ 还超过? 用 切 ↓ 还超过? 按字符强制切递归保证优先在语义边界切分只在必要时才暴力切断。3. Embedding 的向量空间嵌入模型把文本映射到高维空间768/1024 维语义相近的文本在空间中距离近退货政策 ──→ [0.12, -0.34, 0.56, ...] 退换货流程 ──→ [0.11, -0.33, 0.55, ...] ← 距离很近 天气预报 ──→ [-0.45, 0.78, -0.23, ...] ← 距离很远相似度用余弦距离或欧氏距离计算。搜索时就是找查询向量最近的 K 个文档向量。4. Vector Store 的索引结构向量库用近似最近邻ANN算法加速搜索算法原理特点HNSW层级导航小世界图速度快、精度高内存占用大IVF倒排索引 聚类可控精度适合大规模PQ乘积量化压缩省内存精度略降Chroma 默认用 HNSWFAISS 支持 IVF PQPinecone 用自研索引。5. 管线性能优化瓶颈优化方向嵌入计算慢批量嵌入 GPU 加速搜索不够准调整 chunk_size / 换嵌入模型 / 加元数据过滤结果太相似用 MMR 搜索 / 调大 fetch_k中文效果差换中文优化的嵌入模型bge-m3索引更新频繁增量 add_documents()不全量重建小结视角一句话概念原始文档→可检索知识的 ETL 管线加载→切分→嵌入→存储价值标准化数据接入让你专注业务而非格式用法Loader 统一来源、Splitter 控制粒度、Embedding 选中文模型、VectorStore 选合适引擎原理递归切分保语义边界、向量空间做语义搜索、ANN 算法加速检索记住一件事四件套中切分Splitter对最终检索质量影响最大——切得不好后面嵌入再好、向量库再快也白搭。

相关新闻

高斯泼溅技术-从入门到精通

高斯泼溅技术-从入门到精通

自适应密度控制(Adaptive Density Control) 训练从稀疏点云初始化,经过几万步梯度下降,最终得到数百万个高斯体。这中间,高斯体的数量和位置是如何从初始状态演变到最终状态的?答案就是本文的主题——自适…

2026/9/24 15:05:24 阅读更多 →
HarmonyOS7 启动优化:冷启动从 3 秒降到 1 秒的 5 个技巧

HarmonyOS7 启动优化:冷启动从 3 秒降到 1 秒的 5 个技巧

文章目录前言冷启动 vs 热启动优化 1:延迟加载优化 2:减少 onCreate 逻辑优化 3:预加载优化 4:布局优化优化 5:懒初始化效果对比写在最后前言 我们的 App 上线后第一周,用户反馈最多的不是功能 bug&#x…

2026/9/20 5:04:49 阅读更多 →
测试文章 001122 - 请忽略

测试文章 001122 - 请忽略

这是一篇测试文章,用于验证账号状态,将立即删除。

2026/9/22 20:38:17 阅读更多 →

最新新闻

2026年半入耳式蓝牙耳机选购指南与实测分析

2026年半入耳式蓝牙耳机选购指南与实测分析

1. 2026年半入耳式蓝牙耳机市场现状2026年的TWS耳机市场已经进入高度成熟期,各大品牌在百元价位段的竞争尤为激烈。根据GFK最新市场调研数据显示,150-300元价格区间的半入耳式蓝牙耳机占据了整体销量的43%,成为普通消费者的首选品类。这个价位…

2026/9/25 6:50:19 阅读更多 →
博途V13源文件拆解与移植实战:从环境配置到工艺轴避坑

博途V13源文件拆解与移植实战:从环境配置到工艺轴避坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/25 6:50:19 阅读更多 →
口袋妖怪究极绿宝石5.5手机版:模拟器运行与ROM修改技术解析

口袋妖怪究极绿宝石5.5手机版:模拟器运行与ROM修改技术解析

1. 口袋妖怪究极绿宝石5.5手机版解析口袋妖怪究极绿宝石5.5是基于经典GBA游戏《口袋妖怪绿宝石》的民间改版作品。这个版本在原作基础上增加了大量新内容,包括扩展的精灵图鉴、全新的剧情线、改进的战斗系统等。手机版则是通过模拟器技术让玩家能够在移动设备上体验…

2026/9/25 6:50:19 阅读更多 →
基于 embassy-boot 的 STM32H7 固件升级实战:从 DFU 应用到双应用烧录

基于 embassy-boot 的 STM32H7 固件升级实战:从 DFU 应用到双应用烧录

嵌入式物联网异步编程 【免费下载链接】embassy Modern embedded framework, using Rust and async. 项目地址: https://gitcode.com/gh_mirrors/em/embassy 点击查看 免费下载 导读 本文围绕 examples/boot/application/stm32h7 这一示例展开,讲解如何…

2026/9/25 6:50:19 阅读更多 →
swagger-codegen 生成的 Java 客户端模型文档解读:以 okhttp4-gson 的 Category 模型为例

swagger-codegen 生成的 Java 客户端模型文档解读:以 okhttp4-gson 的 Category 模型为例

开发工具代码生成API设计 【免费下载链接】swagger-codegen swagger-codegen contains a template-driven engine to generate documentation, API clients and server stubs in different languages by parsing your OpenAPI / Swagger definition. 项目地址: http…

2026/9/25 6:50:18 阅读更多 →
Atlas 300V 24G推理加速卡部署YOLO全攻略,手把手绕过踩坑

Atlas 300V 24G推理加速卡部署YOLO全攻略,手把手绕过踩坑

后台经常有朋友私信我第一句话就问:“Atlas 300V 24G是运算加速卡吗?能不能跑YOLO?”第二句话往往是:“网上说atlas部署yolo很麻烦,是真的吗?”这两个问题我当年刚拿到这张卡时也反复琢磨过。先说结论&…

2026/9/25 6:49:18 阅读更多 →

日新闻

AI元人文:从工具使用到思维重构的深度探索

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:00:41 阅读更多 →
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:00:41 阅读更多 →
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/25 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/24 14:34:13 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/24 9:10:42 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/24 14:33:56 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/24 12:50:34 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/24 14:33:48 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/24 12:49:17 阅读更多 →