RAG管线四件套:从原始文档到可检索知识
一、概念什么是 RAG 管线四件套把原始文档变成可检索知识需要经过四步原始文档 ──①──→ 标准文档 ──②──→ 文档片段 ──③──→ 嵌入向量 ──④──→ 向量索引 Loader Splitter Embedding VectorStore每一步对应一个组件#组件职责输入输出①Document Loader从数据源加载文档文件路径 / URLlist[Document]②Text Splitter把长文档切成小片段list[Document]list[Document]更短③Embedding Model把文本转成向量strlist[float]④Vector Store存储向量并支持搜索文档 向量相似文档列表四步串起来就是 RAG 的离线索引管线。一句话总结四件套是原始文档 → 可检索知识的 ETL 管线——加载、切分、嵌入、存储每一步都有标准抽象。二、价值为什么需要标准化管线1. 数据源千差万别PDF、Word、Markdown、HTML、Notion、Slack、数据库……格式各异。Document Loader 把所有来源统一成Document(page_content, metadata)。2. 长文档必须切分一个 42K 字符的 PDF 超出多数模型的上下文窗口。即使塞进去模型也会注意力涣散。切分让每个片段独立可检索、大小可控。3. 语义搜索需要向量关键词搜索无法理解同义词。退货和退换意思相近但词不同。嵌入向量把语义映射到空间距离近义词自然靠近。4. 向量库是检索的基石有了向量索引才能毫秒级返回与查询最相似的文档片段。不同向量库Chroma、FAISS、Pinecone各有适用场景但接口统一。核心价值四件套把数据接入变成标准化 ETL 管线让你专注业务而非数据格式。三、用法四件套逐一实战① Document Loader加载数据# PDF from langchain_community.document_loaders import PyPDFLoader docs PyPDFLoader(report.pdf).load() # Markdown from langchain_community.document_loaders import UnstructuredMarkdownLoader docs UnstructuredMarkdownLoader(guide.md).load() # 网页 from langchain_community.document_loaders import WebBaseLoader docs WebBaseLoader(https://example.com/faq).load() # 纯文本 from langchain_community.document_loaders import TextLoader docs TextLoader(notes.txt, encodingutf-8).load() # CSV每行一个文档 from langchain_community.document_loaders import CSVLoader docs CSVLoader(data.csv).load()每个 Loader 返回list[Document]Document 有两个核心字段page_content: str — 文本内容metadata: dict — 元数据来源文件名、页码、URL 等② Text Splitter切分文档from langchain_text_splitters import RecursiveCharacterTextSplitter splitter RecursiveCharacterTextSplitter( chunk_size1000, # 每个片段最大 1000 字符 chunk_overlap200, # 相邻片段重叠 200 字符 separators[\n\n, \n, 。, , , , ], # 中文友好 add_start_indexTrue, # 记录每个片段在原文的起始位置 ) chunks splitter.split_documents(docs) print(f原文档: {len(docs)} 个, 切分后: {len(chunks)} 个片段)关键参数chunk_size片段上限。太大→噪声多太小→上下文断裂。经验值 500-1500chunk_overlap重叠区。保证片段边界不丢信息。经验值 chunk_size 的 10-20%separators切分优先级。RecursiveCharacterTextSplitter依次尝试每个分隔符直到片段足够小其他 SplitterSplitter适用场景RecursiveCharacterTextSplitter通用文本推荐默认MarkdownHeaderTextSplitter按标题层级切分 MarkdownPythonCodeTextSplitter按函数/类切分 Python 代码TokenTextSplitter按 token 数切分③ Embedding Model文本转向量from langchain_huggingface import HuggingFaceEmbeddings # 推荐多语言 中文优化 embeddings HuggingFaceEmbeddings( modelBAAI/bge-m3, ) # 嵌入单条文本 vector embeddings.embed_query(退货政策) print(f维度: {len(vector)}) # 通常 768 或 1024 # 批量嵌入 vectors embeddings.embed_documents([退货政策, 换货流程])选型指南模型维度特点安装BAAI/bge-m31024多语言中文优秀langchain-huggingfaceBAAI/bge-small-zh-v1.5512中文专用轻量langchain-huggingfacetext-embedding-3-small1536OpenAI需联网langchain-openai国内用户推荐bge-m3中文效果好、离线可用、免费。④ Vector Store存储 搜索from langchain_chroma import Chroma # 创建 索引一次性 vectorstore Chroma.from_documents( documentschunks, embeddingembeddings, collection_namemy_docs, persist_directory./chroma_db, # 持久化到磁盘 ) # 后续加载不用重新索引 vectorstore Chroma( collection_namemy_docs, embedding_functionembeddings, persist_directory./chroma_db, ) # 相似度搜索 docs vectorstore.similarity_search(退货政策, k3) # 带分数 docs_with_scores vectorstore.similarity_search_with_score(退货政策, k3) for doc, score in docs_with_scores: print(f分数: {score:.4f} | {doc.page_content[:80]})向量库选型向量库特点适用场景Chroma嵌入式零配置支持持久化开发/小规模部署FAISSFacebook 开源纯内存极快大规模内存检索Pinecone全托管云服务生产环境、免运维Milvus开源分布式支持 GPU超大规模生产QdrantRust 实现性能好中大规模生产完整管线从文件到可检索 Agentfrom langchain_community.document_loaders import PyPDFLoader from langchain_text_splitters import RecursiveCharacterTextSplitter from langchain_huggingface import HuggingFaceEmbeddings from langchain_chroma import Chroma from langchain.tools.retriever import create_retriever_tool from langchain.agents import create_agent # ① 加载 docs PyPDFLoader(company_policy.pdf).load() # ② 切分 chunks RecursiveCharacterTextSplitter( chunk_size1000, chunk_overlap200 ).split_documents(docs) # ③ 嵌入 ④ 存储 embeddings HuggingFaceEmbeddings(modelBAAI/bge-m3) vectorstore Chroma.from_documents(chunks, embeddings, persist_directory./db) # 接入 Agent retriever_tool create_retriever_tool( vectorstore.as_retriever(search_kwargs{k: 3}), namesearch_docs, description搜索公司政策文档, ) agent create_agent(deepseek:deepseek-chat, tools[retriever_tool]) result agent.invoke({ messages: [{role: user, content: 公司年假多少天}] })四、原理管线各步的内部机制1. Document Loader 的统一接口所有 Loader 继承BaseLoader实现load()→list[Document]class BaseLoader: def load(self) - list[Document]: ... def lazy_load(self) - Iterator[Document]: ... # 懒加载省内存大文件用lazy_load()避免一次性加载到内存。2. RecursiveCharacterTextSplitter 的递归策略原文: 第一章\n\n第一节\n\n内容A...\n\n第二节\n\n内容B... ↓ 尝试用 \n\n 切分 [第一章, 第一节\n\n内容A..., 第二节\n\n内容B...] ↓ 某段超过 chunk_size? 继续用 \n 切 ↓ 还超过? 用 。 切 ↓ 还超过? 用 切 ↓ 还超过? 按字符强制切递归保证优先在语义边界切分只在必要时才暴力切断。3. Embedding 的向量空间嵌入模型把文本映射到高维空间768/1024 维语义相近的文本在空间中距离近退货政策 ──→ [0.12, -0.34, 0.56, ...] 退换货流程 ──→ [0.11, -0.33, 0.55, ...] ← 距离很近 天气预报 ──→ [-0.45, 0.78, -0.23, ...] ← 距离很远相似度用余弦距离或欧氏距离计算。搜索时就是找查询向量最近的 K 个文档向量。4. Vector Store 的索引结构向量库用近似最近邻ANN算法加速搜索算法原理特点HNSW层级导航小世界图速度快、精度高内存占用大IVF倒排索引 聚类可控精度适合大规模PQ乘积量化压缩省内存精度略降Chroma 默认用 HNSWFAISS 支持 IVF PQPinecone 用自研索引。5. 管线性能优化瓶颈优化方向嵌入计算慢批量嵌入 GPU 加速搜索不够准调整 chunk_size / 换嵌入模型 / 加元数据过滤结果太相似用 MMR 搜索 / 调大 fetch_k中文效果差换中文优化的嵌入模型bge-m3索引更新频繁增量 add_documents()不全量重建小结视角一句话概念原始文档→可检索知识的 ETL 管线加载→切分→嵌入→存储价值标准化数据接入让你专注业务而非格式用法Loader 统一来源、Splitter 控制粒度、Embedding 选中文模型、VectorStore 选合适引擎原理递归切分保语义边界、向量空间做语义搜索、ANN 算法加速检索记住一件事四件套中切分Splitter对最终检索质量影响最大——切得不好后面嵌入再好、向量库再快也白搭。

相关新闻

高斯泼溅技术-从入门到精通

高斯泼溅技术-从入门到精通

自适应密度控制(Adaptive Density Control) 训练从稀疏点云初始化,经过几万步梯度下降,最终得到数百万个高斯体。这中间,高斯体的数量和位置是如何从初始状态演变到最终状态的?答案就是本文的主题——自适…

2026/7/23 22:45:32 阅读更多 →
HarmonyOS7 启动优化:冷启动从 3 秒降到 1 秒的 5 个技巧

HarmonyOS7 启动优化:冷启动从 3 秒降到 1 秒的 5 个技巧

文章目录前言冷启动 vs 热启动优化 1:延迟加载优化 2:减少 onCreate 逻辑优化 3:预加载优化 4:布局优化优化 5:懒初始化效果对比写在最后前言 我们的 App 上线后第一周,用户反馈最多的不是功能 bug&#x…

2026/7/23 22:45:32 阅读更多 →
测试文章 001122 - 请忽略

测试文章 001122 - 请忽略

这是一篇测试文章,用于验证账号状态,将立即删除。

2026/7/23 22:44:31 阅读更多 →

最新新闻

CANNBot 实操体验:基于Ascend C的矩阵乘法算子开发

CANNBot 实操体验:基于Ascend C的矩阵乘法算子开发

目录 引言 测评结论 ✅ 核心优势 ⚠️ 待优化点 📊 效率提升效果 CANNBot 是什么? 核心能力一览 本次实操案例 第一部分:环境搭建 1.1 创建Notebook实例 1.2 安装 Node.js 18 1.3 安装 OpenCode 1.4 安装 CANNBot-Skills 第二部分&#xff1a…

2026/7/23 22:55:37 阅读更多 →
AI辅助开发效能跃迁路径(2024企业级落地白皮书首发)

AI辅助开发效能跃迁路径(2024企业级落地白皮书首发)

更多请点击: https://codechina.net 第一章:AI辅助开发效能跃迁路径(2024企业级落地白皮书首发) 企业正从“局部试点AI工具”迈向“系统性重构研发范式”的关键拐点。2024年,头部科技公司实测数据显示:在C…

2026/7/23 22:55:37 阅读更多 →
【RT-DETR涨点改进】CVPR 2026 | 卷积创新改进篇 | 轻量化改进!引入YOLO-ULM中轻量D3C2f轻量化模块,含二次创新模块,5种创新改进点,助力目标检测任务,高效涨点

【RT-DETR涨点改进】CVPR 2026 | 卷积创新改进篇 | 轻量化改进!引入YOLO-ULM中轻量D3C2f轻量化模块,含二次创新模块,5种创新改进点,助力目标检测任务,高效涨点

一、本文介绍 🔥本文给大家介绍使用 YOLO-ULM中轻量D3C2f模块 改进RT-DETR网络模型,D3C2f 通过特征切分与聚合结构保留 C2f 的高效梯度流动和特征复用能力,同时在 D3 Block 中级联 33 深度可分离卷积、77 大核深度卷积和 33 深度可分离卷积,既扩大模型感受野、增强高层语…

2026/7/23 22:55:37 阅读更多 →
【RT-DETR涨点改进】TGRS 2026 | 特征融合改进篇 |引入CDSF跨域协同融合模块,增强特征互补性与语义一致性,助力高光谱目标检测、遥感目标检测、多模态融合目标检测任务,高效涨点

【RT-DETR涨点改进】TGRS 2026 | 特征融合改进篇 |引入CDSF跨域协同融合模块,增强特征互补性与语义一致性,助力高光谱目标检测、遥感目标检测、多模态融合目标检测任务,高效涨点

一、本文介绍 🔥本文给大家介绍使用 CDSF跨域协同融合模块 改进 RT-DETR 网络模型,主要作用是对不同层级、不同尺度或不同模态的特征进行自适应对齐与互补融合,避免传统拼接或直接相加造成的语义错位和信息冗余。该模块先利用多尺度深度可分离卷积提取局部细节与大范围上下…

2026/7/23 22:55:37 阅读更多 →
MTK安全启动分析9:MTK LK 编译Makefile完整解析

MTK安全启动分析9:MTK LK 编译Makefile完整解析

MTK LK 编译Makefile完整解析整体概述MTK平台LittleKernel(BL33二级引导器)是由编译Makfile脚本build_lk.mk来编译,核心特性:多LK编译模式(LK_MODE):一套LK源码编译出不同功能固件(普…

2026/7/23 22:54:37 阅读更多 →
沁园春·智能潮

沁园春·智能潮

沁园春智能潮浦江七月,展台十万,机杼争朝。 望徐汇滩头,机器成阵; 张江云上,算力奔涛。 月之暗面,一朝破壁,开源权重撼寰霄。 消息出,惊华尔街夜,股海生潮。莫道东方难超…

2026/7/23 22:54:37 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻