LangChain 从入门到实战(07):让它「读」你的私有文档——检索增强 RAG(上)模型再强,也只学过公开数据;你的公司文档、产品手册、用户手册,它一概不知。这一篇开始处理让模型「看得见你的私有知识」。RAG(Retrieval-Augmented Generation,检索增强生成)是眼下最主流的做法:先检索相关资料,再让模型基于资料回答,绕开「重训练一个模型」。RAG 分两半,这一篇讲**「建库」上半场**:把文档切成小块 → 向量化 → 存进向量库。下一篇讲**「问答」下半场**:检索 + 生成,让模型引用你的资料作答。一、RAG 全程只有 4 步步骤A 加载 → 步骤B 切分文档 → 步骤C 向量化(Embedding) → 步骤D 存进向量库 ↓ 步骤E 提问时: 把问题向量化 → 向量库捞出最相近的 N 小块 → 拼进 prompt → 模型作答前 4 步是一次性离线流程(建库),后 1 步是每次问答的在线流程。这一篇讲 A–D,下一篇讲 E。二、A 加载:DocumentLoader读出原始文档文档可能来自文件、PDF、网页、数据库。LangChain 有一族