深入浅出之RAG
RAGRetrieval‑Augmented Generation检索增强生成大白话先从自己的知识库找资料再交给大模型去回答解决大模型幻觉、知识过时、私有数据无法输入的问题。可以说RAG是企业数智化的一项基础设施。RAG 的整体工作流程1.文档上传加载读 PDF、Markdown、数据库、网页等私有 / 外部文档2.文档切分Chunk 分片把长文档切成小段固定长度、语义…各种切法3.向量化用 Embedding 模型把文本片段转为向量存入向量数据库4.用户提问用户输入问题5.检索检索召回排序。召回把问题向量化在向量库做相似度搜索取出最相关的几段原 文。也即把相关候选文档先捞出来宁可多不要漏。允许拿一部分不相关的噪声只求不要把真正相关的文档漏掉。多路召回就是按多种方式召回文档片段。重排 Rerank将召回的文档片段过滤噪声选出 Top‑N 最相关片段送给大模型做上下文通俗类比你去图书馆找资料回答一个问题 召回电脑检索系统根据关键词 语义给你找出 20 本可能相关的书会混几本不那么相关的但是保证相关的尽量都出现 重排图书管理员把这 20 本翻一遍按和你问题的相关度重新排顺序挑出最贴合的 3‑5 本给你。 整套动作叫检索。6.Prompt 组装把检索出来的参考资料 用户问题一起喂给大模型7.生成答案大模型基于给到的参考资料输出回答尽量引用检索到的内容减少瞎编。曹植能七步成诗咱七步也能做个RAG,但是做好RAG那是真不容易。一现在从切片开始切片是 RAG 的地基检索效果 70% 由切片质量决定向量模型、重排都救不了糟糕的切片。切片根据文档类型、结构有多种切割方式固定长度切片滑动窗口原理按字符 /token 固定切分配置chunk_sizechunk_overlap滑动重叠。2.递归字符切片RecursiveCharacterTextSplitter【生产最常用】原理按分隔符优先级递归切分优先大粒度分隔符块还是过大再用更小分隔符。中文分隔符顺序\n\n段落 →。句号 →、逗号 →\n换行 → 空格 → 兜底切割。3.文档结构切片Structural Chunking原理解析文档原生结构Markdown 标题、HTML 标签、PDF 章节、目录、列表按标题边界切割把标题和对应正文绑定在一起同时把标题存入元数据 metadata。语义切片Semantic Chunking原理句子之间计算 embedding 相似度当相邻句子向量相似度显著下降判定为语义边界在此处切分块长度动态变化不是固定值。5. LLM 智能切片原理调用大模型让 LLM 自己理解文本输出切分后的片段。6. 分层 / 父子切片Hierarchical NodeAuto‑Merging Retriever原理生成两层节点大粒度父 chunk完整章节 细粒度子 chunk向量库存子 chunk检索命中子 chunk 后向上拿到父 chunk 完整上下文给 LLM。7. Late‑chunking延迟切片原理先把大段文本做 Embedding再切分向量而不是先切文本再分别 Embedding保留全局语义信息。8.上下文增强。原理切分块后块有前置和后置块命中核心块后将核心块、后置块一起交给LLM。9.块级加标。原理命中块与标题信息关联。10.文档增强。切片、问题11.查询改写机制。查询改写回退提问问题拆解12.上下文压缩、反馈闭环、自反思RAG、知识图谱、层次化索引、假设性文档生成。然后呢这么多生产级 RAG 怎么切片 ?生产几乎不会只用单一切片算法一定是混合流水线优先结构解析 → 递归细切高价值文档叠加语义校验海量文档拒绝全量 LLM 切片。原始文档(PDF/Word/md/html)↓ 文档解析PDF提取文本、OCR、去页眉页脚、清理乱码、表格特殊处理 ↓ 【一级切分结构切片】 按标题、章节、段落做粗切每个粗块携带完整元数据文档名、章节标题、页码 ↓ 【二级切分递归Token切片】 对每一个粗块使用Token感知递归切片控制chunk_size、overlap ↓ 过滤过滤过短碎片50token直接合并到相邻块 ↓ 可选增强高价值文档做语义边界微调海量文档跳过LLM切片 ↓ 写入向量库metadata带上来源文档、章节标题、页码、块序号还有不同业务场景选型也不一样还有metadata 必须携带上下文信息每个 chunk 必须带上文档名称、章节标题、页码、块 ID。只存裸文本检索出来不知道属于哪个章节很容易幻觉。设置最小 chunk 阈值过滤 50token 碎片碎片单独向量没有语义会产生噪声召回。不要一刀切不同文档类型不同策略如FAQ整条不切代码按函数 / 类切分不要随便按 token 切割代码块表格表格单独处理不要直接丢进通用切片。一定要评估切片效果不要拍脑袋调参构造业务真实问答测试集评估Recall3、Recall5对比不同 chunk_size/overlap选出数据集最优参数不要迷信网上通用值。高级进阶方案Contextual RetrievalAnthropic给每个 chunk 生成小块摘要摘要和原始块一起入库提升边界召回。Small‑to‑Big 检索检索拿到细粒度 chunk运行时向上扩展获取更大上下文不需要存储两层数据。快速上线、海量文档递归切片 结构预处理优先二、向量化向量化是为了后续检索召回。向量化的方式也有很多1.普通向量 RAGNaive/Standard RAG 固定流水线向量相似度召回文本块一次检索直接生成。2.Advanced RAG进阶 RAG是****对向量 RAG 流水线做增强优化仍然只用文本向量库不引入图谱。 检索前查询改写、多子查询生成、HyDE检索后Reranker 重排序、上下文压缩、过滤噪声3.KG‑RAGGraph‑RAGKnowledge‑Graph RAG 向量 知识图谱三元组擅长实体关系、多跳链路推理。4.Agentic‑RAG智能体 RAG检索不再是固定流水线把检索变成 Agent 的可调用工具LLM 自主做规划、判断、循环多次检索、选择数据源、调用外部 API、SQL、搜索引擎。流程用户问题 → Agent 规划拆解 → 判断要不要检索、去哪检索 → 可多次检索 反思校验 → 汇总生成。三、检索、召回、重排RAG 三阶段检索 (Retrieval) → 召回 (Recall) → 重排 (Rerank)很多人会混用这三个词工程上边界清晰检索整体动作统称召回粗筛从海量库里面捞一批候选集追求高召回率宁可多捞不要漏****重排精筛对召回出来的候选做精细打分排序过滤垃圾选出最优质少量片段送入 LLM。口诀检索Hierarchical RAG 分层 RAG父子文档 RAG知识分层存储文档级 → 章节级 → 细粒度 chunk。检索策略先召回大文档 / 章节再向下取细粒度片段解决大文档上下文丢失问题。召回求全重排求精召回 Recall粗召回目标把有可能相关的文档尽量捞出来不要漏掉正确答案允许混入无关内容。指标重点RecallK尽量让正确 chunk 落在返回的 Top‑K 候选里。常见召回手段多路召回 Hybrid**向量召回语义召回**将 query 向量化向量库做余弦相似度返回相似度最高 N 条。优点语义理解同义词、转述也能匹配缺点专有名词、缩写容易匹配不准。**BM25 关键词召回词法**传统检索基于词频、逆文档频率匹配字面关键词。优点专有名词、ID、编码匹配强缺点不懂语义同义改写匹配差。**KG 图谱召回KG‑RAG**从问题提取实体图数据库 Cypher 遍历拿到关联实体、三元组、关联 chunk ID。生产标准向量 BM25 两路召回可选加图谱召回。多路会拿到多份候选做结果融合去重、简单权重打分输出候选池比如捞取 Top‑20~Top‑50这一步就是召回完成。召回阶段不做精细过滤宁可错捞不能漏。如果正确文档在召回阶段就不在候选池后面重排再强也救不回来。四、Prompt 组装系统提示词 用户原始问题 检索回来的上下文片段 约束规则重点不是简单把文档全部堆进去要做边界、格式、防幻觉、上下文过载控制。1.多个文档片段建议加分隔符区分来源避免文本粘连2.适合需要标注信息出自哪篇文档便于溯源降低幻觉。3.多轮对话需要带上历史消息同时引入检索上下文。容易采坑的点上下文长度超限检索返回过多 chunk拼接后超过 LLM 上下文窗口会被截断丢失信息。处理方案rerank 重排只取 top‑N 最相关片段不要把全部召回结果塞进去对长 chunk 做截断监控 prompt 总 token 数量。2. 上下文和问题混淆必须明确标记分隔符【参考上下文】、【用户问题】防止大模型把用户提问当成知识库内容或者把上下文当成用户指令。3. 防幻觉关键约束必加两条规则如果参考上下文没有对应信息直接回复无法回答禁止猜测禁止使用外部知识。很多 RAG 效果差不是检索不行是 Prompt 没加这条约束大模型直接用内部知识乱答。4. 不要把原始大段文档直接无脑拼接多路召回回来的 chunk存在重复、冗余组装前建议去重rerank 过滤低分片段过滤无效噪声片段。五、生成答案dvanced RAG 进阶生成① 反思 RAG Self‑RAGLLM 生成同时自我校验三件事是否需要检索检索材料是否够用生成的答案是否和材料一致材料不足则再次发起检索多轮迭代。② 迭代 / 递归生成长文档 RAG检索出来上下文太长放不下窗口先对第一批 chunk 生成中间摘要再把摘要 剩余 chunk 分批送入模型逐步合并答案③ 多查询生成 Query Rewrite对用户问题生成多个变体 query分别检索再合并上下文再生成提升召回覆盖面。生成后处理很多工程忽略拿到 LLM 输出答案后增加后置校验事实校验答案关键语句反向和检索 chunk 比对看信息是否存在过滤 “无法回答” 之外的无效输出格式清洗去掉思考标签、多余分隔符可选引用溯源输出对应文档片段来源笔者利用向量库和知识图谱做了一个企业级RAG提供上传文档 → 自动索引 → 多路检索增强问答的一站式能力。技术栈Java 17 / Spring Boot 3.2.5 / Spring AI 1.1.2 spring-ai-alibaba 1.1.2.3基础框架MySQL 8元数据、切片记录、聊天历史、索引任务JPAMilvus稠密向量存储embedding 2048 维COSINENeo4j知识图谱HTTP 事务 API 访问Elasticsearch标准 BM25 关键词召回通道MinIO文件对象存储DashScope通义千问 LLM text-embedding-v4 向量模型Spring Security表单登录认证核心架构RAG 流水线索引侧异步任务治理上传MinIO→ 内容 SHA-256 去重/版本管理 → 解析Tika→ 元数据富化启发式 LLM 分类标签→ 分片4 种策略→ 知识图谱抽取 → 向量入库 MySQL 切片 ES BM25状态机IndexTaskPENDING/RUNNING/SUCCESS/FAILED/DEAD指数退避自动重试死信队列 [PIPELINE-ALERT]告警任务看板可手动重试/丢弃问答侧RagService 编排提示词注入检测 PII 脱敏SensitiveInfoGuardService输入/检索片段/图谱/输出全链路查询理解QueryUnderstandingServiceLLM 改写 比较类问题拆分子查询多路召回MultiRecallService向量(Milvus) 关键词(MySQL FULLTEXT ngram) BM25(ES)RRF 融合上下文压缩ContextCompressionServiceMMR 去重 新鲜度过滤 长度截断知识图谱多跳召回问题实体抽取 → 2 跳 BFS 扩展 → 三元组进 prompt受检索过滤约束短期记忆内存 ChatMemory长期存储MySQL按用户刷新不丢失流式回答 参考来源追溯脚注知识图谱人工校对能力三元组抽取/去重HashSet equals/hashCode、按文件来源标记fileIds 多源共享增量更新updateGraph 文件级 diff保留人工合并结果vs 全量构建人工校对 API实体列表/合并/重命名/别名/类型修改/删除、相似实体合并建议数字实体已过滤可视化 多跳召回接口安全与治理检索质量门槛相似度阈值 0.3、注入片段隔离防文档投毒、敏感信息落库前脱敏文件去重/版本管理V1/V2…、激活版提升、恢复历史版、删除时同步清理任务/图谱学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

V-JEPA: 从视频帧到3D时空Token,V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余

V-JEPA: 从视频帧到3D时空Token,V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余

从视频帧到3D时空Token:彻底理解V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余的直觉教程 从视频帧到3D时空Token 1. 第一件事情:视频为什么不能直接扔进 ViT? 普通 ViT 本质上处理的是: T…

2026/8/10 23:34:53 阅读更多 →
2025年论文降重实战:高效工具与技巧

2025年论文降重实战:高效工具与技巧

1. 论文降重实战:2025年高效解决方案 去年指导学弟毕业论文时,他拿着查重率38%的稿子急得冒汗。我教他用几个工具组合处理,三小时后重复率直接降到6.3%。现在这套方法已经迭代到第三代,特别适合被AI检测和传统查重双重困扰的同学。…

2026/8/10 23:34:53 阅读更多 →
大模型推理能力评估与实战:从概念到部署优化全解析

大模型推理能力评估与实战:从概念到部署优化全解析

在 AI 模型领域,性能评估是一个复杂且多维度的议题。当我们谈论一个模型在“非推理”任务上超越 GPT-4o,在“推理”任务上超越 GPT-5 时,这通常意味着该模型在特定基准测试或特定任务集上取得了领先的综合得分。这里的“非推理”可能指代语言…

2026/8/10 23:33:53 阅读更多 →

最新新闻

配置github 部署免费主页

配置github 部署免费主页

Comate帮我写好了网站程序,并一步步告诉应该怎么操作 ai.quye.com 是个好选择——短、有力、直接锚定"AI 编程中心"这个定位,而且不像 pro 那样暗示有免费/付费之分。 我来把它接进构建流程。 Read建站.pyL1-20 定了:ai.quye.com。 我把 …

2026/8/11 0:35:18 阅读更多 →
数据“确权”时代开启——从产权登记到万亿级数据市场

数据“确权”时代开启——从产权登记到万亿级数据市场

8月,中国数据要素市场迎来历史性时刻。8月1日,国家数据局印发《数据产权登记工作指引(试行)》,从登记机构管理、登记流程规范、登记凭证应用等方面作出系统部署,为数据这一无形资产出具“身份证明”。紧随其…

2026/8/11 0:35:18 阅读更多 →
sx_opus2wav 开源项目分析

sx_opus2wav 开源项目分析

sx_opus2wav 开源项目分析 项目地址:https://github.com/smallerxuan/sx_opus2wav 一、项目定位 一句话概括:基于 opuslib / libopus 的轻量级 Opus ↔ WAV 双向转换工具,CLI GUI 双形态,核心解决的痛点是嵌入式设备导出的"…

2026/8/11 0:35:18 阅读更多 →
洛谷P1784 数独 题解

洛谷P1784 数独 题解

题目概述 给定一个数独,求最终填好的数独。(保证有唯一解)。 思路拆分 数独的要求有三个:行,列,九宫格无重复数字。 我们只用dfs搜索每一个点就行了。 由于整个数独可以划分为9个九宫格, 在处理九宫格时我们…

2026/8/11 0:34:17 阅读更多 →
零基础上手知漫剧:如何通过结构化输入解决AI漫剧台词错位

零基础上手知漫剧:如何通过结构化输入解决AI漫剧台词错位

引言 2026年AI漫剧赛道持续火热,但台词错位问题一直是创作者最头疼的技术难点——配音和画面对不上、情绪表达和场景不匹配、不同角色说话方式趋同。这些问题的根源往往不是工具不行,而是输入方式不对。知漫剧(zz.jiaxunai.cn)作…

2026/8/11 0:34:17 阅读更多 →
知漫剧AI漫剧台词同步问题排查:参数调整与优化方案

知漫剧AI漫剧台词同步问题排查:参数调整与优化方案

引言 2026年AI漫剧赛道持续升温,但台词同步问题一直是创作者最头疼的技术难点——配音和画面对不上、口型不同步、情绪表达和场景不匹配。这些问题直接影响观众体验和完播率。知漫剧(zz.jiaxunai.cn)作为一站式AI漫剧制作平台,在…

2026/8/11 0:34:17 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/10 1:05:29 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/10 1:05:29 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/10 1:05:29 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/10 17:07:33 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/10 1:05:29 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/10 17:07:33 阅读更多 →