Rag是什么,Rag的整体技术架构
01LLM的问题RAG的破局 大模型的缺点幻觉在没有答案的时候会提供一些虚假的信息。新鲜度模型知识的更新成本、周期、及大模型的通用能力问题。知识新鲜度的更新模型的训练都有滞后性用当下模型的时候会有知识的缺失。数据安全和隐私等问题。大多数模型的Context Window非常有限模型无法读取所有内容。输入太杂乱会影响模型理解。输入越多模型推理成本高、推理速度慢。RAG就是检索增强生成结合检索系统和生成模型来提高语言生成的准确性和相关性。通过从外部知识库中检索相关信息并将其作为提示Prompt输入给大型语言模型LLMs以增强模型处理知识密集型任务的能力提供更加符合上下文语境的回答。RAG的优势RAG的优势在于它能够在生成响应时引入外部知识提供更符合上下文语境的回答。与预训练模型不同RAG的内部知识可以很容易地修改甚至实时补充。相比微调技术RAG具备可观测性、可解释性等优势还可以有效降低大模型的幻觉问题。知识实时性困境大模型大模型训练数据存在时间截断。RAGRAG通过实时检索最新文档如科研论文/新闻动态扩展模型知识边界。事实准确性困境大模型纯生成模型易产生“幻觉”Hallucination虚构不存在的事实。RAGRAG先检索相关证据文档要求模型严格基于检索内容生成显著降低错误率。领域适配成本问题大模型微调Fine-tuning需要大量标注数据和计算资源。RAGRAG仅需构建领域文档库即可让通用模型输出专业内容如法律/医疗场景。Rag具有的特点可扩展性企业知识库以 TB/PB 计远超长上下文窗口的承载能力准确性长上下文模型存在“上下文悬崖”远未达到理论极限就已性能下降延迟与效率全量输入导致响应慢 成本高RAG能精准定位最相关信息数据隐私支持基于角色的访问控制避免将所有数据暴露给基础模型部署资源受限显存/算力限制无法支持超长上下文如 Qwen-14B 在 A100-40G上仅能接收约20k token实际案例即使百万token窗口也仅相当于1500页文档远不足以覆盖全库RAG系统的组成RAG是一个系统不是单一的组件由多个组件组成的复杂系统LLM只是其中的一个组件。RAG系统组件包括Chunk切块文档如果太大系统会把它拆成小片段。比如《报销手册》被拆成”机票报销“、”酒店报销“、”差旅补贴“。检索时就能更精准不需要把整本手册塞进给大模型。Embedding向量化把文字转成一组数字向量相似的句子距离很近不相关的距离很远。比如”机票报销“和”出差机票费用申请“离得近而和”量子纠缠“则完全不搭界。Vector Database向量数据库存放向量的仓库可以快速找出和问题最相近的几段内容。常见的向量数据库有Milvus、Weaviate、Pinecone等。Retrieval检索除了把切块转成向量用户的问题也会转成向量在向量数据库与其他数据片段比较“距离”距离越近代表内容越相关检索的结果就是找出最相关的几个片段。Generation生成检索到片段 用户问题 → 输入大模型 → 输出自然语言答案。切块、向量化、向量数据库这三部分可以理解为是离线部分去做检索和生成是在线部分做。RAG已死我们总会听到一个词叫RAG已死因为现在大模型有长上下文的能力之后它就可以吃到更多的TOKEN这样的话是不是RAG就没有用了 下面是Meta AI的一个Rag原文作者说他当时做Rag的一个初衷目标结合参数化记忆模型本身知识 非参数化记忆外部检索知识从而扩展语言模型的知识库。解决痛点无法访问私有企业内部数据模型无法访问 私有/专有数据参数知识过时无法实时更新其训练数据截止日期与当前时间之间总会存在差距。幻觉与归因问题模型经常编造听起来合理但错误的信息缺乏可验证来源。错误的二分法RAG vs 长上下文 vs 微调 vs MCP ≠ 你死我活正确认识它们是互补关系RAG → 获取外部知识微调 → 优化处理与应用长上下文 → 承载更多检索信息MCP → 简化工具/Agent集成类比RAG不是“过时工具”而像 硬盘与内存在系统中各司其职结论RAG永远不是“过时替代品”而是AI知识利用的基础设施。真正有价值的方案必然是 检索 长上下文 微调 MCP 的组合拳。传统问答系统 VS 问答对FAQ VS Rag检索增强生成传统问答系统 vs 现代问题系统(RAG)问答对FAQvs RAG检索增强生成基于问答对的问答基于问答对的问答就像一个“预设答案库”。系统会提前整理好一系列问题与对应的答案通常由人工或规则生成当用户提出问题时系统通过关键词匹配或语义向量匹配从库中找出最相似的问答对直接返回答案。它的核心在于高效匹配可以不依赖大型语言模型LLM实现简单且轻量。特点数据结构固定问答对数据库。匹配方式关键词或语义匹配。回答方式直接返回已有答。基于文档的问答RAGRAG是一种更现代的方案。它将文档切分成小块转化为向量存储在知识库中。当用户提问时系统先通过向量检索找到与问题最相关的文档片段再交给大型语言模型LLM生成自然语言回答。RAG结合了检索与生成灵活性更强。特点是数据结构文档切分后向量化存储。匹配方式向量相似度检索。回答方式LLM综合检索结果生成答案。灵活性能推理、组合生成新答案。双层知识库问答第一层FAQ知识库人工标注这是一个高质量、小而精的知识库存储着由领域专家撰写和审核的标准问答对。它专门针对那些频繁发生、具有标准问答对的回答。这一层的目标是提供零偏差的答案。第二层向量知识库文档语料这是一个大规模、广覆盖的知识库包含了操作手册、行业规范、领域文档等海量非结构化文档。通过文本分割、向量化后存储于向量数据库中。它负责处理FAQ知识库未覆盖的长尾问题和复杂查询。02大模型微调和Rag大模型微调RAG的对比03RAG的技术架构RAG的整体技术架构如上图主要分为离线和在线离线就是先进行文本切块再进行分词向量化得到一个向量库索引库索引库可以进行文本索引也可以做一个向量索引。当用户来进行提问之后分别做一个文本混合检索和一个向量检索计算用户的问题与语料库中哪些文本块相似比较相似高的k个块作为答案。检索完之后把数据进行重排序最后返回k个答案文本块给大模型。最后结合提示词工程模板将检索得到的k个块和用户的问题一起送进大模型大模型基于给定的文本块来回答用户的问题。Rag技术演进最开始的Rag是23年用户提问后对这个向量对这些文件进行一个检索当检索完回来之后直接组装成提示词送给大模型就回答了这是最简单的一个方式。更高级点就是在检索做了一个前优化一个后优化。那前优化就是做了一些查询的改写路由分配到哪些知识库这种路由检索完之后我们进行就是对检索内容再怎样进行检索检索完之后了我们在后在那个检索之后进行一个重排序融合这些操作之后最后组装成提示词之后给大模型这是高级进阶的rag。再之后就相当于把RAG拆成模块化RAG并不是一个单一的组件它是多个组件的组合组件就可以认为进行的模块化比如检索是一个组件重排序是一个组件OCR识别也是一个组件好处是可扩展在不同场景有些场景可能不需要重排序有些场景可能需要查询改写就可以对组件可以进行一个可插拔的方式对每个组件单独评估配置这样也好维护各组件之间就是松耦合这个是RAG的一个演进方式。主流开源框架①RAGFlow②QAnythingRAG开源框架对比RAG自研技术架构04RAG的“天地之间”上图是Rag的天地之间。天地之间下边的数据细节每个业务数据都是独一无二的就会有一些隐私数据。第二点就是在进行RAG调试的时候数据是非常重要的。Rag的思想很简单就是检索增强生成我们需要考虑的是如何搭建RAG把RAG进行普适的推广一定要进行数据分析把数据的细节做好。所以这是Rag的一个地一定要踩这个地才行。天是它的系统架构可以认为是一个工程架构。离线、在线怎么做我们要保证的是系统的整体最优而不是局部最优。优化检索、优化大模型也不一定对整体最优。如果检索的策略效果提升了但是检索内容会引入一些杂质需要进行测试才可以而且一些检索办法不一定完全适配于你的业务还是需要尝试的。这是Rag的一个系统架构中间部分是数据细节和系统架构是天地之间的内容是索引构建检索策略生成索引构建包括了离线文档解析、知识入库构建向量embedding还有一些数据库的选型。检索策略包括全文检索、向量检索检索之前用一个多轮的query改写检索之后可以把答案检索内容进行一个整合排序排版把内容送到大模型中。做完之后可能会有一些业务适配的情况需要围绕业务目标去设计流程去来实现场景化的一个落地。中间的索引架构、检索策略都是为了满足系统架构能够非常好可以达到系统架构最优的路径它不能光考虑局部最优还要考虑整体。第一数据可能会存在混淆的情况没法进行很好的问答 所以数据要进行分库进行数据筛选**。**第二过度依赖通用的检索算法比如用全文检索向量检索组合的混合检索如果大部分用户提问都是一些关键词全文检索就能检索到这部分内容就不需要向量检索了全文检索还比较准可靠。向量检索的场景是用户问题提问比较模糊基本不问关键词可能全文检索会拉低向量检索的得分这时就需要分析到底用单一的检索还是混合检索这是第二点误区**。**第三文本拆分的粒度不合理默认的切分方式为256、512这种实际上不同文档的切块方式是不一样的。比如法律类的文章就一大段一大段的切分256可能有点儿太细了512的大小是比较符合的。比如说我们有一些文章内容实际上他没有那么大可能256。所以就可以把接口开放给用户让用户去选择256还是512因为用户更比你更了解业务。第四将误将检索的召回率等同于检索的效果检索召回率的时候会有一些指标如NDCG其实更要关注的是一些精确率、准确率它只是召回来了但实际上得看看它的准确率有多少。拿到召回数据可以看看TOP1、TOP3、TOP5、TOP10的一个结果这样可以确认召回的效果。第五生成阶段过度依赖****大模型大模型可以承接很多上下文就很容易把这些内容直接扔给大模型这样的话会有一些杂质而且还会存在一种什么就是说你比如说你在提示词的时候告诉他基于以上内容进行回答大模型一看上面内容之后也不管这内容是否完全跟用户提问相关就直接回答所以还得在提示词里做一些约束严格基于以上内容进行回复跟用户问题相关。第六忽视用户的查询意图比如用户询问怎么解决手机充电慢的情况因为他的问题是一个偏口语化的检索回来可能就是手机充电原理这种情况就不是完全符合预期。需要增加改写功能把用户的提问改写成偏标准化的问题这样就可以解决检索到无关内容的情况避免检索到无关内容。第七是查询意图的理解除了改写之外还有前置的意图分类。比如有常见问题类有故障类这种问题把这两个数据都放在一个数据源里进行一个问答可能回答的不好因为常见问题会跟故障进行混淆但是把这两个库分开在前面做一个意图分发比如识别的时候用户的问题是跟常见问题相关那就在常见问题库里去检索那它一定是准的比在全库里更准。当用户进行提问之后先进行意图分发确定到哪个知识库后。再进行快速改写、检索。这就是Rag的一个天地之间。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

关于ESP32P4 SD卡读取速率慢的问题

关于ESP32P4 SD卡读取速率慢的问题

关于ESP32P4 SD卡读取速率慢的问题 使用了微雪的ESP32P4 86盒的开发板, 测试发现SD卡读取4.8MB的文件的时间大概是3.5s,速率约为1.4M/s,但是使用官方的SDMMC例程可以达到5M/s,测试发现有这几个问题导致的。通过这几个修改之后&…

2026/7/29 2:34:15 阅读更多 →
Vosk-Browser终极指南:如何在浏览器中轻松实现离线语音识别

Vosk-Browser终极指南:如何在浏览器中轻松实现离线语音识别

Vosk-Browser终极指南:如何在浏览器中轻松实现离线语音识别 【免费下载链接】vosk-browser A speech recognition library running in the browser thanks to a WebAssembly build of Vosk 项目地址: https://gitcode.com/gh_mirrors/vo/vosk-browser 想要为…

2026/7/29 2:33:15 阅读更多 →
图像生成算法:从随机噪声到高质量图像的转换

图像生成算法:从随机噪声到高质量图像的转换

图像生成算法:从随机噪声到高质量图像的转换 在人工智能领域,图像生成算法正以前所未有的速度发展,其核心目标是从随机噪声中生成逼真、高质量的图像。这一技术不仅在艺术创作、游戏设计、影视特效等领域大放异彩,还在医学影像生…

2026/7/30 3:24:11 阅读更多 →

最新新闻

HandBrake视频格式转换:从编码原理到高效压缩的完整指南

HandBrake视频格式转换:从编码原理到高效压缩的完整指南

1. 项目概述:为什么我们需要一个靠谱的视频格式转换器?如果你经常需要处理视频,无论是从网上下载的电影、自己用手机拍的Vlog,还是工作需要的演示材料,大概率都遇到过格式不兼容的麻烦。视频文件后缀名五花八门&#x…

2026/7/30 3:24:19 阅读更多 →
LLM路由技术:原理、实践与优化策略

LLM路由技术:原理、实践与优化策略

1. LLM路由技术全景解析:从核心原理到落地实践在人工智能技术快速迭代的当下,大型语言模型(LLM)作为基础设施正深度融入各类应用场景。但当我们把多个LLM模型组合使用时,如何智能地分配任务请求就成了关键挑战——这就…

2026/7/30 3:24:19 阅读更多 →
SpringBoot组件扫描冲突解决:@ComponentScan excludeFilters五种过滤器详解

SpringBoot组件扫描冲突解决:@ComponentScan excludeFilters五种过滤器详解

1. 从一次“诡异”的依赖冲突说起最近在重构一个老项目,打算引入一个第三方工具库来优化日志处理。按照惯例,我直接在pom.xml里添加了依赖,然后启动应用。控制台一切正常,但当我调用某个核心业务接口时,却抛出了一个Cl…

2026/7/30 3:24:19 阅读更多 →
Godot碰撞形状:从基础原理到实战优化,提升游戏物理交互

Godot碰撞形状:从基础原理到实战优化,提升游戏物理交互

1. 项目概述:为什么碰撞形状是游戏交互的基石在Godot引擎里做游戏,尤其是涉及到物理交互的,你绕不开的一个核心概念就是碰撞形状。这东西听起来挺基础的,不就是个看不见的框框嘛,但实际用起来,你会发现它直…

2026/7/30 3:24:19 阅读更多 →
C# CancellationToken原理与应用实践

C# CancellationToken原理与应用实践

1. 为什么需要CancellationToken?在C#开发中,我们经常遇到需要长时间运行的操作,比如网络请求、文件IO或复杂计算。这些操作有时会因为用户取消、超时或系统资源限制而需要中途终止。传统的做法是使用布尔标志位来控制执行流程,但…

2026/7/30 3:24:18 阅读更多 →
终极SMAPI模组加载器指南:如何轻松打造个性化星露谷物语体验

终极SMAPI模组加载器指南:如何轻松打造个性化星露谷物语体验

终极SMAPI模组加载器指南:如何轻松打造个性化星露谷物语体验 【免费下载链接】SMAPI The modding API for Stardew Valley. 项目地址: https://gitcode.com/gh_mirrors/smap/SMAPI 你是否曾经梦想将星露谷物语变成完全属于你的农场世界?SMAPI&…

2026/7/30 3:23:18 阅读更多 →

日新闻

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:13 阅读更多 →
如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南

如何3步掌握Video Download Helper:网页视频下载的完整实战指南 【免费下载链接】VideoDownloadHelper Chrome Extension to Help Download Video for Some Video Sites. 项目地址: https://gitcode.com/gh_mirrors/vi/VideoDownloadHelper 你是否曾经在浏览…

2026/7/30 0:00:13 阅读更多 →
“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

“双减”后首个AI备课压力测试报告:覆盖32所中小学的176节AI辅助课,暴露4大隐性增负节点

更多请点击: https://intelliparadigm.com 第一章:AI 教师备课辅助 AI 教师备课辅助系统正逐步成为教育数字化转型的核心支撑工具,它并非替代教师,而是通过语义理解、知识图谱与多模态生成能力,将教师从重复性劳动中解…

2026/7/30 0:00:13 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/29 22:18:20 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/29 14:34:28 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/29 15:00:03 阅读更多 →

月新闻