Agentic RAG:当检索从「流水线」变成 Agent 的一种行为
RAG 这两年被讲烂了但大部分人脑子里的 RAG 还停在 2023 年的那张图用户提问 → 向量检索 → 把召回的几段文本塞进 prompt → 让模型照着生成答案。一条单向流水线检索发生在生成之前且只发生一次。这套经典 RAG 解决了「让模型用上私有知识」的基础问题但真正拿去做复杂业务时它的天花板很快就撞到了。而 Agent 的兴起正在悄悄改写检索这件事的形态。这篇想讲清楚检索范式到底变在哪以及为什么这个变化值得重视。一、经典 RAG 的三个硬伤先说清楚旧范式卡在哪不然没法理解新范式好在哪。第一一次检索定生死。整个流程里只有一次检索机会而这次检索的成败完全取决于用户那句原始提问能不能被向量匹配到对的文档。用户问得含糊、用词和文档对不上、或者问题本身需要换个角度去查——只要这一次没召回到后面生成得再流畅也是错的。模型拿着错误的上下文只会一本正经地胡说。第二检索和生成是断开的没有反馈。检索器召回完就撒手不管了它不知道这些内容到底够不够回答问题。生成模型即使发现「给我的资料里压根没提到这个」也没有任何机制让它说「等等我再查一下」。第三复杂问题需要多跳流水线做不到。比如「对比一下我们 A 产品和 B 产品的退货政策差异」这本质上需要分别检索 A 和 B 的政策、再做对比。单次检索把这句话整个拿去匹配召回的往往是一堆四不像。二、核心转变检索从「预处理」变成「Agent 的一个工具」Agentic RAG 的思路一句话就能概括把检索从生成前的固定步骤变成 Agent 在解题过程中可以自主调用的一种行为。在新范式里「检索」就是挂在 Agent 上的一个工具。要不要检索、用什么 query 去检索、检索一次还是好几次、召回的东西够不够、要不要换个角度再查一遍——这些决策权从写死的流水线交还给了模型自己。defagentic_rag(question,retriever,max_rounds4):context[]for_inrange(max_rounds):# 模型基于当前已掌握的信息决定下一步动作actionllm_decide(question,context)ifaction.typeanswer:returnaction.text# 信息够了作答ifaction.typesearch:# query 由模型生成可能是改写、可能是子问题docsretriever.search(action.query)context.append((action.query,docs))returnllm_answer(question,context)# 触顶兜底对比经典 RAG 那条单向流水线区别就在这个for循环——检索可以发生多次而且每一次查什么是模型看着前面查到的东西临时决定的。三、由此长出来的几个关键模式这个转变一旦发生几个非常实用的模式就自然出现了。查询改写与分解Query Rewriting / Decomposition。模型不再直接拿用户原话去检索而是先把它翻译成更适合检索的 query或拆成几个子问题分别查。前面那个「对比 A、B 退货政策」的例子模型会拆成两次检索先查 A 的政策再查 B 的最后合起来对比。# 模型把一个复杂问题拆成可检索的子问题sub_queries[A产品 退货政策,B产品 退货政策]results[retriever.search(q)forqinsub_queries]迭代检索Iterative Retrieval。第一轮召回不理想时模型能看着结果调整 query 再查一次——「换个关键词」「换个角度」就像人查资料查不到时会做的那样。检索后的自我批判Self-Critique。这是最能体现「Agent」味道的一环召回之后先让模型判断「这些资料足够回答问题吗」够了就作答不够就继续检索。这一步把「检索够不够」这个判断显式地交给了模型而经典 RAG 里这个判断根本不存在。defis_sufficient(question,context):让模型先自检:现有资料够不够作答,不够就触发再检索verdictllm_judge(f问题:{question}\n已有资料:{context}\nf这些资料足以准确回答吗?只回答 够 / 不够 及缺什么)returnverdict.startswith(够)四、别只听好话代价同样真实Agentic RAG 不是免费午餐落地前必须把账算清楚延迟上去了。经典 RAG 一次检索一次生成Agentic RAG 可能要检索三四轮、每轮都有模型推理端到端延迟翻几倍。对要求秒级响应的场景是硬伤。成本上去了。多轮检索意味着多轮模型调用token 消耗显著增加。行为更难预测。检索次数和路径不再固定调试和复现都更难必须配上每一步的检索追踪日志否则线上出问题根本查不动。所以现实里的选型是分层的简单、对延迟敏感的问答老老实实用经典 RAG只有真正需要多跳推理、复杂检索的场景才上 Agentic 这一套。不要因为新就无脑全用那是工程不成熟的表现。五、被忽略的地基知识库的工程与合规讨论检索范式时大家容易只盯着「检索策略」忘了底下还有一整套地基知识库怎么建、文档怎么切分、增量更新怎么做、权限怎么控制——尤其在企业里不同用户能检索到的内容是不一样的你不能让普通员工通过 Agent 检索到 HR 的薪酬文档这套行级/文档级的权限得在检索层就做掉。再加上私有数据不出域、检索链路要审计这些合规要求自建一套完整的知识底座成本相当高。这也是国内一批智能体平台在补的能力——以上海比孚的AgentCore为例作为面向国内合规环境的国产智能体服务商它把知识库管理、权限隔离、私有化部署这类地基性的东西做进了平台层。这里专门说明一句它是国产产品和某些名字相近的海外框架不是一回事选型时注意区分。不过要强调——平台能帮你管好知识底座但检索策略本身拆不拆、迭代几轮、怎么自检依然是需要你按业务去设计的这部分没有银弹。写在最后经典 RAG 没有死它依然是大量简单问答场景的最优解。变化的是当问题足够复杂检索不再适合做成一次性的预处理而应该成为 Agent 解题过程中一种可以反复、自主使用的行为——查不够就再查查偏了就改方向查够了才作答。理解这个从「流水线」到「行为」的转变比追逐任何一个具体的 RAG 框架都更要紧。框架年年换这个思路的转变是会长期成立的。

相关新闻

InfiniSynapse智能工具:小红书内容生成与变现全攻略

InfiniSynapse智能工具:小红书内容生成与变现全攻略

1. 项目背景解析InfiniSynapse这个听起来很"黑科技"的名字,实际上是一种结合内容生成与用户行为分析的智能工具。它最早出现在海外创作者圈子,后来被跨境电商从业者改良后引入国内社交媒体平台。我在去年初第一次接触这个工具时,就…

2026/7/25 2:53:33 阅读更多 →
哲学思维如何优化代码设计与系统架构:概念澄清与逻辑一致性实战

哲学思维如何优化代码设计与系统架构:概念澄清与逻辑一致性实战

1. 先搞清楚这个标题到底在说什么看到“哲学专业学生的复仇”这个标题,很多人第一反应可能是学术界的恩怨情仇,或者是哲学专业学生用专业知识进行某种“反击”。但实际在技术博客的语境下,这类标题往往指向一个更具体的场景:用哲学…

2026/7/25 2:52:33 阅读更多 →
工控存储外设:U 盘/SD 卡自动挂载、插拔检测、文件拷贝备份

工控存储外设:U 盘/SD 卡自动挂载、插拔检测、文件拷贝备份

工控存储外设:U 盘/SD 卡自动挂载、插拔检测、文件拷贝备份工控现场最常见的需求之一:插上U盘,自动把数据拷走,拔掉U盘,数据不损坏。听起来简单,坑却不少。一、Linux USB / SD 卡设备识别机制 当外部存储设…

2026/7/25 2:52:33 阅读更多 →

最新新闻

AI工具链助力个人商业化:从斜杠青年到Solo Founder

AI工具链助力个人商业化:从斜杠青年到Solo Founder

1. 从斜杠青年到Solo Founder的蜕变之路 在内容创作领域摸爬滚打多年后,我逐渐意识到一个残酷的现实:单纯依靠平台流量分成和广告收入的斜杠青年模式,已经越来越难以支撑可持续的商业化运作。直到去年接触到AI技术,才真正找到了突…

2026/7/25 3:08:38 阅读更多 →
基于Mask R-CNN的长曲棍球运动员与装备实时检测技术

基于Mask R-CNN的长曲棍球运动员与装备实时检测技术

1. 项目背景与核心挑战在长曲棍球这类高速对抗性运动中,精准识别球员角色(如进攻手、防守队员、守门员)和装备状态(如球杆位置、护具穿戴情况)对战术分析、裁判辅助和训练优化具有重要意义。传统人工标注方式效率低下且…

2026/7/25 3:08:38 阅读更多 →
智能体技术:从对话到执行的演进与实战

智能体技术:从对话到执行的演进与实战

1. 智能体技术演进的分水岭时刻当ChatGPT在2022年底引爆全球AI热潮时,大多数人关注的是其流畅的对话能力。但真正改变游戏规则的,是随后出现的AutoGPT——这个能够自主分解任务、调用工具并完成复杂工作流的AI系统,标志着智能体技术从"能…

2026/7/25 3:08:38 阅读更多 →
Nginx CPU性能深度优化:从内核调度到QPS提升实战

Nginx CPU性能深度优化:从内核调度到QPS提升实战

1. 项目概述Nginx作为现代Web架构的核心组件,其性能表现直接影响着整个系统的吞吐能力。在实际生产环境中,我们经常遇到CPU利用率无法突破瓶颈的情况——明明服务器还有余力,但Nginx的并发处理能力却卡在一个数值上不去。这背后往往隐藏着操作…

2026/7/25 3:08:38 阅读更多 →
Karpathy准则:65行提示词重塑AI编程协作,从代码生成到结对编程

Karpathy准则:65行提示词重塑AI编程协作,从代码生成到结对编程

如果你还在用“请写出高质量的代码”或者“请优化这段代码”来和AI编程助手对话,那你可能已经落后了。最近,AI编程圈被一份仅65行的文本彻底搅动,它来自前OpenAI联合创始人、AI科学家Andrej Karpathy。这份被称为“Karpathy准则”或“Karpathy提示词”的文档,在GitHub上迅速…

2026/7/25 3:08:38 阅读更多 →
AI产品经理Agent落地实战指南

AI产品经理Agent落地实战指南

1. AI产品经理Agent落地全景指南作为在AI产品领域摸爬滚打多年的从业者,我完整经历了从算法demo到商业落地的全过程。今天这份手册将用实战经验告诉你:如何让AI产品经理Agent真正跑起来,并且跑得稳、跑得远。不同于市面上泛泛而谈的方法论&am…

2026/7/25 3:07:38 阅读更多 →

日新闻

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:00:35 阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:35 阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:35 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻