面试官:ReAct 和 Plan-and-Execute,你平时怎么选?你答「看复杂程度」,他听到的是「我没选过」
ReAct 和 Plan-and-Execute 的差别不在难度在「不确定性落在哪」。这篇文章给你一套能当场判定的选型流程以及三种形态各自的失败模式。面试现场 · 大厂 AI 应用岗**面试官**ReAct 和 Plan-and-Execute你平时怎么选**你**看场景。简单的用 ReAct复杂的用 Plan-and-Execute。面试官点点头往椅背上靠了一下「那你上个项目里用的是哪个为什么当时选了它」你说了。他接着问了第三句这一句你没准备过「如果我告诉你那个流程其实可以完全不用 Agent而且更稳、更便宜 —— 你服吗」你愣了一下。因为你从来没有把「不用 Agent」当成一个认真评估过的选项 —— 你只是在两个 Agent 范式里挑了一个。我先把结论放在最前面这道题的分水岭不是你选 ReAct 还是 Plan是你能不能主动说出什么时候不该用 Agent。而这句话的落脚点只有五个字不确定性在哪。01 把「复杂程度」换成两个能当场判定的问题「看复杂程度」字面完全正确但它指导不了任何一次真实决策。因为「复杂」不是工程量词 —— 同一个词在两个句子里指向的东西完全不一样三步、但每步都要调外部 API 且结果不可预测—— 步数少所以「简单」可下一步干什么取决于接口返回什么你写代码时根本不知道。二十步、但流程完全固定的审批链—— 步数多所以「复杂」可每一步走完去哪、什么条件驳回、超额度转谁你写代码时全知道。所以真正的判据是两个可以当场回答的问题跟步数、跟模块数量都没关系问题一 ·下一步动作依赖「执行上一步学到的东西」吗问题二 ·候选动作的集合写代码的时候能穷举吗这两个问题一交叉就是四个格子。而四个格子里有三个的正确答案都不是自主 Agent▲ 两个问题定四格。只有右下那一格自主是必需品你的判断该用哪个判断依据分支能穷举DAG 工作流路径写死在代码里边界情况你能一条条数出来分支不能穷举 但下一步不依赖观察Plan-and-Execute动作空间太大写不全但步骤能在动手前推演出来分支不能穷举 且下一步依赖观察ReAct唯一一格 —— 自主是必需品而不是加分项这张表可以在面试里直接说 —— 它的威力不在于分得多细而在于把**「不用 Agent」变成了一个正式选项**。02 代价是可以算出来的不是「感觉贵」只说场景不说代价等于只答了一半 —— 而且代价这件事能算不用凭感觉。ReAct 的代价为什么是平方级。它的循环是 Thought → Action → ObservationYao et al.arXiv:2210.03629每个循环结束时环境返回一个观察结果这个观察会被并进历史、下一步重发一遍。所以第 n 步的输入 ≈ 系统提示 n 轮历史前 n 步的累计输入大约是 c × n(n1)/2 —— 取 c 为每轮平均 token 数这就是那个「平方」。c 400、n 15 时累计约4.8 万 token同样走 15 步的 DAG 是 15 × 单步常数量级完全不在一个档上。**Plan-and-Execute 的代价是另一种形态。**它只生成一次计划看着是最省的但这份计划是「想出来」的没有经过环境验证。执行到第三步发现前两步的结果和预期不符时它不会主动停下来 —— 它会继续把剩下十步跑完。所以它的风险不在执行在计划本身。▲ 三种形态的赌注、成本、可测试性与失败模式还有一条很少有人提的账复合可靠性。单步正确率 95%、走 10 步端到端只剩 0.95^10 ≈ 60%。这跟范式无关是编排深度的税 —— 所以每多一个自主步骤你都在为不确定性付利息。所以面试里更好的说法不是「ReAct 更贵」而是**「它的输入随步数平方级增长所以我会给它设步数上限。」**一句话里同时有机制、代价和对策。03 中间地带三个手段各自的失败模式ReAct 和 Plan 不是二选一。中间还有三个工程化手段 —— 常被当成「加 buff」但每一个都有自己的翻车方式。说出来立刻和「只在文档里读过」的人拉开差距。3.1 Reflection只在「有客观裁判」的任务上赚钱它的来源是 Self-RefineMadaan et al.arXiv:2303.17651与 ReflexionShinn et al.arXiv:2303.11366前者让同一个模型生成、批评、再改进七个任务上平均约 20% 的绝对提升后者把失败后的反思写进情景记忆下次尝试前先读自己的复盘 —— 相当于不改权重、只改上下文的强化学习。但它必须配停止条件。三种写法按优先级排**①****固定轮次上限。**默认两轮多一轮都是在赌它这次能想到新东西。**②****分数不再提升就停。**适合有打分器的场景没打分器就别硬造一个。**③****交给客观检查器裁决。**单元测试过没过、SQL 跑不跑得通、JSON 过不过 schema —— 有这类裁判的任务反思最稳。最典型的翻车把「反思」做成了「重试」模型只是换个说法把答案重写一遍没引入任何新信息。判断方法很直接看第二轮有没有带来第一轮没有的东西新的工具调用、新的检索、新的报错。没有就是空转。所以判据一句话 —— 有客观裁判的任务反思稳定赚钱纯主观任务它经常把输出改得更长、更啰嗦反而更不像人写的。3.2 Cost Tiering别把「执行」降级成读不懂计划的模型道理很直白规划只调用一两次执行要调几十次钱该花在规划上。但有个容易忽略的坑 ——规划模型和执行模型能力差太大时计划会「落不了地」强模型给出 12 步精巧计划弱模型在第 3 步就理解错了工具参数省下的钱会在重试和错误里加倍还回去。所以只降「执行」这一档别降「理解」这一档。这条也能量拿你的真实工具集跑 50 条 case统计工具名选对率与参数填对率别只看它会不会聊天。3.3 动态重规划靠信号触发不靠模型「觉得」不能等模型自己说「我觉得这个计划不太对」。人的判断可以模糊工程系统的判断必须可观测。四个可以落盘的触发信号①连续两步的观察结果缺字段或类型不符 —— 说明环境给的东西和计划假设的不是一回事。②同一个工具连续失败两次以上 —— 换参数没用该换路径了。③相邻两次观察的相似度极高 —— 这是「原地打转」的典型信号。④已用步数超过原计划的 1.5 倍 —— 计划已经和现实脱节了。再加一条上限重规划最多两次—— 没有上限的重规划会把预算烧在反复推翻自己上失败模式和没有停止条件的 Reflection 一模一样。04 混合架构自主决策点只能收在三类位置最稳的形态不是纯 DAG 也不是纯 Agent而是一条确定的 DAG 主干中间嵌一到两个自主决策点。比「嵌几个」更重要的是嵌在哪—— 只有三类位置值得放① 入口路由点分支没法枚举时的意图判定。如果分支能枚举退款 / 换货 / 咨询 / 投诉用规则或小模型做路由就行不必上 Agent。② 需要外部世界状态才能决定的点比如「这个订单现在能不能退」取决于一次查询的返回 —— 你没法在写代码时把答案写死。③ 失败自愈点重试、换工具、降级到哪条兜底路径。这类决策的输入是错误信息天然适合让模型现场判断。反过来有三类位置看着像决策点其实不该放✕****把工具调用本身当决策点。「调哪个函数、传什么参数」能枚举的话那不是自主是没写完的 DAG。**✕****同一条链上放三个以上决策点。**复合可靠性会把它拖垮出问题时你连第一现场都定位不到。**✕****在不可逆动作前放自主决策点。**付款、删数据、发公告前面要有确定性的闸门 —— 该上人工确认不该让模型拍板。05 多智能体难的不是分工是四件工程事Supervisor / Orchestrator 那张分工图谁都会画主控做意图识别、任务拆解、路由分发子 Agent 各司其职。真正难的是下面四件事。一 · 状态共享先定「谁是唯一真相源」如果两个子 Agent 会并发写同一份状态用消息传递加一个唯一的聚合者别共享可变内存。共享记忆当草稿纸会出现上下文不一致 —— A 已经改了状态B 还在用旧值推理这种 bug 不报错只让结果悄悄偏掉。二 · 上下文不爆炸子 Agent 只回传结论把主控上下文分成三块目标与约束固定不改、子 Agent 的结构化结论每份压到两百 token 以内、决策日志滚动截断。那二十条工具调用记录留在子 Agent 自己的 trace 里。为什么必须这么狠 —— 模型对长上下文中间位置的利用率明显低于开头和结尾Lost in the MiddleLiu et al.arXiv:2307.03172过程塞满主控等于把关键结论推到它最不看的地方。三 · 失败处理四件事必须在写第一行代码前定好超时阈值、重试上限与退避、降级路径、终止条件。最怕的是 Agent 互相甩锅A 说 B 没给数据B 说 A 没说要什么—— 根因通常不在模型在契约里没写清输入 schema 和缺失时的行为。四 · 可观测性trace 要能回答三个问题谁调的、传了什么、花了多少 token。多 Agent 还要加两样把 span 按 parent 串起来否则还原不出调用树、记下「为什么调这个工具」否则只看得到动作看不到理由 —— 出问题时那才是第一现场。06 先有刹车再谈方向盘Agent 落地最容易被忽略的两个工程问题恰好都在「能力」之外。6.1 终止条件三条一起上而且要有优雅退出步数上限硬顶比如十五步、重复动作检测把 action 加参数做 hash重复就停、相邻观察相似度原地打转时连续两次观察会高度相似。为什么只靠步数上限不够真跑偏的时候它会在十五步里认认真真地做十五件错事。步数上限只能保证它停下来保证不了它停在对的地方。补一条很多人不写的撞上限时要能优雅退出带上「做到了哪一步、还缺什么」而不是抛一个空错误 —— 这条决定了线上出问题是三分钟定位还是三小时。6.2 评测能上线的那个数是 pass^k不是平均成功率基础四个指标任务成功率、平均步数别人五步你十二步就是规划能力差、工具调用准确率选错工具、参数填错各占多少、人工看轨迹结果对了但过程离谱上线迟早出事。但真正决定能不能上线的是pass^k同一个任务连续 k 次都做对的概率。τ-benchYao et al.arXiv:2406.12045报告过一组很说明问题的数 —— gpt-4o 在零售域 pass^1 约 61%pass^8 却掉到约 25%也就是连续八次做对的概率只有四分之一。对 To B 交付来说这个数比平均成功率重要得多客户不会因为你偶尔答得漂亮就续费但会因为你不稳定而退货。另外提醒一句 ——跨 scaffold 不可比同一个模型在不同 harness 下根本不是一个分数看到榜单先问「哪个 harness 跑的、评测集修过没有」比记住那个数字有用。07 三句容易说过头的话这几条流传很广但一说重就会被面试官顺着反杀。✕「ReAct 比 Plan-and-Execute 更先进」它们是两个正交的赌注不是版本号。判断标准是「下一步动不依赖观察」不是「谁更自主」。✕「复杂任务就该上自主 Agent」Anthropic 在 Building Effective Agents 里的原话是「find the simplest solution possible, and only increase complexity when needed」。翻成工程口径就是一句铁律能用 DAG 工作流解决的就不要用自主 Agent—— 可复现改一句 Prompt 能定位到节点、可测试每个节点能写单测、可计费token 能提前算这三样自主 Agent 一样都给不了。✕「多智能体一定比单体强」每加一层编排就多一层复合失败率0.95^10 ≈ 0.60 的算术对多 Agent 同样成立子 Agent 又不继承主控的对话历史信息传递本身就要丢一遍。分工不是难点守住分工的收益才是。回到面试官那一问「ReAct 和 Plan-and-Execute你平时怎么选」—— 现在你可以这样答我不会先选范式我会先问两个问题下一步动作是否依赖上一步的返回以及候选动作能不能在写代码时穷举。如果分支能穷举我的答案是 DAG 工作流不管它看起来复不复杂。只有落在「分支不可枚举 下一步依赖观察」这一格我才上 ReAct —— 而且会同时把终止条件和 pass^k 的验收线一起定下来。Plan-and-Execute 我用在另一种情况动作空间太大写不全但步骤能在动手前推演出来。它的风险不在执行在计划没经过环境验证所以我一定会给它配一套基于信号触发的重规划而不是等它自己「觉得不对」。最后补一句我都是按代价选的 —— ReAct 必须有步数预算DAG 必须有兜底路径。没有代价的方案不存在。再回到开场那句 ——「如果我告诉你那个流程其实可以完全不用 Agent而且更稳、更便宜你服吗」现在你能答的不再是「服」或「不服」而是一张表四个格子里哪一格该用它哪三格不该。面试官真正想确认的从来不是你会不会用 Agent而是你有没有技术判断力 —— 什么情况下坚决不用什么情况下它才是唯一解。从「看场景简单的用 ReAct」到「我用两个问题把这次需求定位到左上格所以答案是 DAG」—— **这就是差距。**能讲出这条边界比能背出十个 Agent 框架更有说服力。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

软件项目管理实战:从需求到收尾的全流程方法与避坑指南

软件项目管理实战:从需求到收尾的全流程方法与避坑指南

做软件项目管理这些年,我最常被同行问的一句话是:项目又快又稳的秘诀到底是什么?说实话,不存在什么万能秘诀,但所有做得好的项目,背后都逃不开几件基础事——需求聊透、范围控住、节奏稳住、人盘活。这篇文…

2026/9/26 4:15:00 阅读更多 →
基于卷积神经网络(CNN)的个性化定制表情系统的设计与实现机器学习实战项目python数据分析与可视化

基于卷积神经网络(CNN)的个性化定制表情系统的设计与实现机器学习实战项目python数据分析与可视化

✅源码获取: 🍅--------------------【点击左上方头像,在置顶文章上方的wx】联系我们-------------🍅✌网站介绍:✌10年项目辅导经验、专注于计算机技术领域学生项目实战辅导。✌服务范围:大数据、机器学习…

2026/9/26 4:14:00 阅读更多 →
AI检测在线免费接口批量调用踩坑,我把流水线返工了3次

AI检测在线免费接口批量调用踩坑,我把流水线返工了3次

上周三凌晨两点我对着流水线的红色报错页面,差点把机械键盘敲出键程异响。当时为了赶内容合规的自动化流程,图省事接入了AI检测在线免费的能力,结果没捋清楚细节直接上线,连着踩了三波坑,返工三次才跑通。我们组Q3接了…

2026/9/26 4:14:00 阅读更多 →

最新新闻

具身智能遇上嵌入式操作系统:实时性、异构算力与混合部署实战解析

具身智能遇上嵌入式操作系统:实时性、异构算力与混合部署实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/26 4:54:23 阅读更多 →
Windows原生工具远程连接Ubuntu桌面:RDP与SSH配置实战

Windows原生工具远程连接Ubuntu桌面:RDP与SSH配置实战

1. 两条原生通道:RDP和SSH,先摸清它们的分工1.1 大多数人的认知盲区:Windows的"远程桌面连接"不只是能连Windows先回答最核心的疑问:Windows自带工具到底能不能连接Ubuntu桌面版?答案不仅能,而且…

2026/9/26 4:54:23 阅读更多 →
告别孤立背词:Echo Loop难句收藏+语境化闪卡复习,原句上下文记忆完整用法

告别孤立背词:Echo Loop难句收藏+语境化闪卡复习,原句上下文记忆完整用法

告别孤立背词:Echo Loop难句收藏语境化闪卡复习,原句上下文记忆完整用法 【免费下载链接】Echo-Loop Echo Loop 是一款科学、高效的 AI 英语听说训练 App,通过精听、跟读、盲听、复述和间隔复习,自动驱动学习者把每一段音频真正练…

2026/9/26 4:54:23 阅读更多 →
数据驱动收敛增强器:为CFD伪时间推进装上自动变速箱

数据驱动收敛增强器:为CFD伪时间推进装上自动变速箱

做CFD计算的人恐怕都有过这样的经历:一个跨声速复杂构型,网格量两千万起步,伪时间推进跑了三天,残差还在1e-4附近磨蹭,忽上忽下就是不下去。以前碰到这种问题,常规操作是调CFL数、换隐式格式、开多重网格&a…

2026/9/26 4:54:23 阅读更多 →
VSCode离线安装Python插件实战指南

VSCode离线安装Python插件实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/26 4:54:23 阅读更多 →
还在简历里写“熟悉Vue”?飞算JavaAI已经让Java后端独立交付项目

还在简历里写“熟悉Vue”?飞算JavaAI已经让Java后端独立交付项目

目录前言一、Java后端的求职差距,藏在交付边界里求职溢价来自更大的责任范围二、从一段社区治理需求开始提交完整业务需求三、先让AI把业务关系拆清楚14个关键点覆盖治理全流程9张数据表建立业务关联四、前后端围绕同一套规则生成Java后端负责业务判断与验收五、完整…

2026/9/26 4:53:23 阅读更多 →

日新闻

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、…

2026/9/26 0:00:25 阅读更多 →
学校官网模拟全流程实践:从页面布局到后端接口与部署

学校官网模拟全流程实践:从页面布局到后端接口与部署

如果你正在找一门 Web 大作业的题目,或者刚开始接触 Web 前端开发想做点能拿来展示的东西,“学校官网模拟”几乎是最稳的选择。题目看着简单,但要把导航、新闻列表、轮播 Banner、二级页面、后台数据都串起来,其实已经把前端布局、…

2026/9/26 0:00:25 阅读更多 →
超级玛丽游戏源码C++:从零搭建横版跳跃游戏工程

超级玛丽游戏源码C++:从零搭建横版跳跃游戏工程

简介:这是一份面向游戏开发初学者与C进阶学习者的超级玛丽(超级马里奥)游戏源码,基于C面向对象编程实现,适合想通过经典项目理解游戏主循环、角色类设计、地图关卡加载与物理碰撞检测的读者参考。压缩包共49个文件&…

2026/9/26 0:00:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/25 19:27:14 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/25 11:15:26 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/25 20:29:09 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/25 20:29:43 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/25 20:29:31 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/25 19:27:26 阅读更多 →