本文是《执行缝隙》The Execution Gap的作者手记。 它不是书籍正文的摘要或重写而是围绕本章问题、工程背景与写作之后的进一步思考。过去两年里随着 Agent、工具调用和自动执行逐渐进入真实业务系统很多原本存在于软件工程里的问题突然变得更像“AI 问题”。一条错误判断过去可能只影响一个页面、一个用户或者一次操作现在却可以连续调用多个系统一个参数如果被错误理解过去可能还会经过人工确认而 Agent 可以在几秒钟内把它带进下一个工具、下一次调用和下一轮判断一个结果如果重新进入模型上下文还可能继续成为后续动作的输入。于是当这些系统最终出现现实后果时一个非常自然的结论就是这是 AI 带来的风险。这个说法并不完全错。问题在于它经常把两个不同的问题压缩成一句话。AI 确实可以让一次偏差传播得更快、覆盖更多对象、跨越更长的工具链也可以减少过去由人工步骤自然产生的停顿和纠正机会。但这些变化回答的是一个已经出现的问题后来能够发展到什么程度。它们还没有回答另一个更早的问题为什么这次偏差最初能够成立写第八章时我越来越觉得这两件事情如果不分开几乎所有关于 Agent 安全的讨论最后都会被重新压回模型能力本身。AI 最明显的变化是把执行链里的摩擦拿掉了传统业务系统里存在很多并不是为了安全而设计的“摩擦”。一个人需要打开页面需要确认数据需要切换系统需要等待审批需要重新登录有时候还要把一个系统中的内容人工复制到另一个系统。这些步骤效率并不高很多时候甚至令人厌烦但它们客观上给错误传播留下了时间。一个异常参数可能在下一位操作人员那里被发现一项不合理结果可能在重新输入时被质疑一个自动任务因为需要人工继续推进而停在半路。Agent 正在把这些摩擦快速消除。它可以从一个系统读取上下文自己选择工具生成调用参数读取结果再根据结果决定下一步动作。过去需要多个岗位完成的执行链可以被连接成一个连续过程。从生产力角度看这正是 Agent 最有价值的地方。但从执行风险角度看这也意味着过去那些并非刻意设计、却客观存在的中断点正在消失。一旦前面的某个必要关系已经失效后面可能再也没有一个天然的停顿迫使系统重新看一眼。所以 AI 的确改变了很多东西。它改变速度改变规模改变执行连续性改变工具能够深入现实系统的程度也改变一次偏差被发现以前还剩下多少时间。但这些变化仍然没有解释最开始那条关系为什么会断。如果一个动作已经和原来的批准对象脱钩增加人工确认可能让人更有机会发现它但“确认次数变多”并不会自动把这两个对象重新绑定起来。反过来Agent 把确认步骤去掉也不意味着它因此创造了最初的绑定失效。这里的因果位置必须保持清楚。“AI 放大了它”和“AI 制造了它”之间差得很远这是这一章里我最想保留下来的一条区分。假设同样一个参数已经超出了原来获得批准的范围。在一种系统里这个动作需要人工逐层确认最终可能在第三个人那里被发现并停止在另一种系统里Agent 可以连续完成后面的调用因此几秒钟以后动作已经真正发生。两种系统的现实后果可能完全不同。后者显然更加危险。但最初的结构问题其实一样当前动作已经不再被原来成立的批准完整覆盖。Agent 改变的是这个问题能够传播多远而不是让这个关系第一次失效。这也是为什么我最终把 Amplification 放在“横切修饰项”的位置而没有把它加入前面的五类直接机制。前面五类机制回答的是偏差通过什么结构位置获得了继续进入现实的条件。Amplification 回答的则是一旦这个条件已经出现偏差接下来会跑得多快、走得多远、影响多少对象以及系统还剩多少机会发现和阻止它。把这两个问题混在一起会带来一个非常现实的误区我们可能不断通过降低自动化程度来减轻风险却没有真正修复那条已经失效的关系。增加一次人工确认可能降低传播速度。减少 Agent 连续工具调用可能缩小影响范围。把高风险动作拆成多个步骤也可能增加纠正机会。这些都可能是有效的工程措施。但如果真正的问题仍然存在那么我们做的是控制后果而不是消除成因。两者都重要却不应该被描述成同一件事。没有明显放大Execution Gap 仍然可以成立第八章里 Waymo 的案例对我很重要并不是因为它的后果特别严重恰恰相反它的重要性来自后果并没有被显著放大。在当前十七个正式核验案例里Amplification 有十二个 Strong、四个 Partial只有一个 None而这个 None 就是 Waymo。这件事提供了一个很干净的边界。如果 Amplification 真的是 Execution Gap 成立的必要条件那么每一个已经成立的案例里都必须存在放大。只要有一个已经成立的执行缝隙案例在 Amplification 上仍然是 None这个必要条件的说法就不能继续成立。这并不能证明放大不重要。相反大部分案例都不同程度地出现了放大AI 和自动化也显然能够让放大变得更加剧烈。它真正否定的是另一句话没有放大就没有 Execution Gap。这句话不成立。这个区别看起来有些学术但对工程判断非常重要。如果我们把严重程度、影响规模和 Execution Gap 本身绑定在一起那么一个影响一百万人、持续几个小时的大事故会被认为比一次只影响一个对象的小偏差“更像”执行缝隙。可执行缝隙判断的从来不是后果够不够大。它判断的是已经成立的对象与最终现实执行之间那些必要关系是否仍然成立。一个只影响一个对象的偏差可以拥有非常清楚的 Execution Gap一个造成巨大损失的事故也可能首先属于完全不同的问题。后果大小应该在后面讨论而不是反过来决定概念是否成立。当前没有发现一种“只有 AI 才会有”的一级机制这一章还有一个我觉得很重要、但必须非常克制表达的结论。在当前材料里我们没有发现一种只有 AI 或自动化出现以后才存在的一级 Execution Gap 机制。这句话如果说得太快很容易被理解成“AI 没带来新问题”。不是这个意思。Agent 显然增加了很多过去没有如此集中出现的工程难题。它可以自主选择工具动态改变调用顺序根据中间结果重新规划动作还可能跨越多个组织和系统边界。执行链因此变得更加动态变化入口更多路径更复杂反馈也更连续。这些都是真实的新工程条件。但“工程条件发生巨大变化”和“必须新增一个一级失效机制”并不是同一件事。目前看到的很多所谓 AI 新问题继续拆开以后仍然可以落回原来的那些位置判断与绑定是否仍然成立实际路径有没有偏离执行边界有没有覆盖当前能力状态和结果有没有被混淆以及参与后续动作的 Evidence 是否仍然具有当前资格。AI 会让这些问题更频繁地受到压力也会让多个问题在同一条链上迅速组合出现。可是组合变复杂并不自动意味着必须增加一个新的基本机制。所以这一章真正的表述只能是当前材料没有发现 AI 或自动化独有的一级执行缝隙机制。“当前材料没有发现”和“不存在”中间有一道非常重要的边界。前者是一个有范围的研究结论后者则是一个几乎无限的断言。如果以后出现一个经过事实核验的现实案例现有五类机制无法解释它而且这个新结构具有独立对象、独立因果位置并能够重复出现那么这套结构就应该重新打开。我觉得这也是面对 AI 系统时非常重要的一种态度既不能因为它很新就预设所有问题都是新机制也不能因为现有理论暂时能够解释就宣布以后不可能出现新东西。模型更强并不会自动让执行链完整关于 AI还有一种比“AI 是成因”更深的直觉Execution Gap 会不会其实只是当前模型还不够可靠留下的问题这种想法很自然。今天模型会幻觉会误解上下文会遗漏条件会在长任务中偏离目标。随着模型能力继续提高这些问题中的一部分当然会减少那么执行风险是不是也会随之慢慢消失这里必须重新回到第一章已经建立的“可错性”。能力提高和可错性消失并不是同一件事。一个更强的模型可以在更多任务上判断正确可以理解更长的上下文也可以更准确地使用工具但这些能力并不能替它建立执行链中其他对象之间的关系。模型完全可能正确理解了人的意图后续某次参数转换却失去了关键条件模型可以做出一个完全合理的动作计划但现实状态在真正执行以前已经变化模型本身没有任何幻觉执行系统仍然可能把一个阶段状态当成最终结果甚至模型的所有判断都正确执行边界仍然可能没有限制住动作的现实作用范围。这些问题并不依赖模型先犯一个“智能错误”才能成立。所以我越来越不愿意把 Execution Gap 简化成 hallucination 或 model error。幻觉当然是风险。模型错误当然也会成为执行链中的重要输入。但 Execution Gap 关注的是一个更大的问题从意图、判断和授权一路走到现实结果的过程中那些必须独立保持的关系有没有继续成立。一个非常聪明的主体同样不能替这些关系作保证。这也是为什么“未来模型足够强以后这些问题自然会消失”并不是一个可以依赖的安全假设。我们当然应该继续提高模型能力。只是安全边界不能建立在“以后它大概不会再判断错”上。真正属于 AI 的是放大的速度和深度把 AI 从一级成因的位置移开以后并不会让 AI 在这套理论里变得不重要。恰恰相反我觉得它真正的位置反而更清楚了。AI 最值得警惕的不是它凭空发明了一种过去不存在的 Execution Gap而是它第一次能够如此大规模地同时放大已经存在的那些缝隙。一个错误过去可能停留在单个动作现在可以形成级联。一个结果过去只是结果现在可以立即成为下一轮输入。过去一个人只能同时操作少数对象现在同一个 Agent 可以把动作扩展到成百上千个目标。过去不同工具之间需要人工切换现在一个 Agent 可以把它们连接成连续工具链。更重要的是随着自动化连续性提高系统留给纠正的天然机会会越来越少。这些变化没有创造 Execution Gap却能够改变它最终呈现出来的现实形态。这也是我认为 AI 时代执行安全会变得越来越重要的原因。不是因为过去没有这些问题。而是因为过去系统里很多尚未被正式设计成安全机制的“摩擦”正在被效率优化一点一点拿掉。当这些摩擦消失以后如果真正的执行边界仍然没有建立那么我们失去的不只是人工步骤而是原本偶然存在的最后纠正机会。后果有多大和缝隙为什么存在仍然必须分开这一章最后还留下了 Blast Radius。这是一个非常直观、也很容易再次混淆的问题。一次偏差已经进入现实以后它究竟会影响多少对象、多少资金、多少设备、多少用户当然极其重要。未来 AI Agent 能够同时操作越来越多现实资源以后这个问题甚至会成为很多系统最直接的风险指标之一。但灾难半径仍然属于结果面。它不能反过来决定 Execution Gap 是否成立。如果我们以后建立了一套完整的 Blast Radius 度量能够准确计算一个动作最多影响多少账户、多少资产或者多少物理设备这套能力会非常有价值。可它测量的是后果潜力。它仍然没有回答偏差为什么能够进入现实。所以我宁愿在这里把这个问题明确留空也不希望为了理论结构看起来完整提前给后果范围制造一套并没有充分依据的刻度。为什么形成缝隙和形成缝隙以后能够造成多大的后果是两件不同的事。把它们分开以后AI 的位置也就更加清楚。AI 不是成因也绝不是无关变量写完这一章以后我觉得关于 AI 最容易犯的两个错误刚好处在两个极端。一种是把几乎所有新的执行风险都归因于 AI于是系统里的绑定、路径、边界、状态和证据问题全部被压缩成“模型还不够可靠”。另一种则是在发现这些问题原本就存在以后反过来说 AI 其实没有带来本质变化。我都不认同。AI 没有创造这些基础关系但它正在改变这些关系所承受的压力。它让动作更快让工具链更长让反馈更连续让传播范围更大也让现实改变之前能够停下来的机会越来越少。所以 AI 的位置既不是“根机制”也不是“无关背景”。它是一个非常强的放大层。而当一个系统拥有越来越强的自主执行能力以后真正应该建立的安全能力也不应该只是让模型更加聪明而应该确保无论模型多强、动作多快、工具链多长那些决定现实是否可以被改变的必要关系仍然能够独立成立。到这里第七章和第八章连续完成了两次排除。Change 不是成因。Amplification 也不是成因。但两者都很重要。而当这些最显眼的因素都被从成因的位置拿开以后下一个问题就更加基础了现实里有很多错误结果。它们是不是都应该叫作 Execution Gap如果不是这个概念真正的外边界在哪里关于《执行缝隙》《执行缝隙》The Execution Gap是Execution Engineering Trilogy第一卷。本书讨论一个基础而关键的问题从人的意图到机器最终改变现实世界中间究竟发生了什么在线阅读繁體中文版 執行縫隙 | Havenlon ResearchEnglish Edition The Execution Gap | Havenlon ResearchAmazon Kindle Amazon.com: The Execution Gap: The Structural Discontinuity Between Intent and Action (Execution Engineering Trilogy Book 1) eBook : Wang, Lin, Wu, Mengting, Zhang, Yong, Deng, Jiang: Kindle StoreAmazon Paperback The Execution Gap: The Structural Discontinuity Between Intent and Action (Execution Engineering Trilogy): Wang, Lin, Wu, Mengting, Zhang, Yong, Deng, Jiang: 9798177903347: Amazon.com: Books© 2026 Lin Wang / Havenlon.本文为作者手记与《执行缝隙》正式书籍正文相互独立。 未经授权请勿全文转载或用于商业再出版。 引用请注明作者及出处。