Agent三层架构 Harness-Loop-Graph
做 Agent 的人最近吵得最凶的一个话题Harness、Loop、Graph 到底有什么区别。说实话这三个词确实容易混。怎么说呢。它们都在讲同一套模型的事有时候都涉及「循环」而且每一层都直接影响可靠性。但你把它们当成同义词的那一天起你搭出来的 Agent 就注定只能跑 demo。今天把这三层掰开了说清楚。什么是 Harness什么是 Loop什么是 Graph。每一层解决什么问题。你自己搭的 Agent 崩在哪一层。三十秒讲完三层Harness 造的是模型外面的整个运行环境。工具在哪查、文件在哪写、权限怎么管、状态怎么记。全是 Harness 的事。坦率的讲Loop 设计的是重复干活自我纠正的反馈循环。做完了查一下没过就再来一遍有证据才停。Graph 把工作流拓扑画成显式的有向图。节点干什么边往哪走什么时候分叉什么时候合并哪一步要人等。全搬到图上。脑子里记一个顺序就够了。环境反馈流程。Harness。模型坐在里面的那层壳LangChain 有一句话说得特别好。Agent 就是模型加上 Harness。Harness 是模型之外一切能跑起来的东西系统提示词、工具定义、内存、文件系统、沙箱、模型路由、握手转交、中间件钩子、压缩、权限、日志、验证接口。OpenAI 的 Agents SDK 从运行时的角度说了同一件事。Runner 调模型、执行工具调用、处理转交、携带状态、只在到达真正的终止条件时才停。Harness 这个叫法之所以有用是因为它把注意力从模型崇拜上拽开了。两个团队用同一个底模出来的东西可以天差地别。不是模型不一样是 Harness 不一样。一个给模型干净的工具、稳定的工作区、受限的权限、可观察的状态另一个给一句模糊的提示词加一个不稳定的 API 壳。智能是相似的。工作条件不是。一个完整的 Harness 通常包含这些。上下文注入指令、检索到的信息、会话状态、技能、任务策略。执行面API、浏览器、终端、代码解释器、数据库、MCP 工具。持久化文件、检查点、会话日志、git 历史、长期记忆。执行控制超时、重试、预算、模型路由、子 Agent 拉起、审批门。安全治理权限、隔离、白名单、密钥处理、人工授权。可观测trace、工具输入输出、状态迁移、成本、延迟、评估结果。你试试把模型从你的架构图里删掉。剩下的那些东西工具、数据访问、状态存储、沙箱、中间件、验证器、重试策略、UI差不多全是 Harness。Anthropic 在长程编程任务里发现了一个很典型的问题。光做上下文压缩不够。他们做了一个精良的架构初始化器、进度文件、git 历史、增量工作的记录规则保证每个新的上下文都能理解发生了什么和接下来该干什么。这不是靠改 Prompt 搞定的是靠改 Harness。我觉得什么时候该在你自己的 Harness 上花时间。Agent 缺能力的时候。Agent 断开重连后状态回不来的时候。Agent 能碰到不该碰的东西的时候。Agent 的行为在不同环境里不一样的时候。Loop。别再写「再试一次」了每个用了工具的 Agent 都自带一个小循环。调模型看结果跑工具把工具输出塞回模型再来一圈直到出最终答案。但当你有意地在外面再叠一层或几层循环的时候Loop 工程才真正开始。验证循环。Agent 产出内容之后外挂一个确定性校验或者评分器跑一遍拿到具体反馈只在真有问题的时候重做一轮。事件驱动循环。定时到了、webhook 来了、新文档到了Agent 被唤醒跑一圈。改进循环。跑完之后分析 trace 和失败案例改指令或者工具配置再测一遍新版本是不是更好。LangChain 今年把所有 Agent 架构称为「叠循环」不是一个 while(true) 就完事的。一个合格的 Loop 至少要包含这些。触发器用户请求、定时任务、测试失败、新数据、评估反馈。目标一个明确的状态描述不是模糊的「继续优化」。状态和记忆下一圈需要什么信息不用重放全部历史。执行策略Agent 可以改什么、调什么、花多少。证据测试通过、schema 校验、引用来源、diff、指标、人工审核。退修反馈紧凑且可执行的失败原因。停止条件成功、预算耗尽、超时、不可恢复错误、人工升级。验证循环就是把 Agent 的原生循环包了一层外部评分器和明确的通过条件。不要在置信分数上循环。在证据上循环。「模型说它做完了」不是一个停止条件。「测试通过、链接有效、schema 校验过、审稿人批了。真的真的」才是。有一说一Prompt 告诉模型一次调用里该干什么。Loop 告诉系统调用之后该干什么怎么观察结果、怎么选反馈、怎么判断是否继续、怎么持久化进度、怎么停止。Prompt 质量还是重要的但 Loop 把一条一次性指令变成了一个受控过程。主要代价是金钱和延迟。每一个评分器、审稿人、重试都等于多跑一次模型。Anthropic 给的一个大原则是优先用最简架构能用就行只在性能收益能覆盖成本的时候才往上加复杂层。Loop 也遵循同样的道理。失败成本比验证成本高的地方才叠 Loop。Graph。别让「下一步」活在代码里Graph 工程问的是一个不同的问题。不只是 Agent 做了什么是什么组件下一步可以做什么。节点表示步骤边表示允许的顺序。边可以表达顺序、条件分支、并行展开、交汇合并、循环、人工中断。状态在图里流转拓扑图让控制流可以被检查和验证。LangGraph 是长程、有状态 Agent 的底层编排基础设施。有持久执行、状态管理、人在回路控制明确地把重点放在控制 Agent 上而不是抽象掉工作流。微软 AutoGen 的文档说得最直接当你要精确控制 Agent 的先后顺序、不同结果走不同的下一步、确定性分支、多步复杂流程带循环的时候用 Graph。Graph 工程师实际在决定什么。节点边界哪份工作属于确定性函数、LLM 调用、专家 Agent、人工审核。状态 schema每个节点能读什么、能改什么并行更新怎么合并。路由条件什么证据把工作流推向前、推向后、推向侧线、推出升级。并发什么能并行跑什么必须等什么共享资源需要协调。循环和出口哪里可以重试最多试几次什么让循环安全。持久性检查点在哪中断后执行怎么恢复。上面这些让 Agent、Skill 和它们之间的关系可以作为一个组合系统被检查。Graph 工程是工程化的图执行不是知识图谱那件事。什么时候值得画图。流程有明显分支、有并行任务、有审批门、有恢复路径、有多个专家 Agent 的时候。不值得画的场景也简单就是「给一个 Agent 三个工具让它自己干」。怎么说呢。图能改善调试但也可能过早地把假设冻成一张僵硬的图纸。如果模型需要在运行时动态规划路线你把每一条可能的路径都硬画进去系统只会变得更脆弱。三层怎么在一套系统里协同想象一个研究发布 Agent它的任务是产出一份有数据支撑的行业简报。Harness 层供给沙箱、文件系统、浏览器、API 工具、权限、持久化状态和审批记录。Graph 层定好研究到分析到撰写到审核到发布的流程和每个节点的状态跳转。Loop 层在每个阶段做验证数据不全回去补、分析矛盾回去查、审核不批回去改。三层是嵌套关系。Graph 跑在 Harness 里面Loop 嵌在 Graph 里面Harness 给所有 Loop 提供状态、工具和验证器。我的判断是分开看的原因不是为了分类学是为了出问题的时候你知道该拉哪根杆。出问题了该修哪一层Agent 碰不到正确的数据或者工具不安全先看 Harness。工具契约、权限、沙箱、上下文注入。Agent 跨会话忘了进度Harness。持久状态、检查点、进度文件、压缩。第一次尝试接近但不够可靠Loop。外部评分、确定性测试、退修反馈、有限重试。Agent 成功之后还在继续跑或者证据不够就停了Loop。基于证据的终点状态带预算感知的停止规则。多个专家必须按特定顺序协作Graph。显式节点、边、路由条件、交汇。多步流程里故障找不到具体在哪Graph 加 Harness。跟图节点对齐的有状态 trace。工作流变化太频繁固定图跟不上了简化 Harness。保持控制由模型驱动推迟图的形式化。几个烧过钱才学到的教训先画图再理解工作。有的团队把业务流程翻译成几十个节点之后才发现 Agent 实际解决它的方式完全不同。先用简版 Harness 跑攒一批 trace把稳定路径形式化成图。让同一个模型自写自评不加安全网。自审查有用但共享盲区也非常真实。能用确定性检查的地方先用确定性检查审稿人的上下文跟撰稿人隔开大影响动作要人批。把「继续试」当成 Loop 规范。无限重试是成本黑洞。每圈都要有可度量的目标、新证据、最大尝试次数和一条有名字的升级路径。把 Harness 当杂物间。工具多不等于好。工具多了选错率高上下文杂了困惑度高权限宽了风险高。Harness 也需要定期减负。模型不行就怪模型。模型无法可靠补偿过期状态、模糊的工具 schema、挂掉的 API、缺失的退出条件这些脚手架问题。谁的责任修谁的层。最简单的记法Harness 工程让模型能跑起来。Loop 工程让过程可迭代、可验证、可恢复。Graph 工程让复杂路径显式、可控。三层之中没有哪一层可以替代另外两层。画得再好的一张图如果 Harness 丢了状态也白搭。搭得再干净的一个 Harness没有证据和停止规则的 Loop 就是在烧钱。精心叠好的循环如果分支、并行和审批都埋在临时代码里也盯不住。真的真的三层一起设计知道每一层负责解决什么可靠的 Agent 系统自然会出来。你搭的 Agent 踩过哪一层的坑评论区说说。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

魔兽争霸3现代兼容性优化:WarcraftHelper完整配置指南

魔兽争霸3现代兼容性优化:WarcraftHelper完整配置指南

魔兽争霸3现代兼容性优化:WarcraftHelper完整配置指南 【免费下载链接】WarcraftHelper Warcraft III Helper , support 1.20e, 1.24e, 1.26a, 1.27a, 1.27b 项目地址: https://gitcode.com/gh_mirrors/wa/WarcraftHelper 还在为经典游戏《魔兽争霸3》在现代…

2026/7/28 0:51:59 阅读更多 →
魔兽争霸3终极修复指南:5分钟解决闪退、卡顿、分辨率问题

魔兽争霸3终极修复指南:5分钟解决闪退、卡顿、分辨率问题

魔兽争霸3终极修复指南:5分钟解决闪退、卡顿、分辨率问题 【免费下载链接】WarcraftHelper Warcraft III Helper , support 1.20e, 1.24e, 1.26a, 1.27a, 1.27b 项目地址: https://gitcode.com/gh_mirrors/wa/WarcraftHelper 还在为魔兽争霸3的闪退、卡顿、分…

2026/7/28 0:50:59 阅读更多 →
LangGraph:AI Agent 时代的“操作系统”

LangGraph:AI Agent 时代的“操作系统”

引言:从“应用”到“操作系统”的范式转变 目录 引言:从“应用”到“操作系统”的范式转变什么是 LangGraph? 核心思想:图即状态机 为什么 LangGraph 是 AI Agent 的“操作系统”? 1. 提供统一的“进程”与“线程”模…

2026/7/28 0:49:59 阅读更多 →

最新新闻

GBase 8s SSC共享存储集群四大核心能力介绍

GBase 8s SSC共享存储集群四大核心能力介绍

从技术层面的四大核心突破,到金融、民政等关键领域的长期实战沉淀,南大通用GBase 8s SSC共享存储集群(gbase database)用真实落地成果,印证了国产共享存储数据库的硬核实力,打破了核心领域对海外数据库的依…

2026/7/28 0:58:01 阅读更多 →
GBase 8s SSC共享存储集群以硬核实力入选2026产业图谱

GBase 8s SSC共享存储集群以硬核实力入选2026产业图谱

2026可信数据库大会重磅发布新版中国数据库产业图谱,首次新增共享存储架构数据库独立赛道,南大通用GBase 8s SSC共享存储集群(gbase database)成功入选,获得行业权威背书。作为适配政企核心业务的国产数据库架构方案&a…

2026/7/28 0:58:01 阅读更多 →
高管邮件秒回率提升81%的秘密:基于NLP情感熵值分析的AI润色模型

高管邮件秒回率提升81%的秘密:基于NLP情感熵值分析的AI润色模型

更多请点击: https://kaifayun.com 第一章:高管邮件秒回率提升81%的秘密:基于NLP情感熵值分析的AI润色模型 在企业通信场景中,高管收件箱日均处理邮件超127封,但平均响应延迟达4.3小时。传统“礼貌性润色”仅优化措辞…

2026/7/28 0:58:01 阅读更多 →
Dify性能瓶颈诊断:CPU飙升87%?内存泄漏定位→压测报告→优化前后QPS对比(附可复用监控脚本)

Dify性能瓶颈诊断:CPU飙升87%?内存泄漏定位→压测报告→优化前后QPS对比(附可复用监控脚本)

更多请点击: https://codechina.net 第一章:Dify性能瓶颈诊断:CPU飙升87%?内存泄漏定位→压测报告→优化前后QPS对比(附可复用监控脚本) CPU与内存异常捕获实战 当Dify服务在生产环境突发CPU使用率飙升至…

2026/7/28 0:58:01 阅读更多 →
如何快速掌握NomNom存档编辑器:No Man‘s Sky新手完全指南

如何快速掌握NomNom存档编辑器:No Man‘s Sky新手完全指南

如何快速掌握NomNom存档编辑器:No Mans Sky新手完全指南 【免费下载链接】NomNom NomNom is the most complete savegame editor for NMS but also shows additional information around the data youre about to change. You can also easily look up each item in…

2026/7/28 0:58:01 阅读更多 →
别再让AI乱改Flutter代码!我总结了一套边界管控方案

别再让AI乱改Flutter代码!我总结了一套边界管控方案

文章目录一、现在AI写Flutter代码跟脱缰野马一样1.1 代码跑偏四大经典社死现场二、全套约束方案,专治AI乱改代码2.1 双层规则文件,给模型画死红线2.1.1 AGENTS.md:项目通用底线,不超50行2.1.2 .cursor/rules/拆分规则文件&#xf…

2026/7/28 0:57:01 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/27 4:33:59 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/27 6:31:56 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/27 4:01:12 阅读更多 →

月新闻