文章强调学习大模型不应只关注模型本身而应重视模型外的系统搭建即Harness。提出AgentModelHarness的实用公式详细介绍Harness的四个层次持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.md文档的重要性以及如何从手动开始构建Eval Harness。最后提供了一个四周的系统学习计划帮助读者从关注模型转向关注系统实现更稳定的Agent应用。很多人学 Agent第一反应是去看模型。哪个模型更强哪个模型写代码更稳哪个模型工具调用更好Prompt 应该怎么写这些问题都重要但如果只盯着模型很容易走偏。真正让 Agent 能稳定干活的往往不是单次回答有多聪明而是模型外面那套系统有没有搭好。这套系统就是 Harness。一个更实用的公式是Agent Model Harness模型提供推理能力Harness 提供工作环境。Prompt、工具、上下文策略、文件系统、Git、沙箱、测试、Hook、日志、人工审核点都是 Harness 的一部分。学习 Harness Engineering本质上是从“关注模型”转向“关注系统”。先把失败看成系统问题做 Agent 项目时最常见的反应是它又犯错了模型不行。有时确实是模型能力问题。但在实际项目里很多失败更像是 Harness 没设计好。比如它改错文件可能不是模型不知道而是项目规则没有写清楚。它跑完不测可能不是模型懒而是流程里没有强制验证步骤。它忘记上下文可能不是模型记忆差而是任务状态没有落到文件里。它重复犯同一个错可能不是模型不可控而是错误没有沉淀成规则、测试或 Hook。这就是学习 Harness 的第一个心智模型不要急着把失败归因给模型。先问一句这个错误能不能通过改 Harness 避免如果能就把它沉淀下来。这有点像工程里的棘轮。每次 Agent 犯错都应该让系统往前卡一格。加一条AGENTS.md规则加一个测试加一个检查脚本加一个发布前清单。下一次不要靠人记住要让系统挡住。Harness 可以先拆成四层初学 Harness Engineering不要一上来追框架。先把它拆成四层会更容易理解。第一层是持久化层。Agent 不能只活在聊天窗口里。稍微复杂一点的任务都需要文件系统、Git、任务目录、状态记录和中间产物。这也是为什么我更喜欢先用文件夹和 Markdown 做内容工厂。它不高级但可追踪、可审核、可恢复。第二层是执行层。Agent 要能真正做事就要能调用 Bash、运行代码、执行测试、读写文件、处理图片或访问浏览器。但执行能力必须配沙箱和权限边界。否则 Agent 越能干风险也越大。第三层是控制层。控制层负责告诉 Agent 什么能做、什么不能做、做完以后怎么判断。AGENTS.md、工作流文档、Hook、Linter、静态分析、单元测试、发布规则都在这一层。第四层是观察与验证层。Agent 不能只生成结果还要能观察结果。前端任务要看截图代码任务要看测试日志发布任务要看草稿箱预览内容任务要看审核清单。没有观察Agent 很容易“自信地完成了一个没完成的任务”。上下文工程不是把东西都塞进去Harness Engineering 里最容易被低估的一块是上下文工程。很多人以为上下文工程就是把资料全部塞给模型。这不对。上下文窗口越长信息越多模型不一定越稳。无关信息会干扰判断旧信息会污染新任务工具描述太多也会让模型迷路。更好的思路是即时上下文。需要项目规则时读AGENTS.md。需要写作风格时读memory/style_guide.md。需要发布规则时读发布 Skill。需要检查事实时再去查来源。不要在启动时把所有东西都塞进去。这也是 Skill 设计里“渐进式披露”的意义先给模型任务入口只有在需要时再展开细节。上下文工程不是喂更多材料而是让模型在正确时间拿到正确材料。工具设计要从结果倒推另一个关键点是工具设计。很多系统把工具设计成一堆底层 API查一个字段、点一个按钮、调一个接口、传一段 JSON。这种方式对人类开发者清楚但对 Agent 不一定友好。Agent 更适合使用结果导向的工具。比如“保存公众号草稿箱”就比“上传图片、换取 media_id、拼 content、调用 draft/add”更适合当成一个高层工具。底层步骤可以在工具内部完成。Agent 只需要知道输入是什么、输出是什么、失败时怎么处理。工具也不是越多越好。每个工具都会占上下文。工具越多选择成本越高误用概率也越高。MCP 的价值是把模型连接到外部工具和数据。但 Harness 的工作是给这些工具设边界、降噪、封装成可完成任务的能力。AGENTS.md 是最小可用 Harness如果你不知道从哪里开始我建议先从AGENTS.md开始。它可以是 Agent 的项目说明书。里面写清楚项目目标是什么。目录怎么放。哪些文件不能动。做完以后怎么验证。哪些事情必须人工审核。哪些密钥和登录态绝对不能提交。这比写一个很长的临时 Prompt 更有用。Prompt 是一次性的AGENTS.md是项目资产。再往前一步可以加工作流文档。比如我的公众号内容工厂现在就把流程拆成选题、大纲、初稿、审核、终稿、视觉规划、封面、按需配图、保存草稿箱、人工预览。每一步都有产物。每一步都能检查。这就是一个很朴素的 Harness。Eval Harness 要从手动开始很多人一听 eval就想到复杂平台。其实早期不需要。第一版 Eval Harness 可以很简单保留失败案例。记录 Agent 当时做错了什么。写出期望行为。增加一条规则或测试。下次同类任务再跑一遍。内容项目可以用审核清单。代码项目可以用测试和 Linter。工具项目可以记录工具调用成功率、失败原因、耗时和人工接管次数。等有了稳定任务再做离线评估、Golden 数据集和 Grader。不要一开始就追完整评估平台。先让错误有记录让修正能复用。可以按 30 天来学如果要系统学习 Harness Engineering我会分四周。第一周只建立心智模型。读几篇核心文章搞清楚Agent Model Harness理解为什么 Prompt 不是完整工程方案。这一周不要急着搭平台。第二周做一个文件夹版 Harness。选一个真实任务比如写公众号文章、修代码、整理资料。给它建目录、状态文件、输入文件、输出文件、审核清单和AGENTS.md。第三周加执行和反馈。代码任务加测试、Linter 和日志。内容任务加风格审核、事实检查、发布前清单。前端任务加截图检查。目标不是自动化一切而是让 Agent 能看到自己的结果。第四周补 eval 和复盘。收集 5 到 10 个失败案例分析哪些是模型能力问题哪些是 Harness 问题。能通过规则、工具、测试、上下文策略解决的就沉淀进系统。这四周跑完你不一定掌握了所有框架。但你会开始用系统眼光看 Agent。这比多背几个 Prompt 技巧更重要。推荐从这些资料开始如果只读几篇我会按这个顺序The Anatomy of an Agent Harness[1]Agent Harness Engineering[2]Effective harnesses for long-running agents[3]Effective context engineering for AI agents[4]Context engineering in agents[5]Guardrails 文档[6]读的时候不要只记概念。每读一篇都问三个问题第一这篇文章解决的是 Harness 的哪一层第二它能不能变成我项目里的一个文件、规则、工具或检查项第三如果 Agent 下次犯类似错误我能不能让系统自动挡住Harness Engineering 不是把 Agent 变复杂。它是把原本散落在脑子里、聊天记录里、临时 Prompt 里的经验变成可以复用、可以验证、可以交接的工程系统。模型会继续变强。但真正能长期积累的是你围绕模型搭出来的那套系统。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取