不换模型,效果提升104%!上海AI Lab让Harness也能自进化了
上海人工智能实验室团队提出的Self-Harness近期被LangChain CEO、联合创始人Harrison Chase转发也被前OpenAI副总裁Lilian Weng收进自进化Agent相关博客。让AI自己改自己的Agent Harness这事已经被顶级Agent社区注意到了。上海人工智能实验室团队提出的Self-Harness近期被LangChain CEO、联合创始人Harrison Chase转发也被前OpenAI副总裁Lilian Weng收进自进化Agent相关博客。它盯上的不是换模型而是Agent外层那套Harness。做法很直接。模型先检查自己的运行轨迹从失败里挖出模式再提出有边界的Harness修改最后交给回归测试决定要不要采纳。实验结果显示在Terminal-Bench-2.0上底层模型、工具环境和评测协议都保持不变只改Harness三个模型后端都拿到了held-out提升。其中Qwen3.5-35B-A3B总提升达到104%MiniMax M2.5和GLM-5分别提升28%和24%。论文和项目已经公开文末附链接。△LangChain CEO/co-founder Harrison Chase转发Self-Harness让Harness自己进化Agent Harness可以理解为包在模型外层的一套运行装置覆盖系统提示词、工具使用规则、验证器、运行时控制策略和轻量middleware。在多轮工具任务里它决定Agent怎么调用工具什么时候停失败后怎么恢复产物又该如何验证。过去这套东西主要靠工程师手调。要读大量执行轨迹找失败原因改提示词或工具规则再反复跑benchmark。模型越多、任务越杂Harness就越难继续按“一模型一套人工调参”的方式扩展。△三种Harness改进范式人工改、强模型外援改以及Self-Harness让模型基于自身轨迹改Self-Harness怎么工作换到Self-Harness流程被压成三步。先挖弱点再提改法最后跑回归。Weakness Mining从失败轨迹挖弱点系统先让当前Harness驱动固定模型完成一批任务记录完整执行轨迹、工具调用和评测结果。失败样本不会被当成孤例处理。Self-Harness会结合验证器反馈、Agent行为和失败之间的因果关系把可复用的失败机制聚起来。这样“某个任务没过”会变成“这一类失败可能来自同一种Harness缺陷”。比如缺少最终产物、重复执行无效命令、工具报错后不恢复或者探索太久却迟迟不进入实现。Harness Proposal提有边界的改法拿到结构化失败证据后同一个模型会切换成proposer针对已挖出的失败机制提出候选Harness edit。这些edit只能落在预先声明的可编辑表面上不能把整个Agent控制架构推倒重来。每个提案都要说明想改变哪种行为可能带来什么回归风险以及为什么可能修好当前失败模式。Proposal Validation用回归测试拍板候选Harness会在同一评测协议下重跑并和当前Harness对比。接受规则很保守。held-in或held-out至少一个split要提升另一个split不能退化才会进入下一代Harness。这也是它和普通“自动改prompt”的差别。Self-Harness不让模型凭感觉拍板而是把每一次改动都放进可记录、可复现、可回退的评测闭环里。△Self-Harness自改进闭环包括弱点挖掘、修改提案和回归验证不换模型只改外层也能涨论文在Terminal-Bench-2.0上做了系统评测。Terminal-Bench-2.0是一个多轮智能体benchmark任务运行在容器化终端环境中覆盖文件管理、命令执行、错误恢复、产物验证等真实工具使用能力。在固定模型、工具集、任务环境和评测配置的前提下Self-Harness只改Harness。结果三个模型都出现提升。MiniMax M2.5总提升28%Qwen3.5-35B-A3B总提升104%GLM-5总提升24%。这组结果的重点不是又换了一个更强模型而是在同一个模型外面Harness本身也可以被搜索、验证和迭代。△Terminal-Bench-2.0结果三个模型后端在Self-Harness后均获得held-out提升更重要的是每个候选修改都经过held-in和held-out回归测试。换句话说Self-Harness不是堆更长的提示词而是在一次次验证门控后只留下真的带来收益、又没有明显回退的Harness edits。△Qwen3.5 Self-Harness进化路线通过多轮验证门控保留有效edits不同模型暴露出不同弱点Self-Harness的另一个观察更像工程现场。不同模型不是同一种失败。MiniMax M2.5找到线索后迟迟不交付在初始Harness下MiniMax M2.5有时会持续探索数据集。即使已经找到关键元信息也迟迟不创建评测所需的答案文件最后因为缺少产物或超时失败。Self-Harness保留的修改会鼓励Agent更早识别必需输出先创建初始产物并在工具调用过长时转向具体实现和验证。Qwen3.5-35B-A3B工具失败后容易陷入循环Qwen3.5-35B-A3B的常见问题是工具失败后进入重复编辑、重复覆盖或重复命令循环甚至在停止前删除评测必需文件。Self-Harness为它引入依赖预检查、失败后产物恢复、避免完全相同命令重试以及由工具错误触发的artifact-focused提醒。△Qwen3.5保留下来的code-level Harness edits集中在依赖预检查、产物恢复和重试约束。GLM-5更需要管住shell状态和节奏GLM-5暴露出的弱点更集中在shell会话状态以及从探索切到实现的时机。改进后的Harness会提醒Agent在修改环境变量、安装工具或调整路径后确认这些变化能跨命令持续可用。当长时间探索还没有形成产物时系统也会推动它转向实现与测试。这说明Self-Harness不只是给所有模型加一段通用提示。它会根据每个模型在真实轨迹中暴露出的弱点生成并筛选适合它的Harness改动。为什么会引起关注Agent越来越像跑在工具环境里的系统而不是只回答单轮问题的模型。在这种设定里模型能力只是一部分。外层Harness决定它是否知道何时调用工具如何从错误中恢复是否保留正确产物退出前有没有做验证。过去Harness工程更像经验活。Self-Harness给出的方向是让模型自己参与这套经验的挖掘和改写但最终仍由评测而不是自评来拍板。它没有证明“Agent可以完全自己进化”也没有绕过benchmark范围。论文里的结果主要来自Terminal-Bench-2.0和固定模型后端。但作为一个自进化Agent的组件它给出了比较清楚的边界改什么怎么改怎么验什么时候拒绝。研究团队该工作来自上海人工智能实验室团队论文题为Self-Harness: Harnesses That Improve Themselves。从现有文档看团队公开了论文和项目地址读者可以查看具体实验设置、Harness edits和代码。

相关新闻

这届世界杯,大模型的“懂球”程度让我意外

这届世界杯,大模型的“懂球”程度让我意外

上个月部门搞世界杯竞猜,要猜决赛对阵和比分。纯足球小白的我仔细挑了两队提交,立马被指出选得不合理。本人强装镇定:“就这样吧。”但弄懂了规则后,就换掉了之前的选择,没别的原因,纯粹是为了奖品。结果第…

2026/7/25 11:57:11 阅读更多 →
GPT-5.6 能否做好代码维护?基于注释、重构、依赖分析的实测结论

GPT-5.6 能否做好代码维护?基于注释、重构、依赖分析的实测结论

代码维护才是开发者的日常 很多人用 AI 写新代码,但真实工作中,维护旧代码的时间远超写新代码。注释补全、逻辑重构、依赖关系梳理,这些才是每天要面对的事。 这次在 kulaai(titiai.cn) 上把 ChatGPT、Claude、Gemin…

2026/7/26 2:36:15 阅读更多 →
Claude 4.8 代码补全与重构能力实测:真实开发场景表现分析

Claude 4.8 代码补全与重构能力实测:真实开发场景表现分析

写在前面 AI 代码工具这两年迭代太快,从最初的"能补全一行代码"到现在能理解整个项目上下文,变化肉眼可见。 做这次测评之前,我在 kulaai(网址titiai.cn) 上把 ChatGPT、Claude、Gemini、Grok 四个主流模型…

2026/7/25 21:33:51 阅读更多 →

最新新闻

Unity平面反射探针实战:从原理到性能优化,打造真实水面与镜面效果

Unity平面反射探针实战:从原理到性能优化,打造真实水面与镜面效果

1. 项目概述:为什么平面反射探针是提升场景真实感的关键 在Unity中做项目,尤其是涉及室内场景、水面、光滑地板或者科幻题材的金属走廊时,我们总会遇到一个绕不开的难题:如何让物体表面真实地反射出周围的环境?你可能会…

2026/7/26 16:39:50 阅读更多 →
NCM文件转换终极指南:3分钟解锁网易云音乐加密限制

NCM文件转换终极指南:3分钟解锁网易云音乐加密限制

NCM文件转换终极指南:3分钟解锁网易云音乐加密限制 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困扰&am…

2026/7/26 16:39:50 阅读更多 →
三步彻底解决Windows和Office激活难题:KMS_VL_ALL_AIO完整指南

三步彻底解决Windows和Office激活难题:KMS_VL_ALL_AIO完整指南

三步彻底解决Windows和Office激活难题:KMS_VL_ALL_AIO完整指南 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 你是否经常遇到Windows系统弹出烦人的激活提示?Office突然…

2026/7/26 16:39:50 阅读更多 →
英伟达AI算力爆发与代理式AI技术解析

英伟达AI算力爆发与代理式AI技术解析

1. 英伟达季报核心数据解读 2024年第一季度,英伟达交出了一份令整个科技行业震惊的成绩单。财报显示,公司季度营收达到惊人的681亿美元,同比增长73%,远超市场预期。这个数字背后有几个关键点值得关注: 首先是营收结构…

2026/7/26 16:39:50 阅读更多 →
HTML转Figma工具:5步实现网页到设计稿的高效转换

HTML转Figma工具:5步实现网页到设计稿的高效转换

HTML转Figma工具:5步实现网页到设计稿的高效转换 【免费下载链接】figma-html Convert any website to editable Figma designs 项目地址: https://gitcode.com/gh_mirrors/fi/figma-html HTML转Figma是一款革命性的Chrome扩展工具,能够将任何网页…

2026/7/26 16:39:50 阅读更多 →
终极Palworld存档迁移指南:简单三步解决服务器转移问题

终极Palworld存档迁移指南:简单三步解决服务器转移问题

终极Palworld存档迁移指南:简单三步解决服务器转移问题 【免费下载链接】palworld-host-save-fix Fixes the bug which forces a player to create a new character when they already have a save. Useful for migrating maps from co-op to dedicated servers and…

2026/7/26 16:38:49 阅读更多 →

日新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/26 0:00:31 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/26 0:00:31 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/26 0:00:31 阅读更多 →

月新闻