9.26 大语言模型研究简报:把 Agent 开发做成“数据—训练—Harness”闭环
Qwen-Planner-Agent把 Agent 开发做成“数据—训练—Harness”闭环公开时间北京时间2026 年 9 月 24 日 22:38机构Alibaba Token Hub / MAI Team状态论文预印本 技术报告核心进展阿里MAI团队发布Qwen-Planner-Agent重点不是单独训练一个更强的手机Agent而是建立一套闭环开发框架AI for Data → AI for Training → AI for Harness其中Data多个 Agent 自动构造任务、采集轨迹、分析失败并据此生成下一轮训练数据Training先做planning-oriented SFT再做hybrid-environment online RLCARE根据模型当前能力动态调整reward / advantage在任务成功率和推理、工具调用成本之间做权衡Harness统一接入Memory、Skills、Tools和sub-agent并把执行失败重新反馈给数据与训练环节。作者报告Qwen-Planner-Agent 27B在自建MobilePA-Bench上达到77.05% Overall相比基座模型提升9.83 个百分点。该结果来自团队自建benchmark仍需独立复现。为什么重要真正值得关注的是Model–Harness co-evolution。过去很多Agent系统是固定模型 人工 Harness Benchmark这里变成执行 → 失败证据 → 数据生成 → RL → Harness 修改 → 再执行也就是说模型训练和 Agent runtime 不再完全分离而是共同迭代。与此前工作的关系这项工作延续了Qwen / MAI在Mobile Agent、GUI Agent上的路线但进一步把重点从“模型本身更强”转向训练数据飞轮 Online RL Memory/Skill/Tool Harness 的联合优化。它更像一种agentic post-training runtime co-design方法而不是新的通用基础模型。具体技术路线这个是Qwen论文中给出的lifecycle图这个图里Qwen提出的核心其实不是一个单一训练流程而是一个持续自我改进的AI-for-AI Lifecycle。它把Agent的开发拆成三个相互连接的闭环AI for Data、AI for Training、AI for Harness再用 AI 诊断和人工审核把三个闭环串起来。可以概括成真实任务执行 → 收集轨迹 → 构造/清洗数据 → 训练 Planner → 在线 RL → 真机执行 → 诊断失败 → 回流数据与训练 → 再迭代第一部分是 AI for Data。系统先自动构造可执行任务然后让 Agent 与环境交互收集成功和失败的 trajectory。收集到的数据不会直接拿去训练而是经过 Clean、Filter、Reweight把高价值轨迹筛出来。这里形成第一个循环Task Construction → Trajectory Collection → Data Composition → 再生成新任务意思是数据集不是一次性固定的而是随着模型暴露出的弱点持续更新。第二部分是 AI for Training。整理好的数据先进入 Planning Cold Start让模型通过监督学习掌握基本 planning pattern。之后进入 Online Agentic RL在真实或近真实环境中继续强化。这里的关键是 CARE schedule根据模型当前能力动态调节训练难度和 reward使训练重点跟着模型的短板变化。训练后再做 Planner Evaluation测模型在哪些任务上成功、在哪些地方失败这些诊断结果又反馈给下一轮 cold start 和 RL。于是形成第二个闭环Planning Cold Start → Online Agentic RL → Planner Evaluation → 再训练第三部分是 AI for Harness。训练好的模型并不是裸奔而是放进一个 Harness 里运行。Harness 包括Context Skills Memory模型负责 Plan → Act → RecoverHarness 则提供上下文、技能调用、记忆和运行时支持。系统随后在真实设备上执行任务执行结果再反馈回来。所以这一部分的闭环是Model → Harness → Real-device Execution → Feedback → Model / Harness这点很重要因为 Qwen 的思路不是只优化模型参数而是同时优化模型和 runtime。整个框架最关键的是底部这条“跨层反馈链”Real-device traces → AI-assisted Diagnosis → Human Review → 版本控制 / 审批 → 回流 Data / Training / HarnessAI 先分析失败轨迹提出修改建议人类负责最终审核、版本控制和批准。也就是说它不是完全自动闭环而是 AI 自动诊断 人类治理。如果压缩成一句话Qwen Planner Agent 的 Lifecycle 本质上是一个“数据飞轮 训练飞轮 Harness 飞轮”的三重闭环真实执行产生失败失败被 AI 诊断诊断结果反过来生成新数据、调整训练策略和改进运行时系统从而让 Agent 持续迭代。相比传统流程Dataset → Train → Deploy它更接近Deploy → Observe → Diagnose → Improve Data / Model / Harness → Redeploy这也是这张图最核心的思想。P.S. 这里 lifecycle 一般指的是一个产品“从创建到持续运行和迭代”的全过程针对上述内容中提到的核心模块可以分成AI for Data数据、‘AI for Training’ 训练、AI for Harness执行框架三个部分而且根据技术文档可以把这三个模块理解成一个很清晰的闭环Data负责发现并补齐能力缺口Training负责把数据转化为能力Harness负责把能力稳定地落到真实执行并把执行反馈重新送回前两层。AI for Data把“失败”转成下一轮训练数据核心目标是不是被动收集数据而是根据模型当前不会什么主动生成它最需要的数据。流程可以压缩成能力需求 / 评测失败 → 构造可执行任务 → 多环境采集 trajectory → 验证与筛选 → 调整采样权重 → 进入训练其中有三个关键动作Task Construction根据能力需求或评测暴露的问题自动构造任务明确目标、工具、初始状态和完成条件。Trajectory Collection让 Agent 在 LLM 模拟环境、Sandbox 和真机上执行收集完整的动作、反馈和结果。Weakness Diagnosis根据训练和评测结果判断哪些能力已经掌握、哪些不稳定、哪些完全缺失然后分别做 down-sample / up-weight / new tasks。所以 Data 模块本质上是一个failure-driven data flywheel不是“数据越多越好”而是让每一轮数据都对应一个明确的能力缺口。AI for Training根据模型能力动态调整学习目标核心目标是模型在不同能力阶段不应该使用完全相同的训练目标和奖励。训练分成两步。第一步是 Planning Cold Start / SFT。先用高质量 trajectory 教模型基本的 planning pattern。对于错误动作可以 mask 掉但保留经过验证的 recovery trajectory让模型不仅学会“正确执行”也学会“出错以后怎么恢复”。第二步是 Online Agentic RL。模型进入模拟环境、Sandbox 和精选真机环境中实际执行再根据结果在线更新。这里最关键的是 CARE。它根据当前模型的 competence 动态切换训练重点不会做时 → 强调 exploration / progress基本会做时 → 强调 accuracy / task completion已经稳定会做时 → 强调 efficiency减少冗余 reasoning 和 tool calls也就是先学会做再学会稳定做最后学会高效做。因此 Training 模块不是固定 reward 的 RL而是 competence-aware curriculum。AI for Harness让模型能力在真实环境中稳定发挥Harness 可以理解成 Agent 的 runtime / execution layer。模型主要负责Reasoning → Planning → 输出 structured actionsHarness 负责理解运行时上下文 → 选择技能/工具 → 路由 action → 管理 memory → 执行 → 验证这里有三个关键部分。Scenario Adapter根据当前任务和可用工具加载合适的 skills、instruction 和操作流程。Memory Manager不是简单保存历史而是保留 evidence / provenance检查信息来源、冲突和过期内容。Real-device Execution Verifier实际在设备上执行并记录成功轨迹和失败结果。这些真实执行证据再进入 AI-assisted Diagnosis系统会分析是模型 planning 错了是 memory/context 有问题是 skill 不合适还是 Harness 的 routing / instruction 有问题然后决定下一轮是更新 Model还是更新 Harness或者两者一起更新。所以 Harness 不是固定工程层而是可以与模型 co-evolve 的。总体 Workflow整个系统可以压缩成这一条链真实执行 → 暴露失败 → AI 诊断能力缺口 → 构造针对性任务 → 收集和整理 trajectory → SFT 冷启动 → Online RL → 更新模型 → Harness 真机执行 → 再收集反馈进一步抽象就是Observe → Diagnose → Generate Data → Train → Deploy → Execute → Observe三个模块分别负责AI for Data决定“下一步应该学什么”AI for Training决定“应该怎么学”AI for Harness决定“学到的能力怎么在真实环境中稳定发挥”因此 Qwen Planner Agent 最核心的思想可以概括为把 Agent 开发从一次性的“数据 → 训练 → 部署”变成由真实执行反馈驱动的 Data–Model–Harness 协同演进闭环。最后如果大家感兴趣的话可以仔细阅读相关链接。相关链接arXivQwen-Planner-Agent官方项目页 / Technical Report官方 GitHubHugging Face Papers

相关新闻

【题解-Acwing】1072. 树的最长路径

【题解-Acwing】1072. 树的最长路径

题目:1072. 树的最长路径 题目描述 给定一棵树,树中包含 n 个结点(编号1~n)和 n−1 条无向边,每条边都有一个权值。 现在请你找到树中的一条最长路径。 换句话说,要找到一条路径,使得路径两…

2026/9/30 7:29:05 阅读更多 →
【mcu-1178】基于STM32的乒乓球馆环境智能检测系统

【mcu-1178】基于STM32的乒乓球馆环境智能检测系统

项目编号:mcu-1178功能介绍:项目名:基于STM32的乒乓球馆环境智能检测系统 项目编号:mcu-1178 单片机类型:STM32F103C8T6 具体功能: 1、通过DHT11检测当前环境的温湿度,检测到温度大于最大值&…

2026/9/30 3:38:42 阅读更多 →
Ultimate Vocal Remover 人声分离指南:免费提取伴奏与干声

Ultimate Vocal Remover 人声分离指南:免费提取伴奏与干声

Ultimate Vocal Remover 人声分离指南:免费提取伴奏与干声 【免费下载链接】ultimatevocalremovergui GUI for a Vocal Remover that uses Deep Neural Networks. 项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui Ultimate Voca…

2026/9/30 5:32:31 阅读更多 →

最新新闻

电话里让改就改了?结算时这笔钱没人认

电话里让改就改了?结算时这笔钱没人认

一个做市政管网的项目,施工到一半,甲方现场代表打来电话:这段管径改大一号,先做着,手续后面补。项目经理不敢耽搁,当天就调了料、改了做法。半年后结算,这笔材料加人工多花了十几万,…

2026/10/1 15:32:19 阅读更多 →
从零到第一张AI图:Qwen-Image-2.1-viggle-turbo diffusers快速上手完整教程

从零到第一张AI图:Qwen-Image-2.1-viggle-turbo diffusers快速上手完整教程

从零到第一张AI图:Qwen-Image-2.1-viggle-turbo diffusers快速上手完整教程 【免费下载链接】Qwen-Image-2.1-viggle-turbo 项目地址: https://ai.gitcode.com/hf_mirrors/Viggle/Qwen-Image-2.1-viggle-turbo Qwen-Image-2.1-viggle-turbo 是由 Viggle 基于…

2026/10/1 15:32:19 阅读更多 →
书匠策AI的AI PPT功能:你论文写得再好,不会“讲”也是白搭

书匠策AI的AI PPT功能:你论文写得再好,不会“讲”也是白搭

官网:www.shujiangce.com | 微信 公众号 :书匠策AI 公众号搜一搜 书匠策AI,官网 www.shujiangce.com。今天不聊怎么把论文“写”出来,聊一个更被低估的能力:怎么把论文“讲”出来。 论文写完那一刻,你…

2026/10/1 15:32:19 阅读更多 →
选题—大纲—初稿:课程论文的“三段式”里,书匠策AI到底卡在哪一环

选题—大纲—初稿:课程论文的“三段式”里,书匠策AI到底卡在哪一环

官网:www.shujiangce.com | 微信 公众号 :书匠策AI 先把“写论文”这件事拆开看 课程论文和毕业论文最大的区别,不在于篇幅,在于时间感。 毕业论文你有半年到一年去磨,可以慢慢读文献、慢慢想问题、慢慢改。课程…

2026/10/1 15:32:19 阅读更多 →
从自学到职场:普通工程师的成长复盘与避坑指南

从自学到职场:普通工程师的成长复盘与避坑指南

说出来有点不好意思,我的工程师之路其实不是一条标准的“天赋异禀、一路开挂”的路线,而是一条绕了很多弯、踩过不少坑、也靠很多朋友拉了一把才慢慢走下来的普通路线。所以当有人问我“我也想当工程师,该怎么走”的时候,我特别能…

2026/10/1 15:32:19 阅读更多 →
2026年北京小程序/App开发公司选型指南:从技术架构到服务能力全维度解析

2026年北京小程序/App开发公司选型指南:从技术架构到服务能力全维度解析

一、为什么2026年选对开发服务商比以往更关键过去两年,小程序和App开发市场经历了一轮明显的分化。一方面,企业对数字化产品的需求从“有没有”转向“好不好用”;另一方面,AI能力集成、多端适配、高并发架构等要求让开发项目的技术…

2026/10/1 15:31:19 阅读更多 →

日新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/30 18:13:06 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 0:00:30 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/1 1:01:17 阅读更多 →