长时程智体的综述:基础、演化、驾驭、优化、应用和前沿(下)
26年7月来自人大、北大、清华、中山大学、港科大和新加坡国立的论文“Towards Long-Horizon Agents: A Survey, Foundation, Evolution, Harness, Optimization, Application, and Frontier”。随着LLM能力的快速发展人们对人工智能智体的期望正从解决简单的单回合任务转向在现实世界中执行长时程任务。这类系统称为长时程智体它们能够进行长时程规划与现实世界环境互动从自身错误中恢复并在执行过程中调整策略。这种能力正迅速成为实用智体智能的核心瓶颈。尽管取得了这些进展但该领域仍然缺乏对长时程智体的统一定义和分类。诸如“自演化”或“自主”智体等相关概念经常被互换使用但这些概念都未能清晰地阐明构建长时程智体的真正含义。这种认知上的缺失使得业界缺乏一种系统性的方法来评估长时程能力的进步。本文通过将长时程智体视为外部驾驭harness和内部优化的协同演化构建了一个统一的框架并围绕六个相互关联的视角展开论述基础、演化、驾驭harness、优化、应用和前沿。首先将长时程智体形式化为一种与工具耦合的决策过程并将其与诸如长时间运行执行、自主性和自我演化等邻近概念区分开来。然后追溯该领域从提示prompt级控制到运行时智体系统的演进历程并从外部化驾驭和内部化优化这两个互补视角对现有工作进行分类。在此基础上根据接口将长时程智体分为五种应用形式并回顾相应的基准测试和资源。最后讨论了关键挑战和前沿方向。。。。继续。。。优化就是如何将这些能力逐步内化到模型参数中。按照训练流程组织本节内容。首先是架构基础它首先决定了长时域训练和推理在计算上是否可行无法表示和高效处理长轨迹的策略无法有效地进行长轨迹训练。然后考察能力发展的六个阶段数据和环境合成、预训练和中期训练、微调、强化学习、策略内蒸馏和自进化。图 11 概述整个流程表 5 总结每个阶段的特征、机制和代表性工作。架构基础及其六个训练阶段如下架构基础使长轨迹的训练和解码更加高效。数据和环境合成构建可验证的长期经验包括任务、环境和轨迹供后续阶段用于训练和反馈。训练前/中期构建动作-观察和推理先验使智能体的行为自然而然而非被动接受。微调从精心设计的智能体轨迹中培养行为和工具使用规范。强化学习优化整个轨迹并在稀疏、延迟奖励下解决长期信用分配问题。策略内提炼将策略巩固到自身的状态分布上减少分布偏移并稳定先前学习的行为。自我演化将自我生成的经验、反馈和任务环境更新转化为持续的策略改进。与监督式微调相比智体强化学习Agentic RL进一步利用智体自身交互的反馈来优化策略。这使得LLM的优化目标从单轮响应扩展到长时程交互轨迹。如图12所示其核心挑战涉及四个方面采样信息丰富的多轮轨迹、从稀疏反馈中提取多粒度信用信号、将这些信号整合到稳定的策略更新中以及组织训练交互模式例如层级结构、工具使用、多智体协作和记忆。表6列出各部分的代表性工作。自进化作为一种​​训练机制用于内化智体自身产生的经验。前几个阶段主要依赖于预先准备好的数据、任务集、环境集合或轨迹。自进化增加一个反馈回路当前策略会在其环境中产生新的尝试、失败和反馈而训练过程会将选定的记录写回模型。这正是它与上述两个蒸馏阶段的区别所在微调蒸馏和策略内蒸馏都使用在训练轮次中保持不变的监督源而自我进化则将数据、任务甚至环境视为循环自身更新的对象。近年来这已发展成为一个快速发展的研究领域已有专门的论文详细阐述了智体如何自主地进化其模型、记忆、工具和工作流程以实现终身适应 [147, 165]。如图 13 所示这项工作分为三种形式离线自进化、在线自进化和智体-环境协同进化。长时程智体运行于各种各样的环境中从代码库和网页文档到图形界面、多模态流以及开放式的研究工作流程。这些场景不仅在任务持续时间上有所不同而且在智体观察、行动和接收来自外部世界的反馈的界面上也存在差异。这反过来又决定了执行过程中可用的信息、可以本地检测的错误以及智体必须添加哪些能力来弥补环境的不足。图 14 将代表性应用分为五大类各类应用的区别在于每个智体观察和行动的界面长时域智能体的五大代表性应用包括软件工程智体在代码库和执行环境中进行操作通常可以通过测试、编译器和运行时输出来检查编辑内容。信息检索智体与 Web 文档、搜索引擎和知识库交互其挑战在于如何在没有直接执行预言机的情况下收集和综合证据。计算机使用智体通过屏幕截图、辅助功能树和底层操作来操作图形界面推断和操纵部分可观察的界面状态。多模态智体对长时间的视觉、听觉和文本流进行推理其中相关信息分布在不同的时间和模态中。通用智体将多个此类接口组合在一个工作流中利用异构工具、权限和外部服务。长时程智体的进展是通过共享的基准测试和开放资源基础来衡量和复现的。由于报告的分数反映了模型、框架和训练方案的共同贡献因此长时程评估最好被理解为具有时程-觉察能力对目标必须保持的时间长短敏感和归因-觉察能力能够区分框架引起的差异和模型引起的差异[123, 286, 468]。用作基准测试的可验证的长时程环境也经常被重用作优化方法的训练环境因此评估进展和内部化进展紧密相关。除了下表列出的域基准测试之外越来越多的测试套件特意强调多小时的自主性。例如从 MLE-bench [51] 中的机器学习工程到 PaperBench [560] 中对研究论文的端到端复现这些都补充 METR [286, 429] 的前沿时间范围测量。总而言之这些资源表明长时评估正围绕有状态、耗时数小时且经济效益显著的任务进行整合并且报告的分数必须被解读为模型、框架和训练方案的共同属性而不仅仅是模型本身的属性。本文预期将定义未来几年研究方向的最具影响力的范式转变以及每种转变所蕴含的未解难题。最重要的前沿领域存在于这一过渡空间能力在框架和权重之间双向迁移。驾驭harness本身也从固定的脚手架转变为可学习、可移植的对象。在嘈杂、高成本的真实环境中长时程行动力会打破两个支柱所依赖的理想化前提。核心诊断是实际的长时程进展越来越取决于模型运行环境的属性而不仅仅是模型本身。为了便于比较这些压力将前沿领域归纳为四个更高层次的维度演化、有效性、效率和可信度。表 8 概述此结构下的九个立场。对于每个具体的前沿领域首先说明该领域所处的现状和阻碍因素现状和挑战然后说明对该领域未来发展方向的立场以及它所遗留的未解决问题展望。

相关新闻

终极指南:如何彻底移除Windows Defender安全中心并恢复系统纯净

终极指南:如何彻底移除Windows Defender安全中心并恢复系统纯净

终极指南:如何彻底移除Windows Defender安全中心并恢复系统纯净 【免费下载链接】windows-defender-remover A tool which is uses to remove Windows Defender in Windows 8.x, Windows 10 (every version) and Windows 11. 项目地址: https://gitcode.com/gh_mi…

2026/8/10 2:43:21 阅读更多 →
React 底层原理与大型应用架构实践:工具选型别只比较参数

React 底层原理与大型应用架构实践:工具选型别只比较参数

React 底层原理与大型应用架构实践:工具选型别只比较参数说明:本文将框架升级中的失效模式抽象为示例。工具能力与性能表现需要在目标版本、数据规模和浏览器矩阵中分别验证。1. 下班前最后的构建打包:单页应用在 React 18 节点上卡死 上个月…

2026/8/10 2:43:21 阅读更多 →
设计系统搭建与组件库自动化管理:灰度阶段到底验证什么

设计系统搭建与组件库自动化管理:灰度阶段到底验证什么

设计系统搭建与组件库自动化管理:灰度阶段到底验证什么说明:本文的发布过程是说明性场景,不对应某次真实变更。流量比例、错误阈值和回滚条件应由自身 SLO、兼容范围和监控数据决定。1. 灰度发布第20分钟:1无流量上报了800条样式错…

2026/8/10 2:43:21 阅读更多 →

最新新闻

无标题项目的管理实践与价值解析

无标题项目的管理实践与价值解析

1. 项目概述作为一名从业多年的技术博主,我经常遇到一个有趣的现象:很多优秀的项目或创意往往因为缺乏一个吸引人的标题而被埋没。今天我想分享的是关于"无标题"项目背后的思考与实践经验。在内容创作和技术分享领域,"无标题&…

2026/8/10 3:38:47 阅读更多 →
QT框架核心机制与多线程编程实践

QT框架核心机制与多线程编程实践

1. QT框架核心机制深度解析QT作为跨平台C图形用户界面应用程序开发框架,其核心机制的理解对于开发者至关重要。这次模拟题考察的正是QT框架最本质的设计理念和运行原理,我将从实际开发角度剖析这些核心概念。1.1 信号与槽机制QT最著名的特性莫过于其信号…

2026/8/10 3:38:47 阅读更多 →
华为云智果AgentArts:破解智能体规模化部署的工程化难题

华为云智果AgentArts:破解智能体规模化部署的工程化难题

1. 从概念到落地:智能体规模化部署的“最后一公里”之痛最近和几个负责AI落地的朋友聊天,大家普遍有个共识:现在搞个智能体Demo,用LangChain、Dify或者Coze这类平台,快的话一两天就能跑通一个看起来挺像那么回事的原型…

2026/8/10 3:38:47 阅读更多 →
Java Bean与普通类的核心区别与应用场景

Java Bean与普通类的核心区别与应用场景

1. Java Bean与普通类的本质区别第一次接触Java开发的新手常会困惑:为什么有的类叫Java Bean,有的就叫普通类?这不仅仅是命名习惯问题,背后体现的是设计理念和用途的根本差异。我在实际企业级开发中,见过太多因为混淆两…

2026/8/10 3:38:47 阅读更多 →
NSGA-Ⅲ算法在电力系统多目标调度中的Matlab实现

NSGA-Ⅲ算法在电力系统多目标调度中的Matlab实现

1. 项目概述在电力系统调度领域,梯级水电与火电机组的联合调度一直是个复杂而关键的课题。我最近用NSGA-Ⅲ算法在Matlab上实现了这个多目标优化问题,效果相当不错。这种调度方案能同时考虑发电效率、经济成本和环保指标,比传统单目标优化更符…

2026/8/10 3:38:47 阅读更多 →
BilibiliDown:B站视频下载终极指南,轻松保存你喜欢的每一个视频

BilibiliDown:B站视频下载终极指南,轻松保存你喜欢的每一个视频

BilibiliDown:B站视频下载终极指南,轻松保存你喜欢的每一个视频 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitc…

2026/8/10 3:37:46 阅读更多 →

日新闻

GraphQL-CSS API全解析:useGqlCSS、GqlCSS组件与getStyles实用指南

GraphQL-CSS API全解析:useGqlCSS、GqlCSS组件与getStyles实用指南

GraphQL-CSS API全解析:useGqlCSS、GqlCSS组件与getStyles实用指南 【免费下载链接】graphql-css A blazing fast CSS-in-GQL™ library. 项目地址: https://gitcode.com/gh_mirrors/gr/graphql-css GraphQL-CSS是一个基于GraphQL的CSS-in-GQL™库&#xff0…

2026/8/10 0:00:02 阅读更多 →
告别语言障碍:KISS Translator 双语翻译插件终极指南

告别语言障碍:KISS Translator 双语翻译插件终极指南

告别语言障碍:KISS Translator 双语翻译插件终极指南 【免费下载链接】kiss-translator A simple, open source bilingual translation extension & Greasemonkey script (一个简约、开源的 双语对照翻译扩展 & 油猴脚本) 项目地址: https://gitcode.com/…

2026/8/10 0:00:02 阅读更多 →
BepInEx配置管理器:游戏插件配置的终极可视化解决方案

BepInEx配置管理器:游戏插件配置的终极可视化解决方案

BepInEx配置管理器:游戏插件配置的终极可视化解决方案 【免费下载链接】BepInEx.ConfigurationManager Plugin configuration manager for BepInEx 项目地址: https://gitcode.com/gh_mirrors/be/BepInEx.ConfigurationManager 你是否曾经因为游戏插件的复杂…

2026/8/10 0:00:02 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/10 1:05:29 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/10 1:05:29 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/10 1:05:29 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/9 17:05:02 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/10 1:05:29 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/9 17:05:02 阅读更多 →