Miles框架:Agentic RL如何重构强化学习范式与工程实践
1. 从“智能体”到“智能体化”Miles框架的范式革新最近在强化学习社区里Miles框架的讨论热度持续攀升。作为一个长期关注智能体Agent技术发展的从业者我最初看到“Agentic RL”这个提法时也产生过一丝疑惑这不就是强化学习RL吗我们训练的不就是智能体吗但随着对Miles项目技术文档和开源实践的深入分析我发现“Agentic RL”这个概念远非一个简单的文字游戏。它背后代表的是Miles框架对传统强化学习范式的系统性重构其核心在于将“智能体”从一个被训练、被优化的“对象”提升为整个系统架构的“中心”和“驱动者”。这就像从“制造一个能执行任务的机器人”转变为“构建一个能自主思考、规划、学习和协作的机器人社会”。今天我们就来深入拆解Miles框架实现这一“智能体化”愿景的几项关键技术看看它如何为复杂、长周期、多任务的现实问题提供新的解决思路。2. TITO架构解耦决策与执行的清晰边界Miles框架最核心的设计理念体现在其TITO架构上。TITO是“Task-In, Task-Out”的缩写直译为“任务进任务出”。这个看似简单的设计却是实现“智能体化”的基石。2.1 TITO的核心思想将智能体视为“任务处理器”在传统的强化学习框架如OpenAI Gym、Stable Baselines3中智能体与环境交互的接口通常是“状态State进动作Action出”。智能体接收一个观测Observation输出一个原始动作如关节扭矩、离散指令。框架和算法主要关注如何优化从状态到动作的映射策略。Miles的TITO架构彻底改变了这一视角。在这里智能体接收的输入是一个任务Task输出的也是一个任务Task。这个“任务”是一个比原始“动作”更高级的抽象。它可以是一个目标描述“移动到坐标(x,y)”一个技能调用“使用工具A进行拧紧操作”甚至是一个需要进一步分解的复杂指令“组装这个零件”。为什么这个设计如此重要提升抽象层级它迫使我们将问题建模在任务层面而非底层控制层面。智能体不需要关心电机具体如何转动它只需要决定“接下来要完成哪个子任务”。这极大地降低了策略学习的复杂度尤其适合需要高层规划和组合技能的场景。实现自然分层高级智能体可以输出任务给低级智能体或技能模块执行。例如一个“导航智能体”输出“移动到房间A”的任务由底层的“运动控制智能体”将其分解为一系列路径点和动作指令。这种分层是构建复杂智能体系统的自然方式。促进模块化与复用任务成为智能体之间、智能体与技能库之间的标准接口。一个训练好的“抓取”技能可以被任何需要抓取动作的上级智能体调用只需传递“抓取对象X”的任务即可无需重新训练。2.2 TITO接口的实践形态在Miles的代码实现中一个任务通常被定义为一个结构化的数据对象包含任务类型、参数、优先级、上下文等信息。智能体的act方法接收一个任务列表可能包含当前主任务和多个并发的子任务或中断任务经过内部推理可能涉及规划、检索、学习输出下一个要执行的任务或对现有任务的更新。# 概念性示例非真实代码 class MilesAgent: def act(self, input_tasks: List[Task], current_state: State) - Task: # 内部可能包含任务理解、规划、技能选择、冲突解决等逻辑 next_task self.planner.reason(input_tasks, current_state) return next_task这种设计使得智能体内部的算法可以非常灵活可以是基于规则的规划器、基于学习的策略网络也可以是两者结合的混合系统。框架关心的是任务流的调度与执行而不强制规定智能体的内部实现。3. Session Server为智能体配备持久化记忆与协作后台如果说TITO定义了智能体的“行为模式”那么Session Server则是支撑其“社会性”和“持续性”的关键基础设施。在真实场景中智能体并非每次交互都从零开始它需要记忆历史、管理长期目标、并可能与其他智能体通信协作。3.1 Session的概念超越单次Episode的连续性在传统RL中一个“回合”Episode通常是独立的。智能体在回合结束后重置记忆如RNN的隐藏状态也被清零。这对于许多需要长期记忆、跨回合学习的任务如终身学习、与人进行多轮对话协作是不足的。Miles引入了“会话”Session的概念。一个Session可以跨越多个传统意义上的Episode持续数小时、数天甚至更久。它维护了一个与特定智能体实例或智能体团队绑定的、持久化的上下文环境。Session Server就是负责管理和存储这些Session的后端服务。3.2 Session Server的核心功能状态持久化保存智能体的内部状态如信念状态Belief State、长期目标、已完成的任务历史、学到的经验可能以情境记忆的形式。当智能体因系统重启或故障恢复时可以从Session Server恢复其状态继续之前的任务而不是从头开始。经验管理与检索Session Server可以作为一个中心化的经验库。智能体可以将重要的决策经验任务、状态、结果存储到Session中。未来面对类似情境时可以通过检索相似的历史经验来辅助决策实现基于案例的推理Case-Based Reasoning这比仅依靠参数化的策略网络更灵活、可解释。智能体间通信与协调在多智能体场景中Session Server可以作为消息总线或共享黑板Blackboard。智能体可以将自己的意图、观察到的信息、或发布的任务写入共享的Session区域其他智能体可以读取并据此调整自己的行为实现隐式或显式的协作。人机交互接口Session可以作为人机交互的上下文载体。人类操作员可以随时介入查看智能体的任务历史、当前信念并通过修改Session中的任务列表或直接注入新任务来指导智能体。注意Session Server的引入也带来了新的复杂性挑战如Session数据的一致性、并发访问的锁机制、以及海量Session的存储与检索效率。Miles框架通常需要与分布式数据库如Redis、关系型数据库结合并设计高效的数据序列化格式。3.3 一个简化的协作示例假设有一个仓储机器人团队搬运Agent、分拣Agent和一个中央调度Agent。中央调度Agent接收到“处理订单123”的顶层任务将其分解为“取货A”、“运至区域B”等子任务写入共享Session。搬运Agent从Session中认领“取货A”任务执行过程中发现货架拥堵它将“区域X拥堵”的信息更新到Session。分拣Agent读取到拥堵信息主动调整自己的路径规划避开区域X。所有任务的状态进行中、完成、失败都在Session中更新供所有Agent和人类监督员查看。整个过程中智能体之间没有直接的函数调用而是通过读写共享的Session状态进行松耦合的协作系统更具弹性和可扩展性。4. 技能Skill的封装与组合构建可复用的能力单元在Agentic RL的视角下智能体的能力不是单一的黑盒策略而是由一系列可复用、可组合的“技能”构成的。Miles框架对技能的封装和管理提供了系统性的支持。4.1 技能作为一等公民在Miles中技能是一个封装了特定能力如“移动”、“抓取”、“视觉检测”的模块。它对外暴露标准的执行接口通常也是TITO风格内部则可以用任何方式实现可以是一个训练好的RL策略、一个经典的控制算法、一组预定义的轨迹、甚至是一个调用外部工具如搜索引擎、计算器的接口。技能库Skill Library是框架的重要组成部分。它允许技能注册将开发好的技能进行标准化描述输入输出、前置条件、后置效果并注册到库中。技能发现与调用高级智能体在规划时可以根据任务需求从技能库中查询并调用合适的技能。例如面对“泡一杯茶”的任务智能体可以依次调用“移动到厨房”、“拿取水杯”、“打开水龙头”、“加热”等技能。技能学习与更新技能本身可以通过RL进行持续优化。框架可以记录技能的执行表现成功率、耗时并触发技能的再训练流程。4.2 技能的组合与层次化智能体的强大之处在于组合技能以解决新问题。Miles支持技能的层次化组合序列组合一个技能的输出任务可以作为下一个技能的输入。这是最常见的组合方式。并行组合多个技能可以并发执行服务于同一个高级任务的不同方面如“移动”的同时“保持平衡”。条件组合根据执行结果或环境状态动态选择下一个要执行的技能if-else逻辑。通过TITO接口这种组合可以自然发生。一个高级的“任务规划智能体”本身就可以被看作是一个通过调用和组合底层技能来实现复杂任务的“元技能”。实操心得在构建技能时一个关键的设计原则是保持技能的原子性和正交性。原子性意味着一个技能应只完成一件定义明确的事正交性意味着技能之间的功能重叠应尽可能小。这就像设计良好的函数库能最大程度地提高复用性和组合的灵活性。例如将“移动到(x,y)”和“避障”拆分成两个技能比设计一个复杂的“安全移动到(x,y)”技能要更好因为“避障”技能可以被其他许多需要移动的场景复用。5. 规划与学习的融合应对开放世界的核心引擎Agentic RL智能体不能只依赖固定的策略它必须能在面对新任务、新环境时进行思考规划并从经验中学习学习。Miles框架并不限定具体的算法但它提供的架构天然促进了规划与学习Planning and Learning的融合。5.1 基于模型的规划与基于技能的学习在TITO架构下智能体的内部可以这样工作任务理解与分解接收到高层任务后智能体首先利用其世界模型可以是学习得到的也可以是符号化的对任务进行理解并将其分解为一系列已知的技能调用序列即一个初步计划。这个世界模型预测执行某个技能后环境会如何变化。模拟推演与评估智能体可以在内部利用世界模型对这个计划进行“想象”或推演评估其成功的可能性和代价。这个过程类似于蒙特卡洛树搜索MCTS在AlphaGo中的应用但在任务层面进行。执行与学习选择评估最优的计划开始执行。在执行过程中真实的环境反馈会与模型的预测进行比较。如果出现偏差模型误差或失败技能不足这些信息会成为宝贵的学习信号模型学习用真实数据更新世界模型使其更准确。技能学习如果某个技能频繁失败可以针对该技能进行专门的RL训练提升其性能。规划策略学习如何根据任务和当前状态选择/调整计划本身也可以作为一个元策略进行学习。5.2 检索增强的决策Session Server在这里扮演了另一个关键角色经验记忆库。当智能体面临一个新任务时除了使用模型进行前向搜索它还可以从Session Server中检索历史上执行过的、最相似的任务及其解决方案即成功的技能序列。这种“基于案例的规划”非常高效尤其适用于那些有大量历史经验可循的重复性任务。它结合了搜索在经验库中检索和学习经验本身来自过去的学习过程。一个具体的例子一个家庭服务机器人接到“清理洒在桌上的牛奶”任务。它可能检索从Session中查找类似任务“清理洒的水”、“擦拭桌面”获得一个基础计划[“定位抹布” “抓取抹布” “移动到污渍处” “擦拭”]。规划调整由于当前是牛奶可能涉及粘稠度不同它利用模型推演觉得需要在“擦拭”后增加“清洗抹布”的技能。执行与学习执行这个调整后的计划。如果“擦拭”技能效果不佳因为牛奶干了它会记录这次失败并可能触发对“擦拭”技能在“粘稠液体”场景下的强化学习微调。成功的完整计划则被存储回Session丰富经验库。这种“检索-规划-执行-学习”的循环使得Miles智能体能够持续适应和成长而不是一个静态的模型。6. 实际部署考量与挑战将Miles这样的Agentic RL框架应用于实际项目会面临一系列工程和算法上的挑战这些是光读论文体会不到的。6.1 系统复杂性管理Miles框架引入了多个新组件TITO智能体、Session Server、技能库、规划器系统复杂度显著高于传统的“环境-智能体”两元框架。这带来了额外的开发、调试和运维负担。需要建立清晰的模块边界、定义良好的接口契约、以及完善的日志和监控系统。特别是Session数据流需要仔细设计以避免成为性能瓶颈和单点故障。6.2 技能工程与知识表示构建一个实用的技能库是项繁重的工作。每个技能都需要明确的接口输入输出任务的定义。鲁棒的实现无论是学习得到的还是手写的都需要在各种边界条件下稳定工作。准确的元数据前置条件Preconditions和后置效果Effects的描述。这对于自动规划至关重要。让机器自动、准确地学习和描述技能的效应本身就是一个前沿研究问题学习符号化表示。实践中初期往往需要大量的人工标注和调试。6.3 长期信用分配与稀疏奖励在长周期的任务链中最终的成功或失败可能由很多步之前的某个关键决策导致。如何将最终的奖励信号正确地分配Credit Assignment给链条中早期的某个技能或规划决策是一个经典的难题。Miles的分层结构在一定程度上缓解了这个问题每个子任务可以有子奖励但并未完全解决。仍然需要设计合理的分层奖励函数或采用先进的课程学习、逆向课程生成等技术。6.4 安全性与可解释性一个能够自主规划、调用技能的智能体其行为更难预测。必须建立“护栏”Guardrails机制例如技能安全验证在执行一个技能前快速检查其安全性如“移动”技能是否会撞到人。规划监控对生成的计划进行合理性审查可以基于规则或学习到的安全约束。人机协同保留人类随时中断、修改任务或接管控制的通道。Session Server提供的透明化任务历史是提高可解释性、方便人工审计的重要工具。从我参与的几个概念验证项目来看Miles框架代表的Agentic RL思路在那些任务结构清晰、可分层、且需要较高自主性和复用性的场景如游戏AI、复杂机器人操作流程、自动化业务流程中展现出了巨大的潜力。它更像是在用软件工程中“模块化”、“微服务”、“事件驱动”的思想来重构强化学习系统使其更易于构建和维护复杂智能行为。当然这条路还很长尤其是让系统真正可靠、安全地运行在物理世界中需要算法研究者、软件工程师和领域专家的紧密合作。但毫无疑问Miles为我们提供了一个极具启发性的架构蓝图让我们看到了强化学习从“训练一个网络”走向“构建一个智能体生态”的可能性。

相关新闻

Python列表操作

Python列表操作

Python列表操作 【免费下载链接】mx-bili-plugin 项目地址: https://gitcode.com/gh_mirrors/mx/mx-bili-plugin 学习列表切片操作:B站视频链接#t2m30s **使用场景**: - 标记重要知识点的时间点 - 创建视频内容的目录索引 - 快速回顾特定片段###…

2026/8/11 3:28:23 阅读更多 →
Lybrary:为AI Agent构建AST感知的代码记忆系统

Lybrary:为AI Agent构建AST感知的代码记忆系统

如果你正在开发AI编程助手或智能体(AI Agent),有没有遇到过这样的场景:助手在帮你修改代码时,总是“记不住”项目结构,每次对话都要重新解释一遍文件关系?或者,当你要求它重构一个大…

2026/8/11 3:28:23 阅读更多 →
终极Windows消息保护工具:防撤回+多开双功能完整指南

终极Windows消息保护工具:防撤回+多开双功能完整指南

终极Windows消息保护工具:防撤回多开双功能完整指南 【免费下载链接】RevokeMsgPatcher :trollface: A hex editor for WeChat/QQ/TIM - PC版微信/QQ/TIM防撤回补丁(我已经看到了,撤回也没用了) 项目地址: https://gitcode.com/…

2026/8/11 3:28:23 阅读更多 →

最新新闻

3个实用技巧:掌握FanControl风扇控制软件的高级配置

3个实用技巧:掌握FanControl风扇控制软件的高级配置

3个实用技巧:掌握FanControl风扇控制软件的高级配置 【免费下载链接】FanControl.Releases This is the release repository for Fan Control, a highly customizable fan controlling software for Windows. 项目地址: https://gitcode.com/GitHub_Trending/fa/F…

2026/8/11 4:20:49 阅读更多 →
Selenium ChromeDriver版本不匹配导致浏览器闪退的完整解决方案

Selenium ChromeDriver版本不匹配导致浏览器闪退的完整解决方案

1. 问题概述与核心痛点如果你正在用 Python 的 Selenium 库配合 ChromeDriver 在 PyCharm 里做自动化测试或者爬虫,最让人抓狂的瞬间之一,大概就是代码一运行,Chrome 浏览器窗口“唰”地一下弹出来,还没等你看清页面,又…

2026/8/11 4:20:49 阅读更多 →
C#、C++、Java三语言复刻《水果忍者》:游戏开发核心原理与实战对比

C#、C++、Java三语言复刻《水果忍者》:游戏开发核心原理与实战对比

1. 项目概述:为什么用三种语言重写一个经典游戏?最近在社区里看到不少朋友在讨论如何用不同的编程语言复刻经典游戏,其中《水果忍者》(Fruit Ninja)因其直观的玩法、丰富的物理效果和相对清晰的逻辑,成为了…

2026/8/11 4:20:49 阅读更多 →
Photoshop安装避坑指南:从官方订阅到免费替代方案

Photoshop安装避坑指南:从官方订阅到免费替代方案

1. 从“安装”到“稳定使用”:一个Photoshop老用户的避坑全指南 每次看到网上铺天盖地的“PS安装教程”,我都有点哭笑不得。很多教程只告诉你点哪个按钮,却从不解释为什么要点,更不会告诉你点完之后可能遇到的“惊喜”。作为一个从…

2026/8/11 4:20:49 阅读更多 →
3步搞定Windows运行库兼容性问题:VisualCppRedist AIO终极指南

3步搞定Windows运行库兼容性问题:VisualCppRedist AIO终极指南

3步搞定Windows运行库兼容性问题:VisualCppRedist AIO终极指南 【免费下载链接】vcredist AIO Repack for latest Microsoft Visual C Redistributable Runtimes 项目地址: https://gitcode.com/gh_mirrors/vc/vcredist 你是不是经常遇到这种情况&#xff1a…

2026/8/11 4:20:49 阅读更多 →
《人生底稿 39》|初赴湘楚大地:从内蒙收官到湖南新程,一人扛下两地现场

《人生底稿 39》|初赴湘楚大地:从内蒙收官到湖南新程,一人扛下两地现场

一、内蒙外勤圆满收官,受命单人奔赴湘楚内蒙赤峰外勤圆满收官(详见《人生底稿38》),短暂回归天津休整后,新的外勤任务如期而至。这一次,我的脚步从辽阔的内蒙草原,迈向温润厚重的湘楚大地——湖…

2026/8/11 4:19:49 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/11 1:08:05 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/11 1:08:05 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/11 1:08:05 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/10 17:07:33 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/11 1:08:06 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/10 17:07:33 阅读更多 →