OpenForge RL:适配任意环境的智能体运行时原生训练框架
OpenForge RL适配任意环境的智能体运行时原生训练框架论文原链接https://arxiv.org/html/2607.21557v1摘要现代大模型智能体普遍依赖复杂运行时(\mathcal{H})arness如Claude Code、Codex、OpenClaw完成多轮推理、工具调用与外部系统交互。但现有开源SFT/强化学习RL训练框架无法原生支持带多进程、状态维护的运行时推理只能简化重写运行逻辑造成「训练-部署不一致」鸿沟。本文提出OpenForge RL开源框架核心由轻量代理与K8s任务编排器两大组件构成代理拦截并记录运行时所有模型调用标准化输出可接入veRL等主流RL框架的训练轨迹编排器在云容器中独立调度每条交互样本实现任意运行时、任意环境的规模化端到端训练。我们在两类复杂智能体场景完成全量验证命令行工具智能体Claw-Agent基于30B MoE基座训练仅用数百至数千条任务在ClawEval、QwenClawBench、MCPAtlas基准分别取得31.7(pass³)、55.9(pass3)、33.7(pass1)、28.1(pass1)显著超越同规模开源基线多模态GUI智能体GUI-Agent电脑/浏览器操作8B多模态模型在OSWorld-Verified、Online-Mind2Web、WebVoyager分别达到37.7、63.0、72.3持平甚至数倍优于更大规模同类开源模型。除性能评测外依托原生运行时训练能力本文首次定量分析「运行时选型」与「RL训练」对智能体行为的塑造作用轻量化对齐运行时更容易学习单运行时训练具备跨运行时泛化能力RL主要提升智能体可靠性工具覆盖、自校验、多步骤规划完成度但错误修复能力仍存在短板。本文将完整开源代码、数据集、训练脚本降低各类运行时智能体的强化学习研究门槛。图1论文整体示意图。左OpenForge RL整体架构打通任意运行时、环境与标准RL训练库消除训练部署差异右Claw与GUI两类智能体在6套主流评测基准的对比柱状图。目录引言相关工作2.1 智能体推理运行时2.2 基于运行时的智能体训练方法3.1 符号定义3.2 OpenForge RL核心架构3.2.1 交互样本编排3.2.2 异步样本执行与超时机制3.2.3 异常容错处理3.3 任务数据自动生成流水线实验4.1 命令行Claw智能体4.1.1 监督微调(SFT)与RL数据集4.1.2 完整训练超参与流程4.1.3 评测基准与协议4.1.4 实验结果对比4.2 GUI多模态智能电脑/浏览器4.1 SFT与RL数据构建4.2 训练配置4.3 评测标准4.4 结果分析讨论5.1 不同运行时下模型表现差异5.2 未见过的新运行时泛化能力5.3 RL训练习得的核心智能能力结论致谢参考文献附录A 完整训练细节A.1 Claw智能体训练完整参数A.2 GUI智能体训练电脑/浏览器分模块附录B 数据集完整说明B.1 数据生成流水线完整流程B.2 Claw任务数据明细B.3 GUI电脑/浏览器任务数据细分附录C 全部评测基准执行细节C.1 ClawEval、QwenClawBench评测流程C.2 MCP-Atlas评测配置C.3 OSWorld电脑操作评测C.4 Mind2Web/WebVoyager浏览器评测附录D 行为定量分析完整实验D.1 工具调用分布分析ZeroClawD.2 Codex运行时下智能体行为雷达指标1 引言当前大模型智能体广泛落地软件工程、命令行工具、桌面GUI、网页浏览器等开放场景但主流智能体均封装一套推理运行时(\mathcal{H})arness如Claude Code、OpenClaw、Codex负责多轮上下文管理、子智能体调度、工具调用封装、外部服务通信。运行时直接决定智能上限但现有开源训练框架存在两大核心痛点训练与部署割裂veRL、OpenRL(\mathcal{H})F等标准RL库仅支持单轮、轻量工具交互无法原生兼容多进程、带内部状态的商用运行时研究者只能简化复刻运行逻辑训练环境与真实部署环境不一致模型上线性能大幅衰减。规模化资源冲突GUI、命令行环境均需独立容器隔离资源传统RL框架将样本进程与训练GPU绑定无法弹性调度海量并行交互容器训练成本极高。本文核心贡献提出OpenForge RL通用训练架构由拦截代理K8s云编排器构成实现「任意运行时 × 任意环境」接入标准RLGRPO等无需修改训练内核所有运行时交互轨迹自动标准化兼容veRL等主流开源训练栈。跨领域大规模实证覆盖文本命令行工具、多模态桌面/浏览器两类完全不同的智能体场景仅少量自动生成任务即超越同规模基线GUI场景匹敌数倍参数量模型提供完整可复现实验。运行时行为定量研究首次在真实部署运行时完成训练后拆解运行时复杂度、RL优化对智能体行为的影响揭示泛化规律与当前能力短板。图2OpenForge RL完整数据流架构。左侧为标准RL训练模块veRL推理/训练器中间代理与编排核心拦截所有模型调用、重构交互轨迹右侧云容器沙箱隔离各类运行时与环境新增运行/环境仅需修改容器镜像无需改动训练代码。2 相关工作2.1 智能体推理运行时SWE-Agent等早期工作证明专用人机交互层可大幅提升代码任务效果后续Claude Code、OpenClaw、Codex等成熟运行时集成子智能体、长上下文规划、批量工具调用GUI领域Kimi-Agent、Molmo-Web封装截图视觉交互、键鼠动作。现有研究聚焦运行时设计本文反向研究如何在成品运行时内部完成端到端RL训练消除训练部署鸿沟。2.2 基于运行时的智能体训练veRL、Slime等开源RL框架支持PPO/GRPO但仅适配简单单轮工具交互复杂多进程运行时训练需重度定制训练循环扩展性极差。同期Polar框架仅覆盖软件工程场景本文覆盖文本多模态双大类、6套评测同时完成运行时行为机理分析。3 方法3.1 符号定义将环境交互建模为马尔可夫决策过程M⟨S,A,T,R,γ⟩\mathcal{M}\langle\mathcal{S},\mathcal{A},\mathcal{T},\mathcal{R},\gamma\rangleM⟨S,A,T,R,γ⟩。标准ReACT框架下每一步观测sts_tst​→ 策略πθ\pi_\thetaπθ​输出动作ata_tat​→ 状态转移st1s_{t1}st1​仅保留原始交互序列。而带运行时KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{H}\)}(…的智能体输入输出被运行时封装原始交互被隐藏本文定义完整轨迹KaTeX parse error: Cant use function \( in math mode at position 28: …angle(\mathcal{\̲(̲\mathcal{H}\)}(…KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{H}\)}(…为运行时处理后的输入上下文代理拦截全部KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{H}\)}与模型的请求提取标准化训练样本供GRPO等分组强化学习使用。3.2 OpenForge RL核心架构两大核心模块代理服务器、K8s交互编排器整体流程见上图2。3.2.1 交互样本编排基于Orchard云容器调度系统实现资源弹性分配每条交互样本独立创建K8s Pod容器隔离环境资源桌面GUI、命令行沙箱、浏览器支持Azure/AWS等公有云可动态扩缩并行样本数量不会阻塞GPU训练任务。3.2.2 异步样本与超时机制样本进程完全独立于训练节点单条卡死不会阻塞全局训练批次。为每条容器任务设置全局墙钟超时阈值超时直接终止容器向代理返回错误标记训练流程继续采集其他正常样本解决长任务卡死问题。3.2.3 异常容错处理网络故障、运行时崩溃、环境报错的不完整轨迹直接丢弃避免错误奖励信号污染梯度未来可针对部分完成轨迹设计信用分配方案。轨迹重构公式代理拦截所有运行时-LLM交互任务结束后重构带折扣回报样本KaTeX parse error: Cant use function \( in math mode at position 20: …\{(s^\mathcal{\̲(̲\mathcal{H}\)}_…本文γ1\gamma1γ1仅使用任务最终成功/失败终端奖励GRPO分组对比计算优势函数。3.3 任务数据自动生成流水线面向数据稀缺的GUI、命令行智能体场景设计全自动任务生成流水线批量产出SFT监督轨迹与RL交互任务。图3数据集自动化构建5阶段完整流程任务生成→过滤清洗→环境构建→自动化测试→迭代修复最终产出带可复现容器、校验脚本的标准任务。流水线5阶段生成候选任务基于网页、开源任务库、API知识库生成真实场景指令筛选去重剔除重复、不可行、逻辑残缺任务构建运行环境生成Docker镜像、校验脚本适配Claw/桌面Xvfb虚拟屏/远程浏览器自动化测试调用强模型执行验证任务可完整跑通迭代修复测试失败则自动修改环境、指令循环至校验通过。产出任务附带完整Dockerfile、校验脚本同时支持SFT蒸馏强模型轨迹与RL在线交互训练。图4三类训练任务领域分布饼图Claw命令行、电脑GUI、网页浏览器任务细分占比。表1 Claw/GUI训练数据集总量| 数据集指标 | Claw命令行 | 电脑GUI | 浏览器GUI ||—|—|—|| SFT轨迹数量 | 892 | 795 | 1496 || RL训练任务数 | 343 | 252 | 900 || 适配运行时 | ReACT/ZeroClaw/OpenClaw/Codex | Kimi-Agent修改版 | MolmoWeb修改版 |4 实验4.1 命令行Claw智能体文本工具调用4.1.1 SFT与RL数据基于Claw(\mathcal{H})ub、ZClawBench素材生成流水线任务每条任务绑定4类主流运行时ReACT基准、ZeroClaw、OpenClaw、Codex。SFT采用MiniMax-M2.5强模型轨迹蒸馏RL使用流水线生成343条全新交互任务。4.1.2 训练完整配置基座Qwen3-30B-A3B MoE激活参数量约3B训练后端veRL优化器GRPO硬件8×B200 GPUAzure云容器执行样本超参批次8分组大小8完整超参见附录A.14.1.3 评测基准ClawEval报告pass³、pass3基准原生ReACT运行时QwenClawBenchpass1基于OpenClawMCPAtlas89个无第三方凭证标准任务覆盖率≥0.75记成功。表2 Claw智能体全部基准性能对比| 模型 | ClawEval pass³ | ClawEval pass3 | QwenClawBench pass1 | MCPAtlas pass1 ||—|—|—|—|| 头部闭源大模型Claude Opus4.6 | 70.8 | 80.8 | 59.5 |76.4 || 同规模基线Qwen3-30B原生 | 14.3 | 39.8 | 21.8 | 12.4 || OpenForge-Claw(SFT) | 21.7 | 52.1 | 32.1 | 23.6 || OpenForge-Claw(SFTRL) |31.7|55.9|33.7|28.1|4.1.4 结果分析仅数千条自动生成任务SFTRL相比原生基座在全部基准大幅提升强化学习在线交互显著提升多工具规划、任务完成稳定性。4.2 多模态GUI智能体电脑浏览器4.2.1 数据构建电脑端AgentNet、合成桌面素材生成252条RL任务浏览器端WebGym过滤真实网站任务900条RL样本SFT全部使用Kimi-K2.5轨迹蒸馏。4.2.2 训练配置基座Qwen3-VL-8B多模态模型输入仅截图训练框架veRLGRPO云端容器运行Xvfb虚拟桌面/远程Chromium。完整超参见附录A.2。4.2.3 评测基准OSWorld-Verified桌面操作、Online-Mind2Web、WebVoyager网页交互全部报告pass1。表3 GUI多模态模型性能| 模型 | OSWorld-Verified | Online-Mind2Web | WebVoyager ||—|—|—|| 头部闭源GPT5.4 |75.0 |92.8 | - || 8B基线Qwen3-VL原生 |29.4 |38.7 |49.2 || OpenForge-GUI(SFT) |34.4 |57.4 |61.5 || OpenForge-GUI(SFTRL) |37.7|63.0|72.3|4.2.4 结果8B规模模型在WebVoyager超越MolmoWeb(8B)基线Online-Mind2Web提升24.3个百分点证明OpenForge可适配视觉、键鼠交互的复杂GUI运行时。5 讨论5.1 不同运行时学习难度差异评测OpenForge-Claw在四类运行时表现ReACT、ZeroClaw性能远高于OpenClaw、Codex。原因轻量运行时工具注册简单、上下文冗余更少模型更容易对齐复杂商用运行时长提示、嵌套子智能增加学习难度。表4 多运行时ClawEval表现| 模型 | ReACT pass1 | ZeroClaw pass1 | OpenClaw pass1 | Codex pass1 ||—|—|—|—|| 原生基座 | 26.1 |32.5 |11.4 |12.2 || SFTRL训练模型 |45.1 |48.5 |20.9 |32.5 |5.2 跨运行时泛化能力仅在ZeroClaw训练的模型在未见过OpenClaw/Codex上仍有显著提升同时在多运行时混合训练后全部运行时性能进一步上涨说明多样工具调用模式带来通用智能能力。表5 单/多运行时训练泛化效果| 训练运行时 | ZeroClaw | OpenClaw | Codex ||—|—|—|| 仅ZeroClaw训练 | 13.5 | 3.3 | 4.6 || 三类混合训练 | 16.0 | 9.5 | 20.3 |5.3 RL习得的核心智能能力图5左ZeroClaw下工具调用占比RL大幅减少通用shell调用转向专用业务工具右Codex运行时五大行为指标雷达图RL在格式鲁棒、工具覆盖、自校验、步骤效率全面提升仅错误修复提升有限。定量分析五大核心智能指标格式鲁棒性减少非法工具调用步骤效率缩短完成任务平均步数工具全覆盖完整调用任务所需全部工具自校验执行修改类工具后主动读取验证错误恢复工具报错后重试、调整方案。结论RL显著提升前四项但错误恢复能力提升幅度最小属于当前模型明显短板需要专门数据与优化目标。6 结论本文提出OpenForge RL开源训练框架解决现有RL库无法原生兼容各类智能体运行时的痛点通过拦截代理标准化运行时交互轨迹结合K8s弹性容器编排实现任意运行时、任意环境下大模型智能体端到端强化学习彻底消除训练-部署不一致。在文本命令行、多模态桌面/浏览器两大场景验证框架有效性同等参数量下性能全面超越开源基线依托原生运行时训练定量揭示运行时复杂度、RL优化对智能体行为的塑造规律。全部代码、数据集、完整训练评测脚本开源为运行时智能体的强化学习研究提供通用基础设施。未来工作将优化部分轨迹信用分配、专门增强错误修复类智能能力。

相关新闻

大模型选型与实战:从入门到进阶的AI应用指南

大模型选型与实战:从入门到进阶的AI应用指南

1. 大模型入门:从零开始理解AI巨无霸第一次接触"大模型"这个词时,我正盯着电脑屏幕发呆,心想这玩意儿跟普通AI有什么区别?直到亲眼见证ChatGPT在3秒内写完我憋了3小时的周报,才意识到技术变革已经来到家门口…

2026/9/23 13:23:38 阅读更多 →
视觉转代码的幻觉陷阱:从 Figma 到 Spring Boot 的自动化落地实录

视觉转代码的幻觉陷阱:从 Figma 到 Spring Boot 的自动化落地实录

视觉转代码的幻觉陷阱:从 Figma 到 Spring Boot 的自动化落地实录上周处理一个内部低代码平台的原型验证需求,团队尝试引入基于多模态大模型(LMM)的“UI 设计图/视频 -> 完整后端代码”生成方案。目标是让产品经理画好线框图或…

2026/9/23 15:50:30 阅读更多 →
如何一键找回QQ空间所有消失的青春记忆?GetQzonehistory完整备份指南

如何一键找回QQ空间所有消失的青春记忆?GetQzonehistory完整备份指南

如何一键找回QQ空间所有消失的青春记忆?GetQzonehistory完整备份指南 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾经想要回顾自己多年前在QQ空间发布的说说&…

2026/9/15 17:22:35 阅读更多 →

最新新闻

vLLM-Omni 新 TTS 模型怎么接?从跑通第一句音频到合入主线的完整实战路径

vLLM-Omni 新 TTS 模型怎么接?从跑通第一句音频到合入主线的完整实战路径

vLLM-Omni 新 TTS 模型怎么接?从跑通第一句音频到合入主线的完整实战路径 【免费下载链接】vllm-omni A framework for efficient model inference with omni-modality models 项目地址: https://gitcode.com/GitHub_Trending/vl/vllm-omni 你手上有一个 Hug…

2026/9/23 22:11:15 阅读更多 →
Python移动追踪目标检测实战:从YOLO到稳定ID的避坑指南

Python移动追踪目标检测实战:从YOLO到稳定ID的避坑指南

简介:这份资源面向具备一定Python基础、希望入门计算机视觉与人工智能方向的开发者,聚焦视频流中移动目标的定位与追踪问题,可应用于安全监控、自动驾驶、无人机导航等场景。压缩包共2个文件,均为py脚本,整体约3KB&…

2026/9/23 22:11:13 阅读更多 →
COSCon开源年会参会全攻略:从注册到复盘一次搞定

COSCon开源年会参会全攻略:从注册到复盘一次搞定

1. 先搞清楚这年会到底是啥,值不值得你跑一趟1.1 一个把“开源”从口号变成朋友圈的现场每年十月底到十一月初,国内开源圈都会迎来一次大规模线下聚会,这就是 COSCon 中国开源年会。今年是第十届,主办方把会期、场地和议程都做了升…

2026/9/23 22:11:11 阅读更多 →
YOLO红细胞目标检测:标签格式转换与训练调参实战指南

YOLO红细胞目标检测:标签格式转换与训练调参实战指南

简介:面向目标检测入门与进阶人群的YOLO红细胞检测数据集,使用真实场景下的高质量图像构建,包含1000张已标注图片,场景覆盖多种光照和背景条件,可支撑医学影像分析、细胞识别等方向的课程设计、毕业设计或算法预研。数…

2026/9/23 22:11:09 阅读更多 →
非定常气动理论包解析:Theodorsen函数复现与数据验证

非定常气动理论包解析:Theodorsen函数复现与数据验证

简介:泰德森理论是非定常空气动力学中用于分析周期性运动升力的经典解析方法,可计算翼面在非定常气流中的瞬态响应。这一压缩包面向空气动力学专业学生、飞行器设计人员与 MATLAB 仿真爱好者,重点解决二维翼型非定常升力求解、机动飞行与颤振…

2026/9/23 22:11:06 阅读更多 →
SPSS中VIF方差膨胀因子怎么看?一文搞定多重共线性诊断

SPSS中VIF方差膨胀因子怎么看?一文搞定多重共线性诊断

做回归分析时,我最常被同行问的问题之一就是:“SPSS到底在哪里看方差膨胀因子(VIF)?”找了半天,结果表里根本没有这一列。其实不是SPSS不给,而是它默认把这个功能藏起来了,需要在线性…

2026/9/23 22:09:59 阅读更多 →

日新闻

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A…

2026/9/23 0:00:23 阅读更多 →
2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我

2k显示屏性能优化踩坑:版本升级后API全变了,这份源码解析救了我 刚把开发环境的显示器从1080P换到2K,跑老项目直接报错,版本升级后 API…

2026/9/23 0:01:25 阅读更多 →
3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点

3步搞定美眉图实战项目,告别官方文档抓不住重点 官方文档翻了三遍还是云里雾里?别急,美眉图在实战项目中常被用来做数据可视化,但它的原理比你想的简单。今天咱们直接上手,用一个完整的小项目把美眉图跑通,不再死磕那些冗长的理论说明。…

2026/9/23 0:01:25 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →