强化学习 / OPD】OpenClaw-RL 源码阅读笔记 --- (7)--- Policy Serving
0x00 概要本系列的目的是借着对 OpenClaw-RL 源码的学习来梳理强化学习的一些相关概念和思想。所以会有一些基础知识、扩展和发散OpenClaw-RL 只是一个切入点。而且因为整篇系列是一个整体所以有些概念的解读/学习会在不同的文章中出现还请大家谅解。OpenClaw-RL 是一个用于在线强化学习Online RL的框架专门针对智能体工具使用场景。它通过从环境反馈中提取过程奖励信号来训练语言模型支持三种主要模式openclaw-rl基于二元奖励的强化学习Binary RL / GRPOopenclaw-opd基于后见之明提示的在线策略蒸馏On-Policy Distillation, OPDopenclaw-combine联合方法在同一 PPO 更新中同时利用 RL reward 和 OPD teacher signalframeworkOpenClawAPIServer是OpenClaw-RL系统中的核心组件它充当OpenClaw环境与 SGLang推理服务之间的代理服务器负责收集训练数据、计算奖励并提交样本给强化学习训练流程。当然也可以认为OpenClawAPIServer即是 Proxy Server也是 Policy Serving。0x01 基础1.1 架构我们回顾 OpenClaw-RL 的系统架构图如下整体架构1.2 OpenClawAPIServer 的定位OpenClawAPIServer 这个名字其实不准确更准确的命名应该是OpenClawProxyServer 或OpenClawTrainingPipeline—它是连接Policy Serving、Reward Judging 和Policy Training 三个功能层的协调器Orchestrator而非其中任何一层的实现体。职责以 OpenClawAPIServer 为例它独自承担了几个职责职责 属于哪个组件 具体代码HTTP 代理转发用户请求 Policy Serving接口层 httpx.post(sglang_chat_url)拦截 response logprobs Policy Serving数据采集 _extract_logprobs_from_chat_response()PRM 评分 Reward Judging _fire_prm_scoring() / _opd_evaluate()构造训练 Sample 训练数据管道 _submit_turn_sample()开关控制503 训练-服务调度 submission_enabled.is_set()类比OpenClawAPIServer “前台服务员数据记录员不是“厨房Policy本身。类比 对应组件餐厅服务员接单、传菜 OpenClawAPIServer厨房真正做菜 SGLang GPU 4-5Policy 推理食品检验员给菜打分 SGLang GPU 6-7PRM/Judge餐厅管理系统记录点单数据 output_queue → Slime1.3 继承关系 方法覆盖OpenClawAPIServer、OpenClawOPDAPIServer 和 OpenClawCombineAPIServer 的关系如下OpenClawAPIServer (Binary RL 基类, 独立)├─ _submit_turn_sample() score-loss_mask, at-least-one├─ _maybe_submit_ready_samples() 检查 PRM task done└─ _fire_prm_scoring() 触发 PRM 异步OpenClawOPDAPIServer (独立类, 不继承 OpenClawAPIServer)├─ _submit_turn_sample() 独立实现├─ _maybe_submit_ready_samples() 改用 opd_evaluate task├─ _opd_evaluate() hint judge teacher lp 计算├─ _fire_opd_task() 触发 OPD 异步评估└─ _compute_teacher_log_probs() / _compute_teacher_topk_logprobs()OpenClawCombineAPIServer extends OpenClawOPDAPIServer├─ _submit_turn_sample() ← 覆盖: OPD/OPDRL 路径├─ _submit_rl_turn_sample() ← 新增: RL-only 路径 (teacherrollout)└─ _maybe_submit_ready_samples() ← 覆盖: 3路分发逻辑1.4 真实策略服务器OpenClawAPIServer 的技术栈FastAPIWeb框架异步UvicornASGI 服务器基于uvloop高并发httpx/aiohttp异步 HTTP 客户端调用 SGLang和PRM真正的Policy Server是SGLangGPU4-5PolicyQwen3-4B模型权重 (注: RL server 默认 SERVED_MODEL_NAME“qwen3-8b”, OPD server 默认“qwen3-4b”, 实际部署可通过环境变量覆盖)Policy ServerSGLang推理引擎监听sglang_router_ip:sglang_router_portOpenClawAPIServer不运行模型推理它只是SGLang前面的一层拦截代理。用户 → OpenClawAPIServerFastAPI, Proxy → SGLangGPU4-5← 真正的Policy Server↓ 拦截SGLang PRM (GPU 6-7) ← Reward Judge评分↓output_queue↓Slime ← Policy Training的数据入口请求处理调用链HTTP 入口chat_completions()回合判断_handle_main_turn()/_handle_side_turn()SGLang 转发forward_to_sglang()PRM 触发_fire_prm_scoring() →_prm_evaluate()样本提交maybe_submit_ready_samples()→output_queue.put()样本构建调用数据缓冲_buffer_record()→存入_pending_records状态刷新flush_pending_record()→添加下一状态样本构建_submit_turn_sample()→创建Sample 对象FastAPI Proxy 如何转发到 SGLangOpenClawAPIServer 通过 FastAPI Proxy 实现了对外的入口内部通过 SlimeRouter 路由到实际的 SGLang 推理引擎, 实现了接入层与推理层的解耦。完整端口与中间层架构如下图所示。7-中间层架构端口关系总结 (run_qwen3_4b_openclaw_rl.sh 配置):PORT30000- FastAPI Proxy 监听端口 (外部可见, OpenClaw App 连接此处)args.sglang_router_ip/port- Slime 自动分配, 传给 API Server 作为 sglang_chat_url 的目标- 指向 SlimeRouter (内部负载均衡层)args.prm_router_ip/port- PRM Engine 的 /generate 地址 (GPU 6-7)- API Server 用于发送评分请求1.5 对比标准 RL Policy Serving:rollout时SGLang只服务训练系统内部批量生成→批量打分→批量训练无外部访问架构[训练系统 ⇆ [SGLang] 内部通信OpenClaw Policy Serving:rollout 时SGLang同时服务实用户通过OpenClawAppPRM评分内部调用Teacher forward passOPD 时架构[用户手机] → [FastAPI Proxy] → [SGLang] 外部流量[PRM judge] → [SGLang] 内部调用[训练系统] ← [Proxy] 数据管道工程挑战这导致了独特的工程挑战标准 RL 不需要处理的问题 OpenClaw 需要处理───────────────────── ────────────────────────❌ API 认证 ✅ SGLANG_API_KEY❌ 并发控制 ✅ semaphore❌ 503 暂停 ✅ submission_enabled❌ session 管理 ✅ X-Session-Id❌ 流式传输 ✅ SSE streaming❌ 用户体验 ✅ 低延迟响应❌ 数据筛选 ✅ main vs side turn❌ 超时处理 ✅ session timeout总结OpenClaw 的根本范式转变标准 RL 训练系统是 “主人” → 它决定问什么、答几次、怎么评分OpenClaw 训练系统是 “寄生者” → 它寄生在真实对话上被动收集数据这导致OpenClaw-RL Serving 如下特点Rollout 被动等待不是主动生成Environment 真实用户不是模拟器PRM 即用即评不是预训练 RMPolicy 对外服务不是内部推理一切设计选择都源于这个范式转变。0x02 详细功能梳理OpenClawAPIServer 本质上是一个智能代理它不仅转发请求还负责收集强化学习所需的训练数据通过PRM评估助手响应质量并将高质量的数据提交给训练流程。OpenClawOPDAPIServer 则是OPD模式的专用API服务器。2.1 OpenClawAPIServer

相关新闻

找网站建设公司,三种公司千万别碰!

找网站建设公司,三种公司千万别碰!

找网站建设公司,三种公司千万别碰!第一,不给源码的,直接pass,前期的投入,后期一换服务商全都打水漂!第二类要选十年以上的网站建设公司,网站建设属于轻资产行业,时间越长…

2026/7/22 9:44:24 阅读更多 →
企业级AI模型接入的协议适配与安全合规选型指南

企业级AI模型接入的协议适配与安全合规选型指南

背景:2026年国内团队调用海外大模型的现实瓶颈 进入2026年下半年,以Claude Sonnet 5.1、Opus 4.8为代表的海外大模型,在复杂逻辑推演、超长上下文理解及代码生成领域的优势依然显著。然而,国内开发者在实际生产环境接入时&#xf…

2026/7/22 9:44:24 阅读更多 →
GLM与Kimi Code技术协同:AI编程助手API集成实战指南

GLM与Kimi Code技术协同:AI编程助手API集成实战指南

最近在AI编程助手领域,一个值得关注的现象是:智谱GLM团队的技术专家们开始频繁为Kimi Code功能"打Call"。这不仅仅是简单的商业互吹,而是标志着国产AI编程工具正在进入一个全新的发展阶段。 如果你还在纠结"豆包跟Kimi哪个好…

2026/7/22 9:44:24 阅读更多 →

最新新闻

【实战】黄金暴涨破 $4100 与 A 股深 V 大反弹!如何用 Python + QuantDash 实现跨市场(A股/美股/贵金属)联动套利监控

【实战】黄金暴涨破 $4100 与 A 股深 V 大反弹!如何用 Python + QuantDash 实现跨市场(A股/美股/贵金属)联动套利监控

导言 / TL;DR 2026 年 7 月下旬,随着国际政治局势变化,现货黄金价格强势冲破 4100 美元/盎司大关,创下历史新高;与此同时,A 股黄金板块与科技板块在经历了前期的探底后,迎来了强劲的“深 V”大反弹[1][2][…

2026/7/23 12:38:08 阅读更多 →
嵌入式GPIO寄存器深度解析:从原理到实战驱动开发

嵌入式GPIO寄存器深度解析:从原理到实战驱动开发

1. 从零开始:理解GPIO寄存器的核心价值 如果你刚开始接触嵌入式开发,可能会觉得GPIO(通用输入输出)就是简单的 digitalWrite() 和 digitalRead() 函数调用。但当你真正需要实现一个稳定的按键消抖、一个高速的PWM输出&#xf…

2026/7/23 12:38:08 阅读更多 →
基于LS1028A与OpenWRT打造高性能软路由:硬件加速与万兆网络实战

基于LS1028A与OpenWRT打造高性能软路由:硬件加速与万兆网络实战

1. 项目概述:为什么选择LS1028A来打造终极软路由? 最近几年,软路由这个概念在玩家圈子里越来越火。从最开始用淘汰的旧电脑刷个OpenWRT,到后来各种工控机、迷你主机百花齐放,大家追求的无非就是更强的性能、更丰富的功能和更自由的折腾空间。但说实话,很多所谓的“高性能…

2026/7/23 12:38:08 阅读更多 →
ERROR757错误代码解析与分布式系统故障排查指南

ERROR757错误代码解析与分布式系统故障排查指南

1. 关于"ERROR757"的初步探索最近在技术社区和开发者论坛中,一个名为"ERROR757"的神秘代码频繁出现,引起了我的强烈好奇。这个错误代码不像我们常见的HTTP状态码或系统错误编号,它没有标准的文档说明,也没有明…

2026/7/23 12:38:08 阅读更多 →
VAP 直播礼物动效完整指南

VAP 直播礼物动效完整指南

直播礼物动效怎么做?VAP 从原理到 Android/iOS/Web 三端接入实战(附性能优化)关键词:VAP、直播礼物动效、透明视频、腾讯 VAP、Android 动画、iOS 动画、动效性能优化、虚拟礼物、SVGA 对比摘要:VAP 是腾讯企鹅电竞开源…

2026/7/23 12:38:07 阅读更多 →
031、YOLOv8改进实战:ShuffleAttention原理与C2f_ShuffleAttention模块代码实现

031、YOLOv8改进实战:ShuffleAttention原理与C2f_ShuffleAttention模块代码实现

031、YOLOv8改进实战:ShuffleAttention原理与C2f_ShuffleAttention模块代码实现 一、从一次失败的涨点说起 上个月做工业缺陷检测项目,baseline是YOLOv8s,在PCB板表面划痕数据集上mAP卡在82.3%死活上不去。试了CBAM、SE、ECA这些注意力&#…

2026/7/23 12:37:07 阅读更多 →

日新闻

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:25 阅读更多 →
AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析

更多请点击: https://codechina.net 第一章:AI写作开头钩子设计:为什么你的AI文案完读率不足18%?——基于2,346篇A/B测试报告的归因分析 在对2,346篇跨行业AI生成文案的A/B测试数据进行聚类分析后,我们发现&#xff1…

2026/7/23 0:01:26 阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:01:26 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 8:58:19 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 19:43:43 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 12:54:44 阅读更多 →

月新闻