OpenClaw-RL on Reef:让你的个人Agent从日常使用中免费学会变强的完整指南
OpenClaw-RL on Reef让你的个人Agent从日常使用中免费学会变强的完整指南【免费下载链接】reefInfrastructure for continually self‑improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reefOpenClaw-RL是一种面向个人 Agent的强化学习方法而Reef是它为 Agent 持续学习提供的基础设施Continual Learning Infra。一句话概括你不需要标注数据、不需要写奖励函数——Agent 每一次被用户接受或嫌弃的对话本身就是一条免费的训练信号。Reef 在后台默默读取这些信号边服务边更新模型权重让 Agent 越用越懂你。一、OpenClaw-RL 的核心思想奖励信号是免费的传统强化学习最贵的地方是奖励信号要么人工标注要么写规则要么训练奖励模型。OpenClaw-RL 的洞察是——用户的下一条消息就是天然的奖励用户的下一条消息信号含义继续追问、接着推进任务✅ 接受回复满足了偏好抱怨、要求重做、表达不满❌ 拒绝回复踩了雷这意味着训练信号和正常使用完全重合用户什么都不用额外做Agent 就在免费地学习。这是它区别于传统 RLHF 的关键——不依赖离线数据集而是从在线使用中持续采集。在 Reef 中这一切都发生在 recipes/openclawrl/ 这个 recipe 包里官方配方文档见 docs/user-guide/recipes/openclawrl.rst。二、Reef 如何实现流量本身就是老师2.1 会话绑定让每一轮对话可归因Agent 的每次推理请求都会被 Reef 记录下来。处理器从这些已记录的流量中重建出完整会话把用户下一条消息准确绑定到上一轮回复上可靠方式harness 在每次推理请求中携带一个对话唯一的x-reef-tag-session标签Reef 按标签到达顺序绑定各轮兜底方式没有标签时用客户端重发的不断变长的历史做前缀匹配会话重建逻辑在 recipes/openclawrl/sessions.py整个反馈处理器在 recipes/openclawrl/processor.py。值得强调的是Agent 端零侵入——它不知道 Reef 的存在也不上报任何训练数据学习信号完全来自 Reef 侧的旁路观察。2.2 PRM 裁判 后见之明提示hindsight hint当用户下一状态到达、某一轮完成后Reef 调用一个独立部署的PRM过程奖励模型来给这一轮投票这条消息是否表达接受若是接受PRM 还会额外提出一个后见之明提示——一句如果用户当初就这么说模型就会直接给出这个回复的简短指令。PRM 裁判实现在 recipes/openclawrl/prm.py在专用 worker 上独立运行与被训练的模型互不干扰。2.3 双信号训练RL 在线蒸馏OpenClaw-RL 用一个训练目标同时利用两类信号权重可调默认各 1.0RL 项以该轮的原始奖励作为优势函数的 PPO让被接受的行为概率上升OPD 项on-policy distillation把策略拉向带着 hindsight hint 提示的冻结教师模型等于让 Agent 从自己已经成功的经验中蒸馏训练配方loss 族openclawrl定义在 recipes/openclawrl/recipe.py目标函数与损失选择在 recipes/openclawrl/objective.py。每个训练步完成后新权重热切换回推理引擎——下一个会话直接用上新学到的行为服务从不停机。三、实验复现72 场 GSM8K 作业对话仓库内置了一个完整可跑的模拟实验recipes/openclawrl/examples/openclawrl/README.md把论文设定完整复刻学生一个由 Qwen3-32B 扮演的小学生带着72 道 GSM8K 数学作业逐个会话来问老师一个标准安装的 Hermes Agent策略模型是 Qwen3-4B-Thinking隐藏的偏好学生要求作业看起来像人写的——不许加粗、不许列表、不许最终答案这类 AI 味标记但必须展示完整的计算步骤。学生从不说出口Agent 只能从被嫌弃/被接受的反应中学这正对应标题里的从真实使用中学偏好只存在于用户的反应里而不在任何指令中。四、结果14 场会话就用顺了你的偏好上面这张学习曲线来自一次完整记录的运行前 36 场会话红色曲线是累计被接受的会话数持续增长蓝色/绿色曲线是近 10 场会话中仍出现加粗 / 列表的比例——两者都在明显下降虚线处第14场会话达到论文的适应判据连续 3 场通过也就是说从第 1 场会话被嫌弃格式太 AI到第 16 场会话首条回复直接通过Agent 只经历了十几场真实对话就完成了适应。实验结果目录见 recipes/openclawrl/examples/openclawrl/results/。五、动手运行从克隆仓库到一条命令 实验是单主机部署需要7 张 GPU4 卡训练、1 卡推理 rollout、1 卡 PRM、1 卡学生模型。1. 克隆仓库并构建镜像git clone https://gitcode.com/gh_mirrors/reef7/reef cd reef docker build -f docker/Dockerfile.reef -t reef-openclawrl .2. 下载模型# 策略模型 PRM 裁判 hf download Qwen/Qwen3-4B-Thinking-2507 --local-dir ~/models/Qwen3-4B-Thinking-2507 # 扮演学生的 32B 模型 hf download Qwen/Qwen3-32B --local-dir ~/models/Qwen3-32B3. 一键启动bash recipes/openclawrl/examples/openclawrl/run.shrun.sh会构建学生服务镜像、按 recipes/openclawrl/examples/openclawrl/serve.yaml 拉起整个训练栈Reef PRM 学生模型各自占独立 GPU、等待健康检查通过后按顺序跑完 72 场会话重复执行还能从上次中断处续跑。运行细节GPU 分配、断点恢复、WB 曲线导出完整记录在实验 README 中。六、为什么这值得你关注OpenClaw-RL on Reef 展示了一条低成本的 Agent 进化路径信号免费用户反应即奖励无需标注管线Agent 零改造Agent 照常工作学习发生在 Reef 的旁路里在线进化权重热切换服务不中断用一天强一分可插拔整套机制就是一个 Reef recipe配置项批次大小、会话 TTL、PRM 参数等在 docs/user-guide/recipes/openclawrl.rst 中有完整列表如果你的 Agent 也在同样的话被用户纠正了第三次现在你可以让 Reef 替你记住这件事了。【免费下载链接】reefInfrastructure for continually self‑improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reef创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

用代码和AI批量生产视频:ffmpeg、Remotion、Manim与Claude Code实战

用代码和AI批量生产视频:ffmpeg、Remotion、Manim与Claude Code实战

1. 从"video-use"这个模糊标题说起:它到底想解决什么问题第一次看到"video-use"这个标题,加上正文和关键词都是空的,我脑子里第一反应是:这大概率是一个围绕"用代码来操作视频"的工具集或者工作流封…

2026/9/29 11:04:40 阅读更多 →
rrdtool 1.4.7源码编译安装与监控命令实战指南

rrdtool 1.4.7源码编译安装与监控命令实战指南

简介:rrdtool-1.4.7.tar.gz 是 RRDTool 1.4.7 稳定版源码包,面向运维工程师、监控系统二次开发者和网络管理人员,可与 Smokeping、Cacti、MRTG 等监控工具配合,解决性能数据采集、时序存储与趋势展示问题。包体压缩后约 1.29MB&am…

2026/9/29 22:31:34 阅读更多 →
OpenShell Go SDK 凭据刷新(Provider Credential Refresh)实战:自动化 API 密钥轮换与状态监控

OpenShell Go SDK 凭据刷新(Provider Credential Refresh)实战:自动化 API 密钥轮换与状态监控

【免费下载链接】OpenShell OpenShell is the safe, private runtime for autonomous AI agents. 项目地址: https://gitcode.com/gh_mirrors/op/OpenShell 点击查看 免费下载 导读:本文围绕 OpenShell Go SDK 中 client.Providers().Refresh() 提供的凭…

2026/9/28 15:16:24 阅读更多 →

最新新闻

C++/MFC/MySQL网络对战游戏平台毕业设计:Socket通信与五子棋实现

C++/MFC/MySQL网络对战游戏平台毕业设计:Socket通信与五子棋实现

简介:这份资源是面向计算机软件专业本科毕业设计场景的《网络对战游戏平台系统设计》完整论文文档,适合正在准备毕设选题、需要参考同类系统实现思路的学生,以及想了解C网络编程与桌面应用开发的学习者。压缩包内共1个doc文件,约6…

2026/9/30 14:51:53 阅读更多 →
LangChain RAG 问答应用实战:从 PDF 索引到多轮对话调优

LangChain RAG 问答应用实战:从 PDF 索引到多轮对话调优

简介:这份PDF面向大模型与人工智能方向的学习者及面试准备者,聚焦基于langchain框架的RAG问答应用实战,帮助读者理解检索增强生成从数据准备到问答落地的完整链路。资源包内仅含1个PDF文件,约390KB,内容以图文与代码示…

2026/9/30 14:51:53 阅读更多 →
PyTorch PolynomialLR学习率调度:原理、参数详解与工程实践避坑指南

PyTorch PolynomialLR学习率调度:原理、参数详解与工程实践避坑指南

聊到深度学习训练里那个“最后一段路怎么走”,我最近几年最常写进代码的就是 PyTorch 自带的 PolynomialLR 。它其实很简单:用一条多项式曲线把学习率从初始值平滑地拉低,最后停在你指定的一个低位上。没有花哨的自动监控,也不需…

2026/9/30 14:51:53 阅读更多 →
VSCode Python开发环境配置:MS Python插件与避坑指南

VSCode Python开发环境配置:MS Python插件与避坑指南

简介:这份PDF资料面向使用VSCode进行Python开发的程序员,尤其是希望把编辑器打造成高效IDE的初学者与进阶者,系统梳理了微软官方MS Python插件及配套扩展的实用配置。内容围绕静态代码扫描、智能提示与自动补全、自动缩进、代码格式化、代码重…

2026/9/30 14:51:53 阅读更多 →
PolynomialLR学习率调度器全解析:原理、代码与调参技巧

PolynomialLR学习率调度器全解析:原理、代码与调参技巧

PolynomialLR 这个调度器,在 PyTorch 的学习率调整家族里属于“低调但好用”的那一类。相比 CosineAnnealingLR 的花哨、ReduceLROnPlateau 的智能、StepLR 的简单粗暴,PolynomialLR 走的是“一条曲线降到底”的路线:用多项式函数把学习率从初…

2026/9/30 14:51:53 阅读更多 →
小型校园网组网实验:子网划分、VLAN与单臂路由配置详解

小型校园网组网实验:子网划分、VLAN与单臂路由配置详解

简介:东北大学计算机网络课程的这份实验报告,围绕小型校园网的设计与组建,完整呈现了从需求分析到网络调试的实践流程,适合计算机网络专业学生及正在完成同类实验的初学者参考。压缩包内仅含1个doc文档,大小约1.21MB&a…

2026/9/30 14:50:50 阅读更多 →

日新闻

Base64 图片头部特征识别:从文件头到格式判断的完整指南

Base64 图片头部特征识别:从文件头到格式判断的完整指南

1. 项目概述:为什么说看懂 base64 图片头部是基本功这几年跟 base64 打交道的机会越来越多,后端接口返回图片、前端渲染验证码、小程序里存小图、还有一些老系统导出报表,动不动就给你一段长到怀疑人生的 base64 字符串。很多人拿到字符串就直…

2026/9/30 0:00:35 阅读更多 →
Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

Java公交站牌广告管理系统:JSP+Servlet+MySQL实战落地指南

简介:本资源是一份面向Java初学者与课程设计学生的公交站牌广告灯箱管理系统毕业设计文档,聚焦城市公共广告资源信息化管理痛点,提供从需求分析到技术实现的完整方案。文档采用标准学术论文结构,含摘要、英文摘要、目录及五章正文…

2026/9/30 0:00:35 阅读更多 →
用 Redis Lua 构建大模型 API 多租户原子配额治理体系

用 Redis Lua 构建大模型 API 多租户原子配额治理体系

我去年年底接了一个内部 AI 平台的治理需求,背景很直接:公司把 DeepSeek、MiniMax 这类大模型 API 统一封装成内部网关,开放给几个业务团队用。结果第一个月账单出来,额度直接超了 4 倍。仔细查日志,发现原因并不复杂—…

2026/9/30 0:00:35 阅读更多 →

周新闻

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/30 13:14:22 阅读更多 →
SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/29 16:41:41 阅读更多 →
FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏

FireRed-OpenStoryline少样本仿写深度解析:AI Agent如何复刻你的独特文案风格与节奏 【免费下载链接】FireRed-OpenStoryline FireRed-OpenStoryline is an AI video editing agent that transforms manual editing into intention-driven directing through natural language …

2026/9/30 13:14:49 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/29 19:29:29 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/29 5:58:00 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/29 3:55:56 阅读更多 →