相比普通 SACAgent 的关键差异
普通 SACAgent 的 actor 输出完整动作critic 接收完整动作。但 SACAgentHybridSingleArm 做了三层动作拆分第一层连续动作由 SAC actor 输出初始化 policy 时action_dim 被设为环境动作维度减 1policy_def Policy(…action_dimactions.shape[-1]-1, # 7 - 1 6)如果环境 action 是 7 维actor 只输出前 6 维——末端执行器的连续控制量。第二层普通 critic 也只评估连续动作Critic 初始化时只用去掉夹爪的动作critic [observations, actions[…, :-1]]训练 critic 时也只取前 6 维actions batch[“actions”][…, :-1]这意味着普通 SAC critic 学习的是Qee(s,aee)而不是Q(s,aee,agripper)。它专注于连续末端执行器动作的价值估计。第三层夹爪动作由 GraspCritic 单独学习SACAgentHybridSingleArm 在网络集合里额外注册了 “grasp_critic”并给它单独配置 optimizernetworks {“actor”: actor_def,“critic”: critic_def,“grasp_critic”: grasp_critic_def,“temperature”: temperature_def,}“grasp_critic”: make_optimizer(**grasp_critic_optimizer_kwargs)在 create_pixels 中GraspCritic 的构造方式如下grasp_critic_def partial(GraspCritic, encoderencoders[“grasp_critic”], networkgrasp_critic_backbone)(name“grasp_critic”)6.3 动作执行流程Rolloutsample_actions 是 SAC actor 和 GraspCritic 配合最直观的接口。执行流程分为四步第一步actor 采样连续末端执行器动作dist self.forward_policy(observations, rngseed, trainFalse)ee_actions dist.sample(seedseed)这里得到前 6 维动作[x, y, z, roll, pitch, yaw]。第二步GraspCritic 输出 3 个夹爪 Q 值grasp_q_values self.forward_grasp_critic(observations, rnggrasp_key, trainFalse)输出类似Q(close) 1.2Q(keep) 0.7Q(open) 0.1第三步argmax 选择夹爪动作grasp_action grasp_q_values.argmax(axis-1)grasp_action grasp_action - 1 # {0,1,2} → {-1,0,1}映射关系argmax0 → 环境动作 -1关argmax1 → 环境动作 0保持argmax2 → 环境动作 1开。第四步拼接成完整动作return jnp.concatenate([ee_actions, grasp_action[…, None]], axis-1)最终输出[continuous_0, continuous_1, continuous_2,continuous_3, continuous_4, continuous_5,discrete_gripper_action] ← 环境真正需要的完整 7 维动作连续控制分支的 Rollout 符合经典 SAC 范式——只依赖 Actor 网络Critic 不参与推理。离散控制分支则不同——由于没有独立的 Actor 网络GraspCritic 在推理时直接充当决策者通过 argmax 选出最优离散动作。6.4 训练流程SACAgentHybridSingleArm.loss_fns 返回四个独立的 lossreturn {“critic”: self.critic_loss_fn,“grasp_critic”: self.grasp_critic_loss_fn,“actor”: self.policy_loss_fn,“temperature”: self.temperature_loss_fn,}训练脚本中hybrid agent 的更新分为两个阶段Critic 训练阶段同时更新 critic 和 grasp_critictrain_critic_networks_to_update frozenset({“critic”, “grasp_critic”})完整训练阶段更新全部四个网络train_networks_to_update frozenset({“critic”, “grasp_critic”, “actor”, “temperature”})Critic Loss连续动作 SAC目标 Q 采用 Clipped Double-Qyrγ⋅miniQ¯θi(s′,a′)代码实现target_next_qs self.forward_target_critic(…)target_next_min_q target_next_qs.min(axis0)target_q rewards discount * masks * target_next_min_qpredicted_qs self.forward_critic(batch[“observations”], actions, …)critic_loss jnp.mean((predicted_qs - target_qs) ** 2)GraspCritic LossDQN 风格GraspCritic 采用 Double DQN 风格——用 online 网络选动作用 target 网络评估next_grasp_qs self.forward_grasp_critic(batch[“next_observations”], rngrng)best_next_grasp_action next_grasp_qs.argmax(axis-1)target_next_grasp_qs self.forward_target_grasp_critic(…)target_next_grasp_q target_next_grasp_qs[jnp.arange(batch_size), best_next_grasp_action]grasp_rewards batch[“rewards”] batch[“grasp_penalty”]target_grasp_q grasp_rewards discount * masks * target_next_grasp_qpredicted_grasp_q predicted_grasp_qs[jnp.arange(batch_size), grasp_action]grasp_critic_loss jnp.mean((predicted_grasp_q - target_grasp_q) ** 2)Actor Loss标准 SACActor 采样连续动作最大化objectiveQ(s,a)−αlogπ(a|s)actor_objective predicted_q - temperature * log_probsactor_loss -jnp.mean(actor_objective)Temperature Loss自动调温温度参数α自动调节保证策略熵不低于目标值——策略熵低于 target 则α增大并增加探索高于 target 则α减小并减少探索。6.5 Reward 的分工设计这是混合 agent 中最精妙的工程细节之一。普通 SAC critic 的目标使用batch[“rewards”]GraspCritic 的目标使用grasp_rewards batch[“rewards”] batch[“grasp_penalty”]设计者的意图很明确夹爪网络不仅要学习任务成功奖励还要特别学习不要做无意义夹爪动作。例如 USB pickup insertion 任务中grasp_penalty 的计算逻辑是if (action[-1] -0.5 and self.last_gripper_pos 0.9) or (action[-1] 0.5 and self.last_gripper_pos 0.9):info[“grasp_penalty”] self.penaltyelse:info[“grasp_penalty”] 0.0通俗理解夹爪已经开得很大还继续开或者已经关得很紧还继续关——这种动作没有实际意义甚至可能损坏硬件或扰乱任务。这类惩罚不适合影响机械臂连续运动的 SAC critic——因为 SAC critic 评估的是 6 维连续动作的价值加上夹爪惩罚会混淆它对末端执行器动作质量的判断。但 GraspCritic 专门学习夹爪的离散决策加上 grasp_penalty 可以更精准地训练什么时候该夹、什么时候该放的策略。6.7 配合全景图

相关新闻

深入解析SoC调试子系统:从JTAG接口到交叉触发与片上追踪技术

深入解析SoC调试子系统:从JTAG接口到交叉触发与片上追踪技术

1. 调试子系统:嵌入式开发的“听诊器”与“手术刀”在嵌入式系统开发的世界里,调试的难度常常与系统的复杂性成正比。当你的代码在由多核处理器、复杂总线、专用加速器和实时外设构成的片上系统(SoC)中运行时,传统的“…

2026/7/25 14:45:40 阅读更多 →
AM263P外设DMA与中断集成解析:MCAN、LIN、RTI、WWDT、DCC实战

AM263P外设DMA与中断集成解析:MCAN、LIN、RTI、WWDT、DCC实战

1. 项目概述与核心价值在嵌入式系统,尤其是汽车电子和工业控制这类对实时性、可靠性要求极高的领域,芯片内部外设模块的协同工作能力直接决定了整个系统的性能上限。我们常常会面临这样的挑战:一个核心处理器(比如R5F)…

2026/7/24 3:22:57 阅读更多 →
深入解析TMS320F28P65x系统控制寄存器:从时钟门控到低功耗管理实战

深入解析TMS320F28P65x系统控制寄存器:从时钟门控到低功耗管理实战

1. 项目概述在嵌入式系统开发,尤其是基于德州仪器(TI)C2000系列微控制器的项目中,系统控制寄存器(System Control Registers)是连接软件与硬件的关键桥梁。它们就像是微控制器内部的“控制面板”&#xff0…

2026/7/25 12:22:14 阅读更多 →

最新新闻

如何通过KK-HF Patch解决Koikatsu游戏体验的5大常见问题

如何通过KK-HF Patch解决Koikatsu游戏体验的5大常见问题

如何通过KK-HF Patch解决Koikatsu游戏体验的5大常见问题 【免费下载链接】KK-HF_Patch Automatically translate, uncensor and update Koikatu! and Koikatsu Party! 项目地址: https://gitcode.com/gh_mirrors/kk/KK-HF_Patch KK-HF Patch是一个专为Koikatu和Koikatsu…

2026/7/25 19:33:18 阅读更多 →
5分钟掌握:如何用docx2tex将Word文档完美转换为LaTeX格式

5分钟掌握:如何用docx2tex将Word文档完美转换为LaTeX格式

5分钟掌握:如何用docx2tex将Word文档完美转换为LaTeX格式 【免费下载链接】docx2tex Converts Microsoft Word docx to LaTeX 项目地址: https://gitcode.com/gh_mirrors/do/docx2tex 你是否曾为学术论文、技术文档或出版物的格式转换而烦恼?docx…

2026/7/25 19:33:18 阅读更多 →
QZoneExport:将QQ空间记忆完整保存到本地的终极解决方案

QZoneExport:将QQ空间记忆完整保存到本地的终极解决方案

QZoneExport:将QQ空间记忆完整保存到本地的终极解决方案 【免费下载链接】QZoneExport QQ空间导出助手,用于备份QQ空间的说说、日志、私密日记、相册、视频、留言板、QQ好友、收藏夹、分享、最近访客为文件,便于迁移与保存 项目地址: https…

2026/7/25 19:33:18 阅读更多 →
League Akari:英雄联盟玩家的终极本地化智能辅助工具

League Akari:英雄联盟玩家的终极本地化智能辅助工具

League Akari:英雄联盟玩家的终极本地化智能辅助工具 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit 在英雄联盟竞技的世界里&…

2026/7/25 19:33:18 阅读更多 →
阿里开源Page Agent:一行JS让AI在网页中自动化交互

阿里开源Page Agent:一行JS让AI在网页中自动化交互

如果你正在开发一个SaaS产品,想快速集成一个AI助手来帮用户填写表单、导航页面,但不想重写后端、不想依赖浏览器插件、也不想搞复杂的无头浏览器,那么阿里开源的Page Agent可能就是你最近最值得关注的项目。 这个项目在GitHub上已经获得了超过20k的Star,热度持续攀升。它最…

2026/7/25 19:33:18 阅读更多 →
BiliFocus浏览器插件:屏蔽B站分心元素,打造专注学习环境

BiliFocus浏览器插件:屏蔽B站分心元素,打造专注学习环境

你有没有过这样的经历:打开B站只是想查一个技术教程,结果首页推荐了一个“十分钟学会XX”的视频,点进去看了五分钟,侧边栏又冒出一个“程序员搞笑日常”,等回过神来,已经刷了一个小时,最初要查的…

2026/7/25 19:32:18 阅读更多 →

日新闻

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:00:35 阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:00:35 阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:00:35 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/25 5:08:22 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/25 5:13:53 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 18:52:18 阅读更多 →

月新闻