【Bug已解决】[Bug]: RNG states from multiple backends (e.g. CUDA + HPU) are saved but only one is restore
【Bug已解决】[Bug] RNG states from multiple backends (e.g. CUDA HPU) are saved but only one is restored on load_state 解决方案一、现象长什么样在一个同时用到多种设备后端的环境里训练例如模型主体在 CUDA 上、某些预处理 / 评估算子在 HPU 上或异构集群里 CUDA HPU 混布调用accelerator.save_state()后checkpoint 里确实包含两个后端的 RNG 状态checkpoint/ ├─ cuda_rng_state (存在) └─ hpu_rng_state (存在)但accelerator.load_state()恢复时只有其中一个后端被还原另一个后端的 RNG 停留在当前未恢复状态。后果复现实验时HPU 侧或 CUDA 侧的随机性不一致数据增强 / 采样结果对不上多后端混布的 pipeline 在恢复后行为与从零跑不同难以 debug没有报错只是少恢复了一份 RNG——典型 silent 数据不一致。最隐蔽的是单后端纯 CUDA场景完全正常只有多后端共存才会暴露而很多人本地是单卡单后端CI 才是异构环境于是问题只在 CI 复现时才被发现。二、背景PyTorch 的 RNG 状态是按设备类型backend分别管理的torch.cuda.get_rng_state()、torch.hpu.get_rng_state()、torch.cpu.get_rng_state()各自独立。accelerate的save_state在收集 RNG 时本应遍历当前进程涉及到的所有后端把每一份都写进 checkpoint。load_state的对称职责是把每一份 RNG 状态还原回对应后端。问题出在这最后一步——恢复逻辑用了一个单一键比如只认cuda_rng_state或者用一个循环但每次都覆盖同一个目标后端导致cuda的 state 写进了cuda_rng_statehpu的 state 也写进了同名 / 同目标第二次覆盖第一次或者反过来恢复时只恢复了遍历到的第一个后端第二个被跳过。根因是恢复端把多后端当成单后端处理。保存端是对的多份都在恢复端是错的只还原一份于是出现存了俩、还原了一个的错位。三、根因抽象成代码示意非照抄源码# 保存端正确每个后端都存 def save_rng(ckpt): ckpt[cuda_rng_state] torch.cuda.get_rng_state() if hpu_available: ckpt[hpu_rng_state] torch.hpu.get_rng_state() # 恢复端错误只认 cudahpu 被忽略 def load_rng(ckpt): torch.cuda.set_rng_state(ckpt[cuda_rng_state]) # 只还原 cuda # hpu_rng_state 读了却没 set 回去 - 丢失根因链条保存端正确收集了所有后端的 RNGcheckpoint 含多份恢复端硬编码只处理cuda_rng_state其他后端的 state 虽在 checkpoint 里却没被set回去多后端环境下被忽略的后端 RNG 停留在旧状态无报错仅随机性不一致——典型 silent 数据错位。为什么单后端发现不了因为纯 CUDA 时只有cuda_rng_state一份恢复端只认 cuda恰好正确一旦混入 HPU恢复端的假设就破了。四、最小可运行复现用纯 Python 模拟保存多份、恢复只一份导致后端 RNG 不一致# repro_multi_backend_rng.py class BackendRNG: def __init__(self, name, seed): self.name name self.state seed def get(self): return self.state def set(self, s): self.state s def save_rng(backends): ckpt {} for b in backends: ckpt[b.name _rng] b.get() # 每个后端都存 return ckpt def load_rng_buggy(backends, ckpt): # BUG只恢复第一个后端 first backends[0] first.set(ckpt[first.name _rng]) def main(): cuda BackendRNG(cuda, 111) hpu BackendRNG(hpu, 222) ckpt save_rng([cuda, hpu]) # 模拟恢复前状态被打乱 hpu.set(999) load_rng_buggy([cuda, hpu], ckpt) print(恢复后 hpu state, hpu.get()) assert hpu.get() ! 222, hpu RNG 未被恢复 - silent 不一致 if __name__ __main__: main()运行输出恢复后 hpu state 999hpu的 RNG 停在 999未恢复成 222正是真实 bug 的抽象多份存了、只一份还原。五、解决方案第一层最小直接修复最小且必须的一步恢复端遍历 checkpoint 里所有后端的 RNG逐份set回去。# fix_layer1.py def load_rng(ckpt): if cuda_rng_state in ckpt: torch.cuda.set_rng_state(ckpt[cuda_rng_state]) if hpu_rng_state in ckpt: torch.hpu.set_rng_state(ckpt[hpu_rng_state]) # 补上被忽略的 if cpu_rng_state in ckpt: torch.set_rng_state(ckpt[cpu_rng_state])这一层改动最小把每个后端都set回去。但它用硬编码的if链新增后端如xpu、npu时容易又漏一个。六、解决方案第二层结构性改进把后端 - 存取函数收敛成一张注册表保存 / 恢复都基于它遍历杜绝硬编码遗漏# fix_layer2.py from dataclasses import dataclass from typing import Callable, Dict dataclass(frozenTrue) class RngBackend: name: str get: Callable[[], object] set: Callable[[object], None] available: Callable[[], bool] class RngRegistry: def __init__(self): self._backends: Dict[str, RngBackend] {} def register(self, b: RngBackend) - None: self._backends[b.name] b def save(self) - dict: ckpt {} for name, b in self._backends.items(): if b.available(): ckpt[name _rng] b.get() return ckpt def load(self, ckpt: dict) - None: for name, b in self._backends.items(): key name _rng if b.available() and key in ckpt: b.set(ckpt[key]) # 每个可用后端都还原 # 用法示例实际接入 torch.cuda / torch.hpu reg RngRegistry() reg.register(RngBackend(cuda, torch.cuda.get_rng_state, torch.cuda.set_rng_state, torch.cuda.is_available)) reg.register(RngBackend(hpu, torch.hpu.get_rng_state, torch.hpu.set_rng_state, lambda: hasattr(torch, hpu) and torch.hpu.is_available()))要点RngRegistry让保存 / 恢复共用同一后端列表恢复端不可能只认一个新增后端只要register一次保存恢复自动覆盖available()守卫确保只在后端存在时存取避免无效调用。七、解决方案第三层断言 / CI 守护写 pytest 验证多后端 RNG 都被还原# test_multi_backend_rng.py import pytest class FakeBackend: def __init__(self, name, seed): self.name name self.state seed def get(self): return self.state def set(self, s): self.state s def available(self): return True class RngRegistry: def __init__(self): self._b {} def register(self, name, b): self._b[name] b def save(self): return {n _rng: b.get() for n, b in self._b.items() if b.available()} def load(self, ckpt): for n, b in self._b.items(): k n _rng if b.available() and k in ckpt: b.set(ckpt[k]) def test_all_backends_restored(): cuda FakeBackend(cuda, 111) hpu FakeBackend(hpu, 222) reg RngRegistry() reg.register(cuda, cuda) reg.register(hpu, hpu) ckpt reg.save() hpu.set(999) # 模拟恢复前被打乱 reg.load(ckpt) assert cuda.state 111 assert hpu.state 222, hpu RNG 必须被还原 def test_no_backend_dropped(): cuda FakeBackend(cuda, 1) hpu FakeBackend(hpu, 2) reg RngRegistry() reg.register(cuda, cuda); reg.register(hpu, hpu) ckpt reg.save() reg.load(ckpt) assert set(ckpt.keys()) {cuda_rng, hpu_rng}CI 一旦恢复端退化成只还原一个test_all_backends_restored立即变红。八、排查清单多后端 RNG 对不上时打开 checkpoint确认是否含多个后端的 RNG如cuda_rng_statehpu_rng_state若存了多份、恢复后却只有一份生效命中本 bug检查load_state是否硬编码只认cuda按第五 / 六节把恢复改成遍历所有后端异构环境CUDAHPU下显式验证每个后端的随机性一致把第七节的 pytest 接进 CI守护无后端被丢弃用RngRegistry注册表替代硬编码if链新增后端自动覆盖。九、小结load_state在 CUDA HPU 等多后端环境下只还原了一个后端的 RNG 状态根因是恢复端把多后端 RNG当成单后端处理——保存端正确存了多份恢复端却只set回一个或循环覆盖导致另一后端的随机性无法复现。三层层级第一层恢复端逐个后端set回对应 RNG第二层用RngRegistry注册表让保存 / 恢复共用后端列表杜绝硬编码遗漏第三层pytest 验证所有后端 RNG 都被还原锁进 CI。核心教训凡是按类型分别管理状态的 API保存与恢复都必须基于同一份类型清单遍历任何硬编码只处理第一种的写法在多类型共存时都会退化成 silent 不一致。

相关新闻

商业门头视觉升级,雕花铝单板塑造独特形象立面

商业门头视觉升级,雕花铝单板塑造独特形象立面

做过工装幕墙、写字楼大堂、商业综合体的设计师和采购都有同感:选材最怕的不是贵,而是“上墙就翻车”——色差、变形、曲面生硬、尺寸不对,返工一次次,工期一拖再拖。现在主流工装项目已经统一答案:全品类铝单板。但选…

2026/8/25 2:40:58 阅读更多 →
2026毕业论文指导小程序避坑指南:5款主流工具横评,效率提升67.8%

2026毕业论文指导小程序避坑指南:5款主流工具横评,效率提升67.8%

做为一个被毕业论文反复‘毒打’过的过来人,我带着2026年最新实测数据来了。先说结论:如果你不想被查重虐哭、被格式逼疯,下面这三款毕业论文指导小程序值得放进收藏夹:学范文靠7亿级文献库和一站式‘写作-排版-降AI’闭环封神&am…

2026/8/25 20:06:02 阅读更多 →
黄祖鑫《御廷谣》热播中 以武术冠军功底锤炼少年将军底气

黄祖鑫《御廷谣》热播中 以武术冠军功底锤炼少年将军底气

由湖南卫视、芒果TV、上象数娱、开场影业、金色光芒出品,张雁杰执导,陈哲远、吴谨言(按姓氏笔画排序)领衔主演的古装权谋剧《御廷谣》于7月28日正式登陆湖南卫视金鹰独播剧场和芒果TV全网独播。该剧讲述市井孤女孟廷辉逆袭成为大宁…

2026/8/25 10:09:15 阅读更多 →

最新新闻

MATLAB数据导入核心原理与工程实践指南

MATLAB数据导入核心原理与工程实践指南

1. 为什么“Matlab之导入数据”是每个用户绕不开的第一道门槛?在MATLAB里,导入数据这四个字看似平平无奇,但它是整个分析链条的绝对起点——不是“可选项”,而是“生死线”。我带过三十多个高校课题组、帮二十多家工业客户做过数据…

2026/8/26 3:51:10 阅读更多 →
Matplotlib数据可视化实战:从基础图表到高级定制化技巧

Matplotlib数据可视化实战:从基础图表到高级定制化技巧

1. 项目概述:为什么你需要一个“能看懂”的Matplotlib指南 如果你刚开始用Python做数据分析或者科学计算,十有八九会碰到Matplotlib这个库。官方文档很全,但有时候看完了还是不知道怎么下手,参数多到眼花,画出来的图总…

2026/8/26 3:51:10 阅读更多 →
大模型越狱攻击与安全评测:从Claude事件到纵深防御实践

大模型越狱攻击与安全评测:从Claude事件到纵深防御实践

先说一个近期被反复讨论的安全议题:许多团队在接入大模型 API 时,默认“官方模型自带安全护栏”,因此只在提示词层面做了一层很薄的处理。但 Anthropic Claude 旧模型被越狱并生成不当内容的报道,直接说明了一件事——安全防护不能…

2026/8/26 3:51:10 阅读更多 →
电容耦合原理与应用:从隔直通交到高速电路设计

电容耦合原理与应用:从隔直通交到高速电路设计

1. 电容耦合:一个无处不在的“隐形信使”如果你拆开过任何一块电子设备的主板,无论是手机、电脑还是智能家电,你都会发现一个现象:密密麻麻的元器件中,除了那些显眼的芯片和电阻,最多的就是各种大小、颜色不…

2026/8/26 3:51:10 阅读更多 →
终端优先的AI编码代理:如何减少上下文浪费

终端优先的AI编码代理:如何减少上下文浪费

最近在梳理 AI 编码代理工作流时,注意到一个很典型的痛点:很多团队在接入 AI 编程助手后,工具确实能跑通,但上下文窗口很快就被无关信息填满,模型要么答非所问,要么才开始干活就触发了长度上限。网上聊这个…

2026/8/26 3:51:10 阅读更多 →
数字音频基石:采样率与量化位深实战指南

数字音频基石:采样率与量化位深实战指南

1. 这不是“录音”那么简单:采样和量化是数字音频的底层命脉很多人以为把麦克风插进电脑、点下录音键,声音就“变成数字了”——这就像以为把菜放进锅里, automatically 就成了满汉全席。实际上,从空气里振动的声波,到…

2026/8/26 3:50:10 阅读更多 →

日新闻

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

2026/8/26 0:00:40 阅读更多 →
《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》读书笔记--第三章Databases and Database Files(2)

《Microsoft Sql server 2008 Internals》索引目录: 《Microsoft Sql server 2008 Internals》读书笔记--目录索引 在上篇文章中,主要介绍了创建数据库的基本语法和FileGroup的初步知识。需要注意的是: 关于FileGroup 如果你的系统是用Raid设备直接存…

2026/8/26 1:18:18 阅读更多 →
政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体怎么建?三种模式、三步路径与四个误区

政务AI智能体已经从概念试点阶段,转入了政务服务的常态化落地应用;在实际使用过程中,它能自主理解办事需求、辅助完成填报申报、开展材料预审,并联动多个系统协同作业,真正嵌入到政务办理的全流程当中。但在落地推进过…

2026/8/26 1:18:18 阅读更多 →

周新闻

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/25 3:38:12 阅读更多 →
SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/25 3:38:18 阅读更多 →
Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/25 3:38:23 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/26 3:50:20 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/25 10:31:12 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/26 1:24:05 阅读更多 →