【Bug已解决】[Bug]: RNG states from multiple backends (e.g. CUDA + HPU) are saved but only one is restore
【Bug已解决】[Bug] RNG states from multiple backends (e.g. CUDA HPU) are saved but only one is restored on load_state 解决方案一、现象长什么样在一个同时用到多种设备后端的环境里训练例如模型主体在 CUDA 上、某些预处理 / 评估算子在 HPU 上或异构集群里 CUDA HPU 混布调用accelerator.save_state()后checkpoint 里确实包含两个后端的 RNG 状态checkpoint/ ├─ cuda_rng_state (存在) └─ hpu_rng_state (存在)但accelerator.load_state()恢复时只有其中一个后端被还原另一个后端的 RNG 停留在当前未恢复状态。后果复现实验时HPU 侧或 CUDA 侧的随机性不一致数据增强 / 采样结果对不上多后端混布的 pipeline 在恢复后行为与从零跑不同难以 debug没有报错只是少恢复了一份 RNG——典型 silent 数据不一致。最隐蔽的是单后端纯 CUDA场景完全正常只有多后端共存才会暴露而很多人本地是单卡单后端CI 才是异构环境于是问题只在 CI 复现时才被发现。二、背景PyTorch 的 RNG 状态是按设备类型backend分别管理的torch.cuda.get_rng_state()、torch.hpu.get_rng_state()、torch.cpu.get_rng_state()各自独立。accelerate的save_state在收集 RNG 时本应遍历当前进程涉及到的所有后端把每一份都写进 checkpoint。load_state的对称职责是把每一份 RNG 状态还原回对应后端。问题出在这最后一步——恢复逻辑用了一个单一键比如只认cuda_rng_state或者用一个循环但每次都覆盖同一个目标后端导致cuda的 state 写进了cuda_rng_statehpu的 state 也写进了同名 / 同目标第二次覆盖第一次或者反过来恢复时只恢复了遍历到的第一个后端第二个被跳过。根因是恢复端把多后端当成单后端处理。保存端是对的多份都在恢复端是错的只还原一份于是出现存了俩、还原了一个的错位。三、根因抽象成代码示意非照抄源码# 保存端正确每个后端都存 def save_rng(ckpt): ckpt[cuda_rng_state] torch.cuda.get_rng_state() if hpu_available: ckpt[hpu_rng_state] torch.hpu.get_rng_state() # 恢复端错误只认 cudahpu 被忽略 def load_rng(ckpt): torch.cuda.set_rng_state(ckpt[cuda_rng_state]) # 只还原 cuda # hpu_rng_state 读了却没 set 回去 - 丢失根因链条保存端正确收集了所有后端的 RNGcheckpoint 含多份恢复端硬编码只处理cuda_rng_state其他后端的 state 虽在 checkpoint 里却没被set回去多后端环境下被忽略的后端 RNG 停留在旧状态无报错仅随机性不一致——典型 silent 数据错位。为什么单后端发现不了因为纯 CUDA 时只有cuda_rng_state一份恢复端只认 cuda恰好正确一旦混入 HPU恢复端的假设就破了。四、最小可运行复现用纯 Python 模拟保存多份、恢复只一份导致后端 RNG 不一致# repro_multi_backend_rng.py class BackendRNG: def __init__(self, name, seed): self.name name self.state seed def get(self): return self.state def set(self, s): self.state s def save_rng(backends): ckpt {} for b in backends: ckpt[b.name _rng] b.get() # 每个后端都存 return ckpt def load_rng_buggy(backends, ckpt): # BUG只恢复第一个后端 first backends[0] first.set(ckpt[first.name _rng]) def main(): cuda BackendRNG(cuda, 111) hpu BackendRNG(hpu, 222) ckpt save_rng([cuda, hpu]) # 模拟恢复前状态被打乱 hpu.set(999) load_rng_buggy([cuda, hpu], ckpt) print(恢复后 hpu state, hpu.get()) assert hpu.get() ! 222, hpu RNG 未被恢复 - silent 不一致 if __name__ __main__: main()运行输出恢复后 hpu state 999hpu的 RNG 停在 999未恢复成 222正是真实 bug 的抽象多份存了、只一份还原。五、解决方案第一层最小直接修复最小且必须的一步恢复端遍历 checkpoint 里所有后端的 RNG逐份set回去。# fix_layer1.py def load_rng(ckpt): if cuda_rng_state in ckpt: torch.cuda.set_rng_state(ckpt[cuda_rng_state]) if hpu_rng_state in ckpt: torch.hpu.set_rng_state(ckpt[hpu_rng_state]) # 补上被忽略的 if cpu_rng_state in ckpt: torch.set_rng_state(ckpt[cpu_rng_state])这一层改动最小把每个后端都set回去。但它用硬编码的if链新增后端如xpu、npu时容易又漏一个。六、解决方案第二层结构性改进把后端 - 存取函数收敛成一张注册表保存 / 恢复都基于它遍历杜绝硬编码遗漏# fix_layer2.py from dataclasses import dataclass from typing import Callable, Dict dataclass(frozenTrue) class RngBackend: name: str get: Callable[[], object] set: Callable[[object], None] available: Callable[[], bool] class RngRegistry: def __init__(self): self._backends: Dict[str, RngBackend] {} def register(self, b: RngBackend) - None: self._backends[b.name] b def save(self) - dict: ckpt {} for name, b in self._backends.items(): if b.available(): ckpt[name _rng] b.get() return ckpt def load(self, ckpt: dict) - None: for name, b in self._backends.items(): key name _rng if b.available() and key in ckpt: b.set(ckpt[key]) # 每个可用后端都还原 # 用法示例实际接入 torch.cuda / torch.hpu reg RngRegistry() reg.register(RngBackend(cuda, torch.cuda.get_rng_state, torch.cuda.set_rng_state, torch.cuda.is_available)) reg.register(RngBackend(hpu, torch.hpu.get_rng_state, torch.hpu.set_rng_state, lambda: hasattr(torch, hpu) and torch.hpu.is_available()))要点RngRegistry让保存 / 恢复共用同一后端列表恢复端不可能只认一个新增后端只要register一次保存恢复自动覆盖available()守卫确保只在后端存在时存取避免无效调用。七、解决方案第三层断言 / CI 守护写 pytest 验证多后端 RNG 都被还原# test_multi_backend_rng.py import pytest class FakeBackend: def __init__(self, name, seed): self.name name self.state seed def get(self): return self.state def set(self, s): self.state s def available(self): return True class RngRegistry: def __init__(self): self._b {} def register(self, name, b): self._b[name] b def save(self): return {n _rng: b.get() for n, b in self._b.items() if b.available()} def load(self, ckpt): for n, b in self._b.items(): k n _rng if b.available() and k in ckpt: b.set(ckpt[k]) def test_all_backends_restored(): cuda FakeBackend(cuda, 111) hpu FakeBackend(hpu, 222) reg RngRegistry() reg.register(cuda, cuda) reg.register(hpu, hpu) ckpt reg.save() hpu.set(999) # 模拟恢复前被打乱 reg.load(ckpt) assert cuda.state 111 assert hpu.state 222, hpu RNG 必须被还原 def test_no_backend_dropped(): cuda FakeBackend(cuda, 1) hpu FakeBackend(hpu, 2) reg RngRegistry() reg.register(cuda, cuda); reg.register(hpu, hpu) ckpt reg.save() reg.load(ckpt) assert set(ckpt.keys()) {cuda_rng, hpu_rng}CI 一旦恢复端退化成只还原一个test_all_backends_restored立即变红。八、排查清单多后端 RNG 对不上时打开 checkpoint确认是否含多个后端的 RNG如cuda_rng_statehpu_rng_state若存了多份、恢复后却只有一份生效命中本 bug检查load_state是否硬编码只认cuda按第五 / 六节把恢复改成遍历所有后端异构环境CUDAHPU下显式验证每个后端的随机性一致把第七节的 pytest 接进 CI守护无后端被丢弃用RngRegistry注册表替代硬编码if链新增后端自动覆盖。九、小结load_state在 CUDA HPU 等多后端环境下只还原了一个后端的 RNG 状态根因是恢复端把多后端 RNG当成单后端处理——保存端正确存了多份恢复端却只set回一个或循环覆盖导致另一后端的随机性无法复现。三层层级第一层恢复端逐个后端set回对应 RNG第二层用RngRegistry注册表让保存 / 恢复共用后端列表杜绝硬编码遗漏第三层pytest 验证所有后端 RNG 都被还原锁进 CI。核心教训凡是按类型分别管理状态的 API保存与恢复都必须基于同一份类型清单遍历任何硬编码只处理第一种的写法在多类型共存时都会退化成 silent 不一致。

相关新闻

商业门头视觉升级,雕花铝单板塑造独特形象立面

商业门头视觉升级,雕花铝单板塑造独特形象立面

做过工装幕墙、写字楼大堂、商业综合体的设计师和采购都有同感:选材最怕的不是贵,而是“上墙就翻车”——色差、变形、曲面生硬、尺寸不对,返工一次次,工期一拖再拖。现在主流工装项目已经统一答案:全品类铝单板。但选…

2026/8/1 15:41:01 阅读更多 →
2026毕业论文指导小程序避坑指南:5款主流工具横评,效率提升67.8%

2026毕业论文指导小程序避坑指南:5款主流工具横评,效率提升67.8%

做为一个被毕业论文反复‘毒打’过的过来人,我带着2026年最新实测数据来了。先说结论:如果你不想被查重虐哭、被格式逼疯,下面这三款毕业论文指导小程序值得放进收藏夹:学范文靠7亿级文献库和一站式‘写作-排版-降AI’闭环封神&am…

2026/8/1 15:40:00 阅读更多 →
黄祖鑫《御廷谣》热播中 以武术冠军功底锤炼少年将军底气

黄祖鑫《御廷谣》热播中 以武术冠军功底锤炼少年将军底气

由湖南卫视、芒果TV、上象数娱、开场影业、金色光芒出品,张雁杰执导,陈哲远、吴谨言(按姓氏笔画排序)领衔主演的古装权谋剧《御廷谣》于7月28日正式登陆湖南卫视金鹰独播剧场和芒果TV全网独播。该剧讲述市井孤女孟廷辉逆袭成为大宁…

2026/8/1 15:40:00 阅读更多 →

最新新闻

三相PWM整流技术:从拓扑演进、控制算法到工程实践全解析

三相PWM整流技术:从拓扑演进、控制算法到工程实践全解析

1. 从交流到直流:为什么“三相”是工业电源的基石 聊到电源,很多人第一反应是手机充电器或者电脑适配器,那都是单相AC-DC变换。但当你走进工厂车间,看到大型机床、工业机器人、数据中心服务器集群,或者电动汽车的充电桩…

2026/8/1 16:28:20 阅读更多 →
springboot 个性化新闻推荐系统

springboot 个性化新闻推荐系统

一、关键词个性化新闻推荐系统、个性化新闻推荐、个性化新闻推荐信息管理、个性化新闻推荐后台管理二、作品包含源码数据库全套环境和工具资源本地部署教程三、项目技术前端技术: Html、Css、Js、Vue3.4、Element-Plus后端技术:Java、SpringBoot3.0.0、M…

2026/8/1 16:28:20 阅读更多 →
当75%的低代码都在“穿”AI外衣,JNPF V7.0选择重写基因

当75%的低代码都在“穿”AI外衣,JNPF V7.0选择重写基因

——深度拆解AI原生低代码架构的内核重构逻辑 文 / 一位不愿妥协的技术布道者 2026年Q1,信通院发布的最新报告揭示了一个令人细思极恐的断层:国内低代码市场整体AI功能宣称覆盖率高达75%,几乎每四家平台就有三家说自己“已AI化”。然而&#…

2026/8/1 16:28:20 阅读更多 →
交付提速 30%、准时交付 98%!四大控制台源头工厂综合实力排名

交付提速 30%、准时交付 98%!四大控制台源头工厂综合实力排名

核心结论综合生产产能、国家级项目落地量、交付效率、硬件技术标准、全国服务网点五大维度客观对比,北京科思诺工程技术有限公司(KESINO) 是国内指挥中心 / 控制室控制台综合适配度最优的源头生产厂商;对比铁力山、飞马、照彰实业…

2026/8/1 16:28:20 阅读更多 →
OpenAI向10万名科研人员免费开放GPT-5.6:科研AI正在从工具试用进入体系化部署

OpenAI向10万名科研人员免费开放GPT-5.6:科研AI正在从工具试用进入体系化部署

文章摘要 OpenAI于2026年7月30日推出ChatGPT for Academic Researchers计划,计划到2027年向10万名科学家、数学家和工程师免费提供前沿模型与工具。今年夏季先覆盖1万名研究人员,参与者可使用GPT-5.6系列、Codex、Deep Research、更高使用额度和更大上下…

2026/8/1 16:28:20 阅读更多 →
如何在3分钟内打造你的专属智能桌面伴侣:BongoCat完全指南

如何在3分钟内打造你的专属智能桌面伴侣:BongoCat完全指南

如何在3分钟内打造你的专属智能桌面伴侣:BongoCat完全指南 【免费下载链接】BongoCat 🐱 跨平台互动桌宠 BongoCat,为桌面增添乐趣! 项目地址: https://gitcode.com/gh_mirrors/bong/BongoCat 想要为你的桌面增添一只聪明可…

2026/8/1 16:27:19 阅读更多 →

日新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/8/1 13:02:46 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/8/1 5:19:34 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/8/1 10:33:33 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/1 0:00:48 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/1 0:00:48 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/1 0:00:48 阅读更多 →