【Bug已解决】[BUG] FP8 model cannot inference on B200 (SM>=100) 解决方案
【Bug已解决】[BUG] FP8 model cannot inference on B200 (SM100) 解决方案一、现象长什么样把一个 FP8 量化的模型或开启 FP8 推理的 transformers 模型放到 NVIDIAB200Blackwell 架构compute capabilitySM100即sm_100/sm_120上推理常见两种失败RuntimeError: FP8 is not supported on this device (compute capability ...)或者RuntimeError: FP8 scaling format mismatch / invalid scale tensor dtype又或者更隐蔽——推理不报错但输出全是 NaN/Inf或精度严重崩坏。这种静默错误在 B200 上尤其危险因为 B200 确实支持 FP8sm_100是 Blackwell 的 FP8 代只是FP8 的 scaling 格式变了B200 引入了新的UE8M0scale 格式无符号 8 位指数、无尾数而老 GPUH100sm_90用的是e4m3/e5m2的 per-tensor/per-block scale。若代码还按老格式构造 scale 张量B200 上直接不兼容或数值错乱。本质FP8 在 B200 上的底层支持与老 GPU 不同新 scale 格式、新指令而推理框架的 FP8 检测/scale 构造逻辑没覆盖SM100于是要么拒绝运行要么用错 scale 格式导致数值错误。二、背景FP8 在 NVIDIA GPU 上有两个层面的代差H100sm_90时代FP8 用e4m3有符号 4 指数 3 尾数表示数据e5m2表示梯度scale 通常是fp32标量或较小的 per-block scale 张量。B200sm_100/sm_120Blackwell时代支持 FP8 的同时引入了UE8M0scale 格式——纯指数、无尾数、无符号专门配合新的 FP8 矩阵乘指令做高效的 per-block/per-tensor scaling。transformers / torchao 里做 FP8 推理时会先检测设备是否支持 FP8通过torch.cuda.get_device_capability()和能力表判断。若代码里的支持表只到sm_90那么 B200sm_100会被判为不支持直接拒绝。再构造 scale 张量用fp32标量或特定 dtype 的 scale buffer。若 B200 要求UE8M0而代码造了fp32/e4m3scale指令执行报错或数值崩。下面用可运行代码复现FP8 支持检测表未覆盖 SM100 导致拒绝推理以及scale 格式不匹配。三、根因根因一句话B200SM100的 FP8 支持新UE8M0scale 格式、新指令未被推理框架的 FP8 检测表与 scale 构造逻辑覆盖导致要么被判为不支持而拒绝运行要么用旧 scale 格式构造 scale 张量而在新硬件上数值错误/崩溃。三个具体失配能力检测表停在 sm_90B200sm_100被判不支持推理被拒。scale 格式未适配 UE8M0B200 要UE8M0scale代码造了fp32/e4m3不兼容。静默数值错误scaling 错误不报错输出 NaN/Inf比拒绝更危险。四、最小可运行复现用纯 Python 模拟FP8 支持检测表未覆盖 SM100 导致拒绝推理from dataclasses import dataclass from typing import Tuple # 老代码的能力支持表只到 sm_90 LEGACY_FP8_SUPPORT {(8, 0): True, (8, 6): True, (9, 0): True} def device_capability() - Tuple[int, int]: # 模拟 B200 sm_100 - (10, 0) return (10, 0) def can_run_fp8() - bool: cap device_capability() # 错误点表里没有 (10,0)返回 False - 拒绝 return LEGACY_FP8_SUPPORT.get(cap, False) def main(): supported can_run_fp8() if not supported: print(复现到拒绝: B200(SM100) 不在 FP8 支持表中推理被拒) # 正确把 SM100 加入支持 extended dict(LEGACY_FP8_SUPPORT) extended.update({(10, 0): True, (12, 0): True}) assert extended[device_capability()] is True print(修正后: B200 被识别为支持 FP8) if __name__ __main__: main()运行会打印复现到拒绝: B200(SM100) 不在 FP8 支持表中推理被拒——正是检测表未覆盖新架构的本质。五、解决方案第一层最小直接修复最立竿见影的修复把 FP8 支持检测扩展到SM100并针对 B200 使用正确的 scale 格式UE8M0。即不再用硬编码到 sm_90 的表而是capability (9,0) 即支持并在 B200 上用UE8M0构造 scale。import torch def fp8_supported(capability: tuple) - bool: 修复compute capability (9,0) 即支持 FP8含 B200 的 10.0。 major, minor capability return (major, minor) (9, 0) def make_scale(buffer, capability): 修复B200(10.0) 用 UE8M0 scale老卡用 fp32 scalar。 if capability (10, 0): # Blackwell: UE8M0 scale纯指数无尾数 # 这里示意把 scale 转成 uint8 表示的 UE8M0 scale_u8 (buffer.float().clamp(1e-6, 1e6).log2().round() .clamp(0, 255)).to(torch.uint8) return scale_u8 else: return buffer.float() # 老卡 fp32 scale def main(): cap (10, 0) # B200 assert fp8_supported(cap) s make_scale(torch.tensor([0.5, 1.0]), cap) print(B200 上 scale dtype:, s.dtype, (UE8M0 应为 uint8)) if __name__ __main__: main()第一层修复让 B200 被正确识别为支持 FP8且 scale 格式适配 Blackwell推理通过。六、解决方案第二层结构性改进把FP8 能力检测 scale 格式选择收口成一个Fp8Backend根据 capability 自动选择支持状态与 scale 策略避免散落的硬编码表再次遗漏新架构。import torch from dataclasses import dataclass from typing import Tuple dataclass class Fp8Backend: capability: Tuple[int, int] property def supported(self) - bool: # 所有 (9,0) 的架构H100/B200/...都支持 FP8 return self.capability (9, 0) property def scale_format(self) - str: # B200(10.0) 用 UE8M0其余用 fp32 return ue8m0 if self.capability (10, 0) else fp32 def make_scale(self, raw: torch.Tensor) - torch.Tensor: if self.scale_format ue8m0: return (raw.float().clamp(1e-6, 1e6).log2().round() .clamp(0, 255)).to(torch.uint8) return raw.float() def main(): for cap in [(9, 0), (10, 0), (12, 0)]: b Fp8Backend(cap) print(fcap{cap}: supported{b.supported}, scale{b.scale_format}) if __name__ __main__: main()第二层的关键是Fp8Backend用capability 比较而非枚举表新架构11.0/12.0...自动被纳入且 scale 格式随架构自动切换杜绝支持表漏更新的回归。七、解决方案第三层断言 / CI 守护加 pytest 守护(1) B200 capability 必须判定为支持 FP8(2) scale 格式在 10.0 必须是 ue8m0(3) 老卡(9.0)用 fp32 scale(4) 不支持的架构(9.0)必须拒绝。import torch import pytest class Fp8Backend: def __init__(self, cap): self.cap cap property def supported(self): return self.cap (9, 0) property def scale_format(self): return ue8m0 if self.cap (10, 0) else fp32 def test_b200_supported(): assert Fp8Backend((10, 0)).supported is True def test_b200_ue8m0_scale(): assert Fp8Backend((10, 0)).scale_format ue8m0 def test_h100_fp32_scale(): assert Fp8Backend((9, 0)).scale_format fp32 def test_old_gpu_rejected(): assert Fp8Backend((8, 0)).supported is False if __name__ __main__: pytest.main([__file__, -q])CI 里test_b200_supportedtest_b200_ue8m0_scale通过就能保证新架构B200 及以后的 FP8 推理能力被正确识别与适配防止支持表漏更新回归。八、排查清单FP8 模型在 B200 上推理失败时按此顺序查看报错类型是不支持 FP8的拒绝还是 scale 格式不匹配的 RuntimeError还是 NaN 的静默错误。查能力检测表torch.cuda.get_device_capability()在 B200 返回(10,0)或(12,0)确认框架的 FP8 支持判断 (9,0) 而非枚举到 (9,0)。查 scale 格式B200 要求UE8M0scale确认代码在capability (10,0)时切换到该格式。升级 transformers/torchao较新版本已支持 Blackwell FP8老版本需打补丁。NaN 静默错误若推理不报错但输出乱重点查 scale dtype 是否错配fp32 scale 喂给要 UE8M0 的指令。用 Fp8Backend 兜底用capability 比较替代枚举表新架构自动支持。验证数值合理在 B200 上跑一个小样本确认输出与 H100 量级一致允许 fp8 正常误差。九、小结FP8 模型无法在 B200SM100推理根因不在硬件不支持——B200 是支持 FP8 的 Blackwell 架构问题在于推理框架的 FP8 能力检测表停在sm_90把 B200 判为不支持而拒绝即使放行FP8 的 scale 格式也从 H100 的fp32/e4m3变成了 B200 的UE8M0旧 scale 构造逻辑会不兼容或数值崩坏。后者更危险因为可能静默输出 NaN。修复三层第一层把 FP8 支持判断从枚举到 sm_90改成capability (9,0)并在10.0用UE8M0scale第二层用Fp8Backend把能力scale 格式收口用比较替代枚举新架构自动纳入第三层用 pytest 断言B200 支持、用 ue8m0、老卡用 fp32、旧卡拒绝。记住B200 的 FP8 不是不支持是 scale 换了 UE8M0检测别再写死 sm_90。

相关新闻

第3章:TF-M 架构 + SPM 调度

第3章:TF-M 架构 + SPM 调度

摘要 CRA Article 13(2) 要求"安全隔离",PSA Certified Level 2 强制硬件隔离。本文用 TrustZone-M 两个世界 三类硬件单元 DEN0063 三级隔离 SPM 调度与 IPC 全链路,讲清楚 TF-M 如何满足 CRA 与 PSA 双重要求。 开篇:一个 400…

2026/10/11 21:33:02 阅读更多 →
【Bug已解决】Different results for PPDocLayoutV3 on CPU and CUDA 解决方案

【Bug已解决】Different results for PPDocLayoutV3 on CPU and CUDA 解决方案

【Bug已解决】Different results for PPDocLayoutV3 on CPU and CUDA 解决方案 一、现象长什么样 用 PPDocLayoutV3(PaddlePaddle 文档版面分析模型,常经 transformers 桥接或在 GPU 机器上推理)做文档版面检测,发现同一张图&…

2026/10/11 19:47:32 阅读更多 →
AI情侣头像如何通过平台审核?2024微信/小红书/抖音最新审核规则实测解读

AI情侣头像如何通过平台审核?2024微信/小红书/抖音最新审核规则实测解读

更多请点击: https://codechina.net 第一章:AI情侣头像如何通过平台审核?2024微信/小红书/抖音最新审核规则实测解读 三平台核心审核维度对比 2024年实测表明,微信、小红书与抖音对AI生成情侣头像的审核逻辑已从“一刀切”转向“…

2026/10/11 2:21:38 阅读更多 →

最新新闻

Agent技能工程:可验证、可监控、可复用的智能体能力单元设计

Agent技能工程:可验证、可监控、可复用的智能体能力单元设计

1. “agent-skills”不是新词,而是智能体能力工程的实践切口“agent-skills”这个词乍看像某个开源库的包名,或是某次技术分享里一闪而过的术语缩写。但过去两年在多个跨领域项目中反复遇到它——不是作为概念被宣讲,而是作为实际开发中必须拆…

2026/10/11 22:27:17 阅读更多 →
模塑玻璃瓶缺陷识别数据集:28类缺陷与YOLOv5实战

模塑玻璃瓶缺陷识别数据集:28类缺陷与YOLOv5实战

简介:这份资源是面向工业质检与计算机视觉方向的模塑玻璃瓶缺陷识别数据集,适合从事缺陷检测算法研发、YOLO模型训练及产线视觉方案验证的工程师与学习者使用。数据集覆盖黑点、泡泡颈、破损、刮痕、裂缝等28类常见玻璃瓶缺陷,标注信息完整&a…

2026/10/11 22:27:17 阅读更多 →
误差椭圆详解:从协方差阵到点位精度分析

误差椭圆详解:从协方差阵到点位精度分析

1. 为什么笔记十二要单独写误差椭圆误差理论与测量平差基础这门课,大家最熟悉的肯定是协方差传播、权、条件平差、间接平差这些大块头。等这些基础过了之后,随之而来的一个非常实际的问题就是:平差算出的坐标点,到底有多可靠&…

2026/10/11 22:27:17 阅读更多 →
MySQL查询结果加序号全解析:从ROW_NUMBER到用户变量与分组排名

MySQL查询结果加序号全解析:从ROW_NUMBER到用户变量与分组排名

说实话,数据库开发里最容易被低估的需求,就是“给查询结果加个序号”。听起来不就是一列 1、2、3、4 吗?可真到动手写的时候,版本差异、排序稳定性、分页跳号、分组重排,随便一个细节都能让你在测试环境折腾半天。我这…

2026/10/11 22:27:17 阅读更多 →
森林害虫目标检测数据集实战:YOLOv8训练与避坑指南

森林害虫目标检测数据集实战:YOLOv8训练与避坑指南

简介:这份森林害虫目标检测数据集面向林业智能监测、农业AI应用开发及生态科研人员,聚焦松毛虫、松墨天牛、卷叶蛾三类常见且危害严重的森林害虫识别难题。数据集共1715张实际场景采集的JPEG图片,按训练集1199张、验证集257张、测试集259张划…

2026/10/11 22:27:17 阅读更多 →
BNF与EBNF详解:从语法规则到解析器实战

BNF与EBNF详解:从语法规则到解析器实战

看到“BNF、巴科斯-诺尔范式”这个标题,很多刚接触编译原理的人第一反应是:又一个高大上的数学符号体系。但说句实在话,BNF 是我在编译原理里见过的最接地气的工具之一。它本质上就干了一件事——用一套严格、无歧义的规则,告诉计…

2026/10/11 22:26:15 阅读更多 →

日新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/11 0:00:27 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/11 0:00:27 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →