AngelSlim FP8量化实战:如何单卡量化235B MoE模型并零掉点上线?
人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载AngelSlim 是一个专注于大模型压缩的开源工具包集 FP8 量化、INT4 量化、投机采样等主流压缩算法于一体。本文以FP8 静态量化FP8-Static为例手把手演示如何用22GB 显存的单卡 GPU完成 235B 参数 MoE 模型Qwen3-235B-A22B的量化并通过 vLLM 实现几乎零掉点上线。为什么选 FP8 量化压缩 MoE 大模型MoE 模型参数量动辄数百亿BF16 精度下 Qwen3-235B-A22B 的权重就超过470GB存储与传输成本极高。FP8 量化把权重和激活都压到 8-bit体积直接减半且推理速度基本不降。相比 INT4FP8 保留了浮点动态范围对 MoE 这类专家权重分布差异大的模型更友好——这也是各大厂 235B/400B 级模型官方 FP8 版本越来越多的原因。AngelSlim 的 FP8 量化支持两种模式模式激活量化方式适用场景fp8_dynamic在线动态量化无需校准数据快速上手fp8_static离线静态量化需校准精度更稳推荐生产使用静态量化需要一小份校准数据集256 条 ShareGPT 样本即可详细原理可参阅 docs/source/features/quantization/fp8.md。单卡量化 235B 的关键low_memory 模式标准 FP8 静态量化需要把整个模型常驻显存235B 模型优化前需要455GB显存。AngelSlim 内置了low_memory模式核心实现在 angelslim/compressor/quant/modules/fp8/fp8.py思路非常朴素整个模型以 BF16 放在CPU 内存上device_map: cpu校准时逐层搬运到 GPU取一层 → 前向计算并释放 → 取下一层配合Catcher捕获每层输入避免全模型前向。效果如下表max_seq_len4096模型优化前显存占用开启 low_memory 模式Qwen3-235B-A22B455GB22GB也就是说一张 RTX 4090 / L40S24GB就能跑完整个量化流程无需多机多卡集群。三步完成单卡量化环境、配置、执行第一步环境准备pip install angelslim若需使用 main 分支最新功能也可从源码安装git clone https://gitcode.com/gh_mirrors/an/AngelSlim后执行python setup.py install。完整要求见 docs/source/getting_started/installation.md。第二步准备配置文件AngelSlim 采用「一个 yaml 一次压缩任务」的设计仓库内置了现成的 235B 低显存配置configs/qwen3/ptq/fp8_static/qwen3-a22b_fp8_static_low_memroy.yamlmodel: name: Qwen model_path: Qwen/Qwen3-235B-A22B device_map: cpu # 关键模型整体放 CPU 内存 compression: name: PTQ quantization: name: fp8_static bits: 8 low_memory: True # 关键开启低显存逐层量化 quant_method: weight: per-tensor activation: per-tensor ignore_layers: - lm_head dataset: name: TextDataset data_path: ./dataset/sharegpt_gpt4_qwen/sharegpt_gpt4-qwen3_a22B_output.jsonl max_seq_length: 4096 num_samples: 256 batch_size: 1三个必配项device_map: cpulow_memory: True省显存双保险、data_path校准数据仓库自带 dataset/sharegpt_gpt4_qwen/、ignore_layers保留lm_head不量化。其他模型的同类配置都放在 configs/ 下按「模型/精度」分类如 DeepSeek-R1 的 configs/deepseek_r1/fp8_static/deepseek_r1_fp8_static_low_memmory.yaml。第三步一键执行python3 tools/run.py -c configs/qwen3/ptq/fp8_static/qwen3-a22b_fp8_static_low_memroy.yamltools/run.py 会按配置自动完成加载模型 → 校准采集激活 scale → 权重量化为 FP8 → 保存输出模型。量化配置会自动写入产出目录的config.jsonquant_method: compressed-tensors格式部署引擎可直接识别无需手动改配置。零掉点验证官方 Benchmark 数据量化后最怕体积减半、智商也减半。AngelSlim 官方在 CEVAL / MMLU / GSM8K / HUMANEVAL 上对 235B 模型的实测结果docs/source/performance/quantization/benchmarks.md量化方式CEVALMMLUGSM8KHUMANEVALBF16 原始89.6086.2885.2927.44FP8-Static89.6786.1986.9627.44FP8-Dynamic89.6786.1885.2228.05INT8-Dynamic88.9386.2086.2023.78可以看到 FP8-Static 在 CEVAL 上甚至微涨 0.07MMLU 仅波动 0.09GSM8K 提升 1.67——基本可视为零掉点而模型体积减半、推理吞吐提升。进阶量化质量体检找离群值如果业务上追求极致精度可以开启量化分析检查 scale 是否存在离群值、FP8 难以拟合的权重分布运行前在配置中加quant_analyse: true量化过程即会输出 scale 分布量化完成后用后处理工具分析产出文件# Scale 分布折线图 log 分析 python3 tools/fp8_quant_analyse.py --analyse-type act --model-path $FP8_PATH # BF16 vs FP8 权重直方图对比 python3 tools/fp8_quant_analyse.py --analyse-type weight --bf16-path $BF16_PATH --fp8-path $FP8_PATH --layer-index 0工具位于 tools/fp8_quant_analyse.py产出效果示例分析工具还能帮你定位个别异常层配合ignore_layers排除后再量化即可。上线部署vLLM 一键拉起 OpenAI APIFP8 产出模型兼容 compressed-tensors 标准vLLM 原生支持无需额外插件pip install vllm0.8.5.post1 python3 -m vllm.entrypoints.openai.api_server \ --host 0.0.0.0 \ --port 8080 \ --model ${MODEL_PATH} \ --tensor-parallel-size 4 \ --gpu-memory-utilization 0.9 \ --max-model-len 4096 \ --trust-remote-code服务默认在http://localhost:8080提供兼容 OpenAI 的/v1/chat/completions接口。部署细节SGLang 后端、多节点 Ray 启动、API 调用示例见 docs/source/deployment/deploy.md现成脚本在 scripts/deploy/ 下。常见问题 FAQ量化时下载模型失败国内网络建议改从 ModelScope 下载后填本地路径。部署 Qwen3-MoE 报CUDA error: no kernel image is available把 vLLM 升级到0.9.2即可官方文档已标注此已知问题。显存还是不够调小batch_size设为 1、调小max_seq_lengthlow_memory模式下显存峰值基本只与单层大小相关。想进一步压到 INT4仓库提供int4_gptq、int4_awq、NVFP4 等配置同样走tools/run.py -c 你的.yaml流程。总结省显存device_map: cpulow_memory: True双配置22GB 单卡量化 235B MoE不掉点FP8-Static 在四项主流 benchmark 上相对 BF16 波动 0.1易部署产出标准 compressed-tensors 格式vLLM 一条命令拉起 OpenAI 兼容服务。整套流程就是一条python3 tools/run.py -c 你的.yaml命令235B 大模型的压缩门槛从此从多机集群降到一张 4090。赞分享人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载相关推荐Qwen3-235B-A22B 在 NVIDIA A100 上的吞吐量优化实战vLLM 引擎选型、FP8 量化与并行策略调优指南Qwen3 235B A22B 在 NVIDIA A100 上的吞吐量优化实战vLLM 引擎选型、FP8 量化与并行策略调优指南 导读 本文是 GPUStac后端人工智能模型推理服务集群管理可观测性解密Qwen3-235B-A22B思考模型FP8量化如何让AI推理成本减半解密Qwen3 235B A22B思考模型FP8量化如何让AI推理成本减半 你是否曾经遇到过这样的困境想要部署一个强大的AI模型却被高昂的GPU成本劝退大模型深度学习双模式FP8量化Qwen3-1.7B-FP8如何重塑轻量级大模型标准双模式FP8量化Qwen3 1.7B FP8如何重塑轻量级大模型标准 导语轻量级大模型的效率革命 你是否在为企业AI部署的三高困境发愁高算力成本、高大模型深度学习创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

GDAL KMLSuperOverlay 驱动深度解析:栅格转 KML/KMZ 影像金字塔的写入与读取实战

GDAL KMLSuperOverlay 驱动深度解析:栅格转 KML/KMZ 影像金字塔的写入与读取实战

GIS遥感数据工程 【免费下载链接】gdal GDAL is an open source MIT licensed translator library for raster and vector geospatial data formats. 项目地址: https://gitcode.com/gh_mirrors/gd/gdal 点击查看 免费下载 导读 KMLSuperOverlay 是 GDAL 内置&…

2026/10/11 15:57:21 阅读更多 →
Blitz模拟器操控全解析:AI实时点击滑动、屏幕直播与手势可视化是如何实现的

Blitz模拟器操控全解析:AI实时点击滑动、屏幕直播与手势可视化是如何实现的

【免费下载链接】blitz-mac Native macOS App Store Connect tool with MCP. Submit iOS apps to App Store with AI agents 项目地址: https://gitcode.com/gh_mirrors/bl/blitz-mac 点击查看 免费下载 Blitz 模拟器操控是这款 macOS 原生 App Store Connect 工具…

2026/10/11 15:57:21 阅读更多 →
C# 操作 USB 摄像头:选型、预览、拍照与避坑指南

C# 操作 USB 摄像头:选型、预览、拍照与避坑指南

简介:这份资源面向具备一定C#与.NET基础的开发者,聚焦USB摄像头在桌面端的调用与操作,解决设备枚举、视频流控制、拍照抓拍与图片保存等常见需求。包内共38个文件,以10个dll动态库、6个cs源码文件为主,辅以exe可执行程…

2026/10/11 15:56:21 阅读更多 →

最新新闻

Vibe Coding 的边界:从“70% 问题“到“80% 墙“,AI 编程五大局限性与人机分工深度解析

Vibe Coding 的边界:从“70% 问题“到“80% 墙“,AI 编程五大局限性与人机分工深度解析

文档教程Vibe Coding示例工程 【免费下载链接】vibe-vibe The First Systematic Vibe Coding Open-Source Tutorial | From Zero to Full-Stack, Empowering Everyone to Build Products with AI | Live at: www.vibevibe.cn ;首个系统化 Vibe Coding 开源教程 | 零…

2026/10/12 0:53:26 阅读更多 →
不用模拟器也能玩PS5游戏?拆解AnyPS5的“非模拟器魔法“:relinker重链接+PRX库+RDNA到SPIR-V

不用模拟器也能玩PS5游戏?拆解AnyPS5的“非模拟器魔法“:relinker重链接+PRX库+RDNA到SPIR-V

不用模拟器也能玩PS5游戏?拆解AnyPS5的"非模拟器魔法":relinker重链接PRX库RDNA到SPIR-V 【免费下载链接】AnyPS5 Tool for automatic PS5 executables porting to Linux and Windows 项目地址: https://gitcode.com/GitHub_Trending/an/Any…

2026/10/12 0:53:26 阅读更多 →
基于A星算法的无人机三维路径规划Matlab实现与优化

基于A星算法的无人机三维路径规划Matlab实现与优化

做无人机的人基本都绕不开路径规划这道坎。“基于A星算法的无人机三维路径规划算法研究(Matlab代码实现)” 这个题目看着规整,但真正落地的时候,坑比想象的多:地图怎么建、邻居节点怎么扩展、启发函数怎么写才能既快又…

2026/10/12 0:51:25 阅读更多 →
VS Code 中直接使用 Codex 教程及连接失败解决方案:TaoToken 统一 Key 接入与排错实录

VS Code 中直接使用 Codex 教程及连接失败解决方案:TaoToken 统一 Key 接入与排错实录

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 0:50:24 阅读更多 →
企业 Agent 提示词注入防御实战:双重护栏与对抗语义检测

企业 Agent 提示词注入防御实战:双重护栏与对抗语义检测

在企业将多智能体(Multi-Agent)系统接入客服咨询、内部知识检索或自动化办公流后,安全攻防的对抗维度发生了一场根本性范式转移:传统的 SQL 注入或跨站脚本攻击(XSS)正在退居二线,而以自然语言为…

2026/10/12 0:47:23 阅读更多 →
Cursor怎么使用:3分钟上手Cursor键盘快捷键速查,用TaoToken统一Key接入GPT4与Claude 3.5辅助编程

Cursor怎么使用:3分钟上手Cursor键盘快捷键速查,用TaoToken统一Key接入GPT4与Claude 3.5辅助编程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/12 0:46:23 阅读更多 →

日新闻

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

复古胶片颗粒感噪点合成器:Canvas ImageData 像素高斯杂色注入算法

在数码相机、高清显示屏与现代矢量图形技术高度发达的今天,画面可以做到绝对的锐利、平滑与无瑕。然而,当一张秋日手账插画或拍立得照片过于“平整无瑕”时,往往会散发出一种冰冷生硬的“数码塑料感(Digital Plasticity&#xff0…

2026/10/12 0:00:59 阅读更多 →
活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

活字印刷古籍线装排版:Canvas 竖排文字与栏线自适应算法

在现代网页与移动端设计中,横排(Horizontal Layout)早已经成为了绝对的主流。然而,当我们翻开泛黄的线装古籍、宋版木刻诗集,或是欣赏一张茶道雅集的手写便签时,那种**自上而下纵向书写、自右向左逐列铺展&…

2026/10/12 0:00:59 阅读更多 →
周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

周日晚间的“精神松绑减震器”:无压力情绪倾倒箱与温和轻声陪伴

每到周日的晚上八点到十点,很多人心里都会悄悄亮起一盏警示灯。 在心理学上,这种现象有一个专门的称谓——“周日夜晚焦虑症(Sunday Scaries)”。明天又是周一,闹钟又要重新在七点响彻卧房;脑海里仿佛有一个…

2026/10/12 0:00:59 阅读更多 →

周新闻

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

流感时间序列预测实战:ARIMA/LSTM全流程拆解与避坑指南

简介:基于 ARIMA、LSTM、Transformer 等模型的流感时间序列预测 Python 源码,面向计算机相关专业课程设计与期末大作业学生,以及项目实战学习者。内容覆盖预处理、平稳性检验、定阶、残差分析、多模型对比预测的完整时序建模流程,…

2026/10/12 0:16:30 阅读更多 →
影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别

影刀RPA新手教程:键盘模拟输入实战——输入文本与模拟按键的区别 做影刀RPA自动化,十个新手有八个栽在"往输入框里填东西"这件事上:要么填不进去,要么填了一半,要么直接把原来内容追加在后面。这背后的根因&…

2026/10/12 0:16:38 阅读更多 →
影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容

影刀RPA新手教程:阅文起点小说数据采集实战——书籍信息与章节内容 1. 认识影刀:什么场景该用RPA采小说数据 起点中文网的页面结构相对稳定——分类榜单、书籍详情、章节内容三块独立页面,跳转链路清晰。这种场景非常适合影刀自动化&#x…

2026/10/12 0:16:43 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 10:45:37 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:53 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/11 14:36:54 阅读更多 →