人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载AngelSlim 是一个专注于大模型压缩的开源工具包集 FP8 量化、INT4 量化、投机采样等主流压缩算法于一体。本文以FP8 静态量化FP8-Static为例手把手演示如何用22GB 显存的单卡 GPU完成 235B 参数 MoE 模型Qwen3-235B-A22B的量化并通过 vLLM 实现几乎零掉点上线。为什么选 FP8 量化压缩 MoE 大模型MoE 模型参数量动辄数百亿BF16 精度下 Qwen3-235B-A22B 的权重就超过470GB存储与传输成本极高。FP8 量化把权重和激活都压到 8-bit体积直接减半且推理速度基本不降。相比 INT4FP8 保留了浮点动态范围对 MoE 这类专家权重分布差异大的模型更友好——这也是各大厂 235B/400B 级模型官方 FP8 版本越来越多的原因。AngelSlim 的 FP8 量化支持两种模式模式激活量化方式适用场景fp8_dynamic在线动态量化无需校准数据快速上手fp8_static离线静态量化需校准精度更稳推荐生产使用静态量化需要一小份校准数据集256 条 ShareGPT 样本即可详细原理可参阅 docs/source/features/quantization/fp8.md。单卡量化 235B 的关键low_memory 模式标准 FP8 静态量化需要把整个模型常驻显存235B 模型优化前需要455GB显存。AngelSlim 内置了low_memory模式核心实现在 angelslim/compressor/quant/modules/fp8/fp8.py思路非常朴素整个模型以 BF16 放在CPU 内存上device_map: cpu校准时逐层搬运到 GPU取一层 → 前向计算并释放 → 取下一层配合Catcher捕获每层输入避免全模型前向。效果如下表max_seq_len4096模型优化前显存占用开启 low_memory 模式Qwen3-235B-A22B455GB22GB也就是说一张 RTX 4090 / L40S24GB就能跑完整个量化流程无需多机多卡集群。三步完成单卡量化环境、配置、执行第一步环境准备pip install angelslim若需使用 main 分支最新功能也可从源码安装git clone https://gitcode.com/gh_mirrors/an/AngelSlim后执行python setup.py install。完整要求见 docs/source/getting_started/installation.md。第二步准备配置文件AngelSlim 采用「一个 yaml 一次压缩任务」的设计仓库内置了现成的 235B 低显存配置configs/qwen3/ptq/fp8_static/qwen3-a22b_fp8_static_low_memroy.yamlmodel: name: Qwen model_path: Qwen/Qwen3-235B-A22B device_map: cpu # 关键模型整体放 CPU 内存 compression: name: PTQ quantization: name: fp8_static bits: 8 low_memory: True # 关键开启低显存逐层量化 quant_method: weight: per-tensor activation: per-tensor ignore_layers: - lm_head dataset: name: TextDataset data_path: ./dataset/sharegpt_gpt4_qwen/sharegpt_gpt4-qwen3_a22B_output.jsonl max_seq_length: 4096 num_samples: 256 batch_size: 1三个必配项device_map: cpulow_memory: True省显存双保险、data_path校准数据仓库自带 dataset/sharegpt_gpt4_qwen/、ignore_layers保留lm_head不量化。其他模型的同类配置都放在 configs/ 下按「模型/精度」分类如 DeepSeek-R1 的 configs/deepseek_r1/fp8_static/deepseek_r1_fp8_static_low_memmory.yaml。第三步一键执行python3 tools/run.py -c configs/qwen3/ptq/fp8_static/qwen3-a22b_fp8_static_low_memroy.yamltools/run.py 会按配置自动完成加载模型 → 校准采集激活 scale → 权重量化为 FP8 → 保存输出模型。量化配置会自动写入产出目录的config.jsonquant_method: compressed-tensors格式部署引擎可直接识别无需手动改配置。零掉点验证官方 Benchmark 数据量化后最怕体积减半、智商也减半。AngelSlim 官方在 CEVAL / MMLU / GSM8K / HUMANEVAL 上对 235B 模型的实测结果docs/source/performance/quantization/benchmarks.md量化方式CEVALMMLUGSM8KHUMANEVALBF16 原始89.6086.2885.2927.44FP8-Static89.6786.1986.9627.44FP8-Dynamic89.6786.1885.2228.05INT8-Dynamic88.9386.2086.2023.78可以看到 FP8-Static 在 CEVAL 上甚至微涨 0.07MMLU 仅波动 0.09GSM8K 提升 1.67——基本可视为零掉点而模型体积减半、推理吞吐提升。进阶量化质量体检找离群值如果业务上追求极致精度可以开启量化分析检查 scale 是否存在离群值、FP8 难以拟合的权重分布运行前在配置中加quant_analyse: true量化过程即会输出 scale 分布量化完成后用后处理工具分析产出文件# Scale 分布折线图 log 分析 python3 tools/fp8_quant_analyse.py --analyse-type act --model-path $FP8_PATH # BF16 vs FP8 权重直方图对比 python3 tools/fp8_quant_analyse.py --analyse-type weight --bf16-path $BF16_PATH --fp8-path $FP8_PATH --layer-index 0工具位于 tools/fp8_quant_analyse.py产出效果示例分析工具还能帮你定位个别异常层配合ignore_layers排除后再量化即可。上线部署vLLM 一键拉起 OpenAI APIFP8 产出模型兼容 compressed-tensors 标准vLLM 原生支持无需额外插件pip install vllm0.8.5.post1 python3 -m vllm.entrypoints.openai.api_server \ --host 0.0.0.0 \ --port 8080 \ --model ${MODEL_PATH} \ --tensor-parallel-size 4 \ --gpu-memory-utilization 0.9 \ --max-model-len 4096 \ --trust-remote-code服务默认在http://localhost:8080提供兼容 OpenAI 的/v1/chat/completions接口。部署细节SGLang 后端、多节点 Ray 启动、API 调用示例见 docs/source/deployment/deploy.md现成脚本在 scripts/deploy/ 下。常见问题 FAQ量化时下载模型失败国内网络建议改从 ModelScope 下载后填本地路径。部署 Qwen3-MoE 报CUDA error: no kernel image is available把 vLLM 升级到0.9.2即可官方文档已标注此已知问题。显存还是不够调小batch_size设为 1、调小max_seq_lengthlow_memory模式下显存峰值基本只与单层大小相关。想进一步压到 INT4仓库提供int4_gptq、int4_awq、NVFP4 等配置同样走tools/run.py -c 你的.yaml流程。总结省显存device_map: cpulow_memory: True双配置22GB 单卡量化 235B MoE不掉点FP8-Static 在四项主流 benchmark 上相对 BF16 波动 0.1易部署产出标准 compressed-tensors 格式vLLM 一条命令拉起 OpenAI 兼容服务。整套流程就是一条python3 tools/run.py -c 你的.yaml命令235B 大模型的压缩门槛从此从多机集群降到一张 4090。赞分享人工智能大模型模型压缩模型量化模型蒸馏模型优化【免费下载链接】AngelSlimModel compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.项目地址https://gitcode.com/gh_mirrors/an/AngelSlim点击查看免费下载相关推荐Qwen3-235B-A22B 在 NVIDIA A100 上的吞吐量优化实战vLLM 引擎选型、FP8 量化与并行策略调优指南Qwen3 235B A22B 在 NVIDIA A100 上的吞吐量优化实战vLLM 引擎选型、FP8 量化与并行策略调优指南 导读 本文是 GPUStac后端人工智能模型推理服务集群管理可观测性解密Qwen3-235B-A22B思考模型FP8量化如何让AI推理成本减半解密Qwen3 235B A22B思考模型FP8量化如何让AI推理成本减半 你是否曾经遇到过这样的困境想要部署一个强大的AI模型却被高昂的GPU成本劝退大模型深度学习双模式FP8量化Qwen3-1.7B-FP8如何重塑轻量级大模型标准双模式FP8量化Qwen3 1.7B FP8如何重塑轻量级大模型标准 导语轻量级大模型的效率革命 你是否在为企业AI部署的三高困境发愁高算力成本、高大模型深度学习创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考