LongCat-Video INT8量化推理实战显存占用减半的完整落地方案【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-VideoLongCat-Video 是美团开源的 13.6B 参数视频生成基础模型其 Avatar 1.5 版本可凭一张参考图 一段音频生成口型精准对齐的数字人视频。本文围绕官方内置的INT8 量化推理能力讲解如何用一行--use_int8参数把 DiT 主模型显存从约 27GB 压缩到约 14GB让中等显存的显卡也能流畅跑通 720P 数字人生成。什么是 INT8 量化推理显存为何能直接减半 视频生成模型最大的显存消耗来自 DiT 主干网络。13.6B 参数在 bf16 精度下需要约27GB权重显存加上 VAE、文本编码器、Whisper 音频编码器和推理激活值消费级显卡几乎必然 OOM。LongCat-Video 官方在 longcat_video/modules/quantization.py 中内置了INT8 权重量化weight-only方案原理非常直观每通道对称量化将每个线性层的权重按输出通道计算一个缩放因子把权重压缩为 1 字节的 int8 整数见 quantization.py#L33-L48 中的QuantizedLinear.from_linear推理时即时反量化前向计算时把 int8 权重还原到与输入一致的精度参与矩阵乘法因此计算精度路径完全不变视觉质量几乎无损见 quantization.py#L26-L31敏感层跳过输出投影final_layer.linear对精度敏感会保留 bf16 不参与量化见 quantization.py#L54-L57。由于权重从 2 字节/参数变成 1 字节/参数DiT 权重显存直接减半。下图就是该项目双角色对唱视频生成的典型效果量化后的权重以约 4GB 一份的 safetensors 分片保存并附带quantization_config.json记录量化方式int8_per_channel_symmetric推理脚本通过 load_quantized_dit() 一键加载。第一步环境准备与模型权重下载1. 克隆代码仓库git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/lo/LongCat-Video cd LongCat-Video2. 创建环境并安装依赖Python 3.10CUDA 12.4conda create -n longcat-video python3.10 -y conda activate longcat-video # PyTorch FlashAttention-2 pip install torch2.6.0cu124 torchvision0.21.0cu124 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu124 pip install ninja psutil packaging pip install flash_attn2.7.4.post1 # 基础依赖 Avatar 数字人依赖 pip install -r requirements.txt conda install -c conda-forge librosa ffmpeg pip install -r requirements_avatar.txt3. 下载两套模型权重⚠️ 注意Avatar 脚本运行时会从上级目录加载 LongCat-Video 的 tokenizer / 文本编码器 / VAE因此两套都要下载pip install huggingface_hub[cli] huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 --local-dir ./weights/LongCat-Video-Avatar-1.5下载完成后weights/LongCat-Video-Avatar-1.5/base_model_int8/子目录就是INT8 量化权重base_model/是 bf16 原始权重两者可自由切换。第二步单角色数字人视频生成实战准备输入 JSON参考图 音频 提示词仓库自带示例 assets/avatar/single_example_1.json{ prompt: A western man stands on stage under dramatic lighting, holding a microphone close to their mouth..., cond_image: assets/avatar/single/man.png, cond_audio: { person1: assets/avatar/single/man.mp3 } }运行 run_demo_avatar_single_audio_to_video.py 脚本核心就是加上--use_int8双卡并行时再加--context_parallel_size2进一步分摊显存torchrun --nproc_per_node2 run_demo_avatar_single_audio_to_video.py \ --context_parallel_size2 \ --checkpoint_dir./weights/LongCat-Video-Avatar-1.5 \ --stage_1ai2v \ --input_jsonassets/avatar/single_example_1.json \ --use_distill --model_type avatar-v1.5 --use_int8参数说明参数作用--use_int8加载base_model_int8量化权重显存减半的关键开关--model_type avatar-v1.5指定 Avatar 1.5INT8 目前仅支持该版本--use_distill启用 8 步蒸馏采样v1.5 的必选项大幅加速推理--stage_1ai2v音频参考图驱动改为at2v则纯文本音频驱动--num_segments生成多段续接视频可做分钟级长视频--resolution支持 480p / 720p 两种分辨率脚本内部逻辑见 run_demo_avatar_single_audio_to_video.py#L126-L130use_int8为真时调用load_quantized_dit()加载量化 DiT否则加载 bf16 的base_model。第三步多角色对话视频生成双人对口型场景使用 run_demo_avatar_multi_audio_to_video.py两条独立音轨分别驱动两位角色torchrun --nproc_per_node2 run_demo_avatar_multi_audio_to_video.py \ --context_parallel_size2 \ --checkpoint_dir./weights/LongCat-Video-Avatar-1.5 \ --input_jsonassets/avatar/multi_example_1.json \ --use_distill --model_type avatar-v1.5 --use_int8输入 JSON 参考 assets/avatar/multi_example_1.jsoncond_audio下配置person1/person2两条音频即可同样带--use_int8即可享受显存减半显存占用对比bf16 vs INT8 量化组成bf16 全精度INT8 量化--use_int8DiT 主干权重13.6B 参数≈ 27 GB≈ 13.6 GB ✅双卡并行时每卡分摊权重≈ 13.5 GB≈ 6.8 GB ✅24GB 显卡 720P 长视频高风险 OOM可稳定运行 量化只压缩 DiT 权重VAE、文本编码器、Whisper 音频编码器仍以 bf16 加载。因此 INT8 双卡并行是中等显存设备跑 720P 数字人视频的最优组合。常见问题与踩坑指南 ️Q基础版 LongCat-Video文生视频/图生视频能用 INT8 吗目前--use_int8仅在--model_type avatar-v1.5下生效基础版脚本暂不支持这是官方文档明确说明的限制见 README.md#L171。Q画质会有明显损失吗INT8 采用每通道对称量化 敏感层跳过 推理时即时反量化官方方案下视觉差异极小若追求极致精度去掉--use_int8即可回退 bf16 权重。Q参考图有什么要求任意清晰的人像照都可以如咖啡馆、舞台等场景均可作为驱动素材Q提示词怎么写效果更好官方建议写长一些包含人物外貌、动作、场景细节的完整描述口型一致性会明显提升音频 CFG 建议保持在 3–5 之间。相关文件速查量化核心实现QuantizedLinear/load_quantized_ditlongcat_video/modules/quantization.py单角色推理脚本run_demo_avatar_single_audio_to_video.py多角色推理脚本run_demo_avatar_multi_audio_to_video.pyAvatar 1.5 技术报告assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf输入示例assets/avatar/single_example_1.json、assets/avatar/multi_example_1.json依赖清单requirements.txt、requirements_avatar.txt小结LongCat-Video 的 INT8 量化推理把 13.6B DiT 的权重显存从约 27GB 砍到约 14GB配合--use_distill的 8 步蒸馏采样和上下文并行构成了目前中小显存设备落地数字人视频生成的完整方案——只需下载带base_model_int8子目录的 Avatar 1.5 权重命令加一个--use_int8即可开跑 【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考