LongCat-Video INT8量化推理实战:显存占用减半的完整落地方案
LongCat-Video INT8量化推理实战显存占用减半的完整落地方案【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-VideoLongCat-Video 是美团开源的 13.6B 参数视频生成基础模型其 Avatar 1.5 版本可凭一张参考图 一段音频生成口型精准对齐的数字人视频。本文围绕官方内置的INT8 量化推理能力讲解如何用一行--use_int8参数把 DiT 主模型显存从约 27GB 压缩到约 14GB让中等显存的显卡也能流畅跑通 720P 数字人生成。什么是 INT8 量化推理显存为何能直接减半 视频生成模型最大的显存消耗来自 DiT 主干网络。13.6B 参数在 bf16 精度下需要约27GB权重显存加上 VAE、文本编码器、Whisper 音频编码器和推理激活值消费级显卡几乎必然 OOM。LongCat-Video 官方在 longcat_video/modules/quantization.py 中内置了INT8 权重量化weight-only方案原理非常直观每通道对称量化将每个线性层的权重按输出通道计算一个缩放因子把权重压缩为 1 字节的 int8 整数见 quantization.py#L33-L48 中的QuantizedLinear.from_linear推理时即时反量化前向计算时把 int8 权重还原到与输入一致的精度参与矩阵乘法因此计算精度路径完全不变视觉质量几乎无损见 quantization.py#L26-L31敏感层跳过输出投影final_layer.linear对精度敏感会保留 bf16 不参与量化见 quantization.py#L54-L57。由于权重从 2 字节/参数变成 1 字节/参数DiT 权重显存直接减半。下图就是该项目双角色对唱视频生成的典型效果量化后的权重以约 4GB 一份的 safetensors 分片保存并附带quantization_config.json记录量化方式int8_per_channel_symmetric推理脚本通过 load_quantized_dit() 一键加载。第一步环境准备与模型权重下载1. 克隆代码仓库git clone --single-branch --branch main https://gitcode.com/GitHub_Trending/lo/LongCat-Video cd LongCat-Video2. 创建环境并安装依赖Python 3.10CUDA 12.4conda create -n longcat-video python3.10 -y conda activate longcat-video # PyTorch FlashAttention-2 pip install torch2.6.0cu124 torchvision0.21.0cu124 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu124 pip install ninja psutil packaging pip install flash_attn2.7.4.post1 # 基础依赖 Avatar 数字人依赖 pip install -r requirements.txt conda install -c conda-forge librosa ffmpeg pip install -r requirements_avatar.txt3. 下载两套模型权重⚠️ 注意Avatar 脚本运行时会从上级目录加载 LongCat-Video 的 tokenizer / 文本编码器 / VAE因此两套都要下载pip install huggingface_hub[cli] huggingface-cli download meituan-longcat/LongCat-Video --local-dir ./weights/LongCat-Video huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 --local-dir ./weights/LongCat-Video-Avatar-1.5下载完成后weights/LongCat-Video-Avatar-1.5/base_model_int8/子目录就是INT8 量化权重base_model/是 bf16 原始权重两者可自由切换。第二步单角色数字人视频生成实战准备输入 JSON参考图 音频 提示词仓库自带示例 assets/avatar/single_example_1.json{ prompt: A western man stands on stage under dramatic lighting, holding a microphone close to their mouth..., cond_image: assets/avatar/single/man.png, cond_audio: { person1: assets/avatar/single/man.mp3 } }运行 run_demo_avatar_single_audio_to_video.py 脚本核心就是加上--use_int8双卡并行时再加--context_parallel_size2进一步分摊显存torchrun --nproc_per_node2 run_demo_avatar_single_audio_to_video.py \ --context_parallel_size2 \ --checkpoint_dir./weights/LongCat-Video-Avatar-1.5 \ --stage_1ai2v \ --input_jsonassets/avatar/single_example_1.json \ --use_distill --model_type avatar-v1.5 --use_int8参数说明参数作用--use_int8加载base_model_int8量化权重显存减半的关键开关--model_type avatar-v1.5指定 Avatar 1.5INT8 目前仅支持该版本--use_distill启用 8 步蒸馏采样v1.5 的必选项大幅加速推理--stage_1ai2v音频参考图驱动改为at2v则纯文本音频驱动--num_segments生成多段续接视频可做分钟级长视频--resolution支持 480p / 720p 两种分辨率脚本内部逻辑见 run_demo_avatar_single_audio_to_video.py#L126-L130use_int8为真时调用load_quantized_dit()加载量化 DiT否则加载 bf16 的base_model。第三步多角色对话视频生成双人对口型场景使用 run_demo_avatar_multi_audio_to_video.py两条独立音轨分别驱动两位角色torchrun --nproc_per_node2 run_demo_avatar_multi_audio_to_video.py \ --context_parallel_size2 \ --checkpoint_dir./weights/LongCat-Video-Avatar-1.5 \ --input_jsonassets/avatar/multi_example_1.json \ --use_distill --model_type avatar-v1.5 --use_int8输入 JSON 参考 assets/avatar/multi_example_1.jsoncond_audio下配置person1/person2两条音频即可同样带--use_int8即可享受显存减半显存占用对比bf16 vs INT8 量化组成bf16 全精度INT8 量化--use_int8DiT 主干权重13.6B 参数≈ 27 GB≈ 13.6 GB ✅双卡并行时每卡分摊权重≈ 13.5 GB≈ 6.8 GB ✅24GB 显卡 720P 长视频高风险 OOM可稳定运行 量化只压缩 DiT 权重VAE、文本编码器、Whisper 音频编码器仍以 bf16 加载。因此 INT8 双卡并行是中等显存设备跑 720P 数字人视频的最优组合。常见问题与踩坑指南 ️Q基础版 LongCat-Video文生视频/图生视频能用 INT8 吗目前--use_int8仅在--model_type avatar-v1.5下生效基础版脚本暂不支持这是官方文档明确说明的限制见 README.md#L171。Q画质会有明显损失吗INT8 采用每通道对称量化 敏感层跳过 推理时即时反量化官方方案下视觉差异极小若追求极致精度去掉--use_int8即可回退 bf16 权重。Q参考图有什么要求任意清晰的人像照都可以如咖啡馆、舞台等场景均可作为驱动素材Q提示词怎么写效果更好官方建议写长一些包含人物外貌、动作、场景细节的完整描述口型一致性会明显提升音频 CFG 建议保持在 3–5 之间。相关文件速查量化核心实现QuantizedLinear/load_quantized_ditlongcat_video/modules/quantization.py单角色推理脚本run_demo_avatar_single_audio_to_video.py多角色推理脚本run_demo_avatar_multi_audio_to_video.pyAvatar 1.5 技术报告assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf输入示例assets/avatar/single_example_1.json、assets/avatar/multi_example_1.json依赖清单requirements.txt、requirements_avatar.txt小结LongCat-Video 的 INT8 量化推理把 13.6B DiT 的权重显存从约 27GB 砍到约 14GB配合--use_distill的 8 步蒸馏采样和上下文并行构成了目前中小显存设备落地数字人视频生成的完整方案——只需下载带base_model_int8子目录的 Avatar 1.5 权重命令加一个--use_int8即可开跑 【免费下载链接】LongCat-Video项目地址: https://gitcode.com/GitHub_Trending/lo/LongCat-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

WiX Toolset 3.x 中的 Light 任务:.wixproj 链接参数完整指南

WiX Toolset 3.x 中的 Light 任务:.wixproj 链接参数完整指南

开发工具构建工具 【免费下载链接】wix3 WiX Toolset v3.x 项目地址: https://gitcode.com/gh_mirrors/wi/wix3 点击查看 免费下载 Light 是 WiX 工具集(v3.x)的 MSBuild 链接任务,它在构建流水线中把 candle.exe 编译出的 .wixo…

2026/10/5 2:20:32 阅读更多 →
高性能移动 Web 开发实战:Mars 仓库中的 CSS3 动画与渲染性能优化

高性能移动 Web 开发实战:Mars 仓库中的 CSS3 动画与渲染性能优化

前端移动开发 【免费下载链接】Mars 腾讯移动 Web 前端知识库 项目地址: https://gitcode.com/gh_mirrors/mar/Mars 点击查看 免费下载 导读:本文以腾讯移动 Web 前端知识库 Mars 仓库的 performance 性能专题 为主体,系统讲解移动端高性能 …

2026/10/5 2:20:32 阅读更多 →
tldr-pages 中的 a2ping 命令速查:图像转 EPS/PDF 的简明实战指南

tldr-pages 中的 a2ping 命令速查:图像转 EPS/PDF 的简明实战指南

文档教程知识库 【免费下载链接】tldr Collaborative cheatsheets for console commands 📚. 项目地址: https://gitcode.com/GitHub_Trending/tl/tldr 点击查看 免费下载 本文以 tldr-pages 仓库中的 a2ping 孟加拉语速查页 为核心骨架,结合…

2026/10/5 2:20:32 阅读更多 →

最新新闻

vcpkg从零安装到项目集成:C++依赖管理实战与报错排查

vcpkg从零安装到项目集成:C++依赖管理实战与报错排查

1. vcpkg到底是什么?先搞清楚它帮你解决什么问题1.1 Windows下C库安装的老大难问题在Windows上做C开发,我想很多人都有过这种经历:项目做到一半,需要引入一个第三方库,打开GitHub,找到仓库,克隆…

2026/10/5 7:40:48 阅读更多 →
MySQL内存占用居高不下?排查RSS虚高的完整链路与调优指南

MySQL内存占用居高不下?排查RSS虚高的完整链路与调优指南

凌晨两点被监控电话吵醒,是每个数据库运维都逃不掉的宿命。电话那边只有一句话:MySQL所在服务器内存使用率已超过95%。我披上衣服坐到电脑前,看了下free -h,8G的机器只剩300多M可用;再看top里mysqld那一行的RES&#x…

2026/10/5 7:40:48 阅读更多 →
OpenClaw云端部署指南:接入飞书机器人打造团队AI助理

OpenClaw云端部署指南:接入飞书机器人打造团队AI助理

把 AI 助手搬到云端这件事,我去年踩了不少坑。先说结论:OpenClaw 这类开源 Agent 框架,装在自己电脑上跑,属于“能跑但难受”——电脑一关它就下班,出差想用还得远程连回去,更别提群里同事想找它办事的时候…

2026/10/5 7:40:48 阅读更多 →
后台任务点了取消,为什么数据还在?

后台任务点了取消,为什么数据还在?

后台任务取消与数据撤销的边界 摘要| AI任务越能自动行动,停止按钮就越需要清楚的语义。结合Microi吾码当前后台任务实现,我们把取消请求、执行停止、事务提交与业务补偿拆开,解释为什么“已停止”无法自动撤回此前成功写入的数据…

2026/10/5 7:40:48 阅读更多 →
为什么配眼镜建议做医学验光,普通验光不够用吗?/钟祥极博视科普

为什么配眼镜建议做医学验光,普通验光不够用吗?/钟祥极博视科普

前些天,有位街坊在莫愁大道边的眼镜店里,给孩子配镜,店员问了一句:“要不要做医学验光?”她有点懵,心想这不都是验光吗?怎么还分两种?几分钟能完事的事,为什么还有人愿意…

2026/10/5 7:40:48 阅读更多 →
Kotlin协变与逆变:从类型安全到out/in关键字的彻底理解

Kotlin协变与逆变:从类型安全到out/in关键字的彻底理解

Kotlin高阶特性里,协变(Covariance)和逆变(Contravariance)属于那种“看着简单,一写就错”的知识点。我见过不少同学,面试前能把“out 是生产者、in 是消费者”背得滚瓜烂熟,回到项目…

2026/10/5 7:39:48 阅读更多 →

日新闻

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

马斯克杀回智能体战场,Grok 4.5万亿参数撑腰,Cursor接手数字白领项目:用TaoToken统一Key跑通多模型Agent工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:22 阅读更多 →
AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

AI编程工具插件机制详解:plugin.json配置与加载失败排查指南

1. 从“plugins”这个词说起:它到底在解决什么问题如果你最近在折腾 AI 编程工具,尤其是 Cursor、Codex CLI、Claude Code 这类带 CLI 的编辑器或命令行助手,那你大概率绕不开一个词——plugins。这个词本身不新鲜,从浏览器到 IDE…

2026/10/5 0:00:23 阅读更多 →
第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

第26课:OpenClaw|日志审计与问题诊断:把日志链路改到 TaoToken 的排查清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 0:00:23 阅读更多 →

周新闻

KT148A语音芯片外挂8002D功放的工程实践指南

KT148A语音芯片外挂8002D功放的工程实践指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 5:06:42 阅读更多 →
LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

LLC谐振变换器增益公式推导:从FHA等效到完整归一化表达式

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 1:10:22 阅读更多 →
ARM架构深度解析:从RISC设计理念到交叉编译实战

ARM架构深度解析:从RISC设计理念到交叉编译实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/5 3:06:17 阅读更多 →

月新闻

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 11:40:45 阅读更多 →
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 9:43:54 阅读更多 →
黑夜航拍船只数据集训练YOLOV5模型全流程解析

黑夜航拍船只数据集训练YOLOV5模型全流程解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 20:14:29 阅读更多 →