ComfyUI + MiniMax H3 实战教程:全模态视频生成,API 和本地两种玩法
发布日期2026-08-10 | 适用版本ComfyUI 0.30.0 | 话题MiniMax H3 · ComfyUI 视频生成 · AI 视频工作流MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的全模态视频生成模型开放权重能在同一上下文中同时接收文本、最多 9 张图片、3 段视频和 3 段音频作为输入输出最高 2K 分辨率、最长 15 秒的带原生立体声音频视频人声、音效和音乐在单次前向传播中一并生成无需后期叠加在 ComfyUI 中有两条接入路径——通过七牛云 MaaS 调 API无需本地 GPU或下载开放权重本地运行覆盖文生视频、图生视频、参考生视频三种工作流模式。MiniMax H3 能生成什么在视频生成模型里H3 的差异点在于真正的全模态输入——不是单纯的文生视频或图生视频而是能把图片、视频片段、音频素材混合给进去让模型理解它们之间的关系后再生成。几个关键参数输出规格最高 2K 分辨率24fps单次最长 15 秒原生音频不是后期配音是模型生成视频时直接合成立体声对白 音效 背景音乐文本编码器Qwen3VL 32B量化为 nvfp4_awq具备强大的多语言和视觉理解能力三种生成模式文生视频T2V、首尾帧生视频FLF2V、参考生视频R2V模型以 int8 量化权重pruned_int8_convrot格式开放本地部署显存要求较高如果不想买 GPU走 API 调用是更省心的选择。两条接入路径对比维度API 模式推荐本地权重模式硬件要求无计算在云端高显存 GPUQwen3VL 32B 编码器体量大上手难度低导入工作流模板即可需下载多个权重文件并手动配置节点费用结构按视频秒数计费一次下载本地电费网络依赖是下载后离线可运行适合场景快速验证、小批量生成大批量生产、需要完全控制方式一API 模式零 GPU七牛云 MaaS 接入第一步获取 API Key在七牛云 MaaS 平台sufy.com注册账户进入 AI 推理服务找到 MiniMax-H3 模型模型 IDminimax/minimax-h3在账户中生成 API Key。平台价格人民币计费计费类型单价视频输出2K¥0.80 / 秒视频输入2K 输出¥0.80 / 秒视频输出768P¥0.50 / 秒视频输入768P 输出¥0.50 / 秒图片输入¥0.20 / 张以一条 10 秒 768P 视频为例视频输出费用约 ¥5。第二步在 ComfyUI 中导入工作流模板打开 ComfyUI确保版本 ≥ 0.30.0在模板库搜索以下关键词导入对应 JSON生成模式模板搜索词文生视频MiniMax H3 T2V首尾帧生视频MiniMax H3 FLF2V参考生视频MiniMax H3 R2V也可直接从 Comfy-Org 的 GitHub 仓库下载对应 JSON 文件拖入导入。第三步填入 API Key运行生成在工作流的 API Key 节点填入从 sufy.com 获取的 Key配置提示词和参数点击运行即可。生成在云端完成本地只收返回的视频文件。方式二本地权重模式本地模式要求 ComfyUI 最低0.30.0 版本否则 MiniMax H3 的原生节点不可用。需要下载的权重文件从 Hugging FaceComfy-Org/MiniMax-H3仓库下载放入对应目录ComfyUI/ ├── models/ │ ├── diffusion_models/ │ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors # T2V/I2V 用 │ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # R2V 用与上面二选一 │ ├── text_encoders/ │ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors │ └── vae/ │ ├── minimax_h3_video_vae_fp16.safetensors │ └── minimax_h3_audio_vae_fp32.safetensors注意R2V 模式参考生视频使用ref2va扩散模型与 T2V/I2V 使用的fl2va不同需单独下载文本编码器和 VAE 两种模式共用。核心节点说明ComfyUI 节点名对应功能MiniMaxH3TextToVideo文生视频MiniMaxH3ImageToVideo图生视频支持首帧 / 尾帧输入MiniMaxH3ReferenceToVideo参考驱动生成Resolution Selector选择宽高比和分辨率Patch Sage Attention KJ可选需 KJNodes 插件加速推理三种生成模式详解文生视频T2V最简单的模式一段提示词出一段视频。提示词建议按整体场景 → 分镜头描述 → 音频期望的结构写H3 会根据对音频的描述自动合成立体声。宽高比预设16:9横屏、9:16竖屏、1:1时长 5–15 秒可调分辨率最高 2K。首尾帧生视频FLF2V给定首帧图片必填和尾帧图片可选让模型补全中间的运动过程。图片尺寸限制宽高均在 256–5760 px 之间宽高比在 2:5 到 5:2 之间两帧需保持一致的宽高比否则会强制裁切。参考生视频R2V最强大也最复杂的模式可以混合多个视觉和音频参考源让模型理解它们之间的关系后生成新视频。输入上限参考图片最多 9 张参考视频最多 3 段每段 2–15 秒总长 ≤15 秒帧率需在 23.976–60 FPS 之间参考音频最多 3 段总长 ≤15 秒至少需要搭配一张图片或一段视频提示词中引用参考素材的格式Picture 1 是主角穿蓝色上衣表情自然。 Video 1 展示她的走路姿态需要保持这个运动节奏。 Audio 1 是背景音乐整个视频延续这个风格。 镜头从她的正面缓慢推进伴随轻微脚步声。编号严格对应节点连接顺序从 1 开始不可跳号。提示词写作要点H3 的音频生成质量高度依赖提示词中对声音的描述很多人忽略这一点导致输出音频平淡。建议每段视频的提示词包含三类声音描述对白或人声说了什么、语气、情绪环境音效场景中应有的自然声音背景音乐风格、节奏、情绪基调分辨率设置短边建议 768px推荐全质量设置在 16:9 比例下约 100 万像素1344×768分辨率数值须为 32 的倍数。时长注意H3 的时长参数会吸附到模型内部的帧块网格24fps 下每块 17 帧填入的秒数会自动取最近的有效值不是所有整数秒都有效。常见问题QComfyUI 用了 API 模式生成结果保存在哪里API 模式下生成在 MiniMax 的云端服务器执行结果以视频文件形式返回到本地 ComfyUI 的输出目录与本地生成结果存放路径相同。Q本地模式至少需要多大显存官方文档未给出明确数值但文本编码器 Qwen3VL 32B量化为 nvfp4_awq体量较大加上扩散模型和两个 VAE建议至少 24GB 显存实际需求以社区测试为准。目前已有 RTX 408016GB搭配 int8 量化权重运行的案例但需要启用显存优化选项。Q通过七牛云 MaaS 调 API模型 ID 怎么填在 API 请求中model字段填minimax/minimax-h3接口端点参考 sufy.com 的接入文档apidocs.qnaigc.com。QR2V 模式的参考视频需要什么格式帧率在 23.976–60 FPS 之间单段时长 2–15 秒三段合计不超过 15 秒。格式建议 mp4分辨率建议与目标输出分辨率接近。小结MiniMax H3 是目前少数真正实现输入什么模态都能理解、输出带原生音频的开放权重视频生成模型。ComfyUI 提供了两条接入路径API 模式适合快速出片不需要本地 GPU通过七牛云 MaaS 按秒计费门槛极低本地权重模式适合需要完全控制的场景但对硬件要求较高。三种生成模式中R2V 的多参考融合能力是 H3 最有价值的差异化功能值得重点探索。本文数据基于 MiniMax 2026 年 7 月 31 日发布的模型权重和 ComfyUI 0.30.0 版本如遇界面差异以官方最新文档为准。延伸阅读ComfyUI 官方 MiniMax H3 工作流文档https://docs.comfy.org/zh/tutorials/video/minimax/minimax-h3MiniMax H3 官方发布博客https://www.minimaxi.com/blog/minimax-h3MaaS 模型广场含 MiniMax-H3 接入信息https://sufy.com/zh-CN/services/ai-inference/modelsComfyUI 节点权重下载仓库https://huggingface.co/Comfy-Org/MiniMax-H3

相关新闻

3步解锁老款Mac完整潜力:OpenCore Legacy Patcher终极实战指南

3步解锁老款Mac完整潜力:OpenCore Legacy Patcher终极实战指南

3步解锁老款Mac完整潜力:OpenCore Legacy Patcher终极实战指南 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 你是否拥有一台被苹果官方"抛…

2026/8/10 23:50:59 阅读更多 →
Meta Muse Code、Claude Code、Codex:2026 年三大 AI 编码智能体深度对比

Meta Muse Code、Claude Code、Codex:2026 年三大 AI 编码智能体深度对比

发布日期:2026-08-10 | 话题:AI 编码工具 | 适合:开发者、技术决策者Meta Muse Code 是 Meta 于 2026 年 8 月 5 日发布的首款 AI 编码智能体 beta 版,基于专为 Agent 协同训练的 Muse Spark 1.2 模型,主打大型代码库的…

2026/8/10 23:50:59 阅读更多 →
微信防撤回补丁完整指南:让你的撤回消息无所遁形

微信防撤回补丁完整指南:让你的撤回消息无所遁形

微信防撤回补丁完整指南:让你的撤回消息无所遁形 【免费下载链接】RevokeMsgPatcher :trollface: A hex editor for WeChat/QQ/TIM - PC版微信/QQ/TIM防撤回补丁(我已经看到了,撤回也没用了) 项目地址: https://gitcode.com/Git…

2026/8/10 23:49:58 阅读更多 →

最新新闻

[VirtualLab] VirtualLab Fusion 中的参数耦合

[VirtualLab] VirtualLab Fusion 中的参数耦合

1. 摘要利用VirtualLab Fusion的参数耦合功能可在光学设置中耦合参数。耦合的参数可重新计算系统的其他参数,进而自动保持系统参数间的关系。因此,参数耦合功能使用户可以参数设置复杂的依存关系。例如,在此示例中,我们使用参数耦…

2026/8/11 1:31:42 阅读更多 →
海外港口集卡拖车GPS终端物联卡:堆场盲区多网冗余组网方案

海外港口集卡拖车GPS终端物联卡:堆场盲区多网冗余组网方案

海外港口、跨境货运堆场的智慧调度作业,高度依赖集卡、拖车GPS终端实现车辆定位与轨迹监管。港区集装箱堆叠密集、大型设备与墙体遮挡多,存在大量网络信号盲区,易引发终端离线、定位漂移、数据断传等问题。港口集卡专用国际物联卡搭载多网冗余…

2026/8/11 1:31:42 阅读更多 →
氢燃料电池Simulink建模与仿真实践

氢燃料电池Simulink建模与仿真实践

1. 氢燃料电池Simulink建模概述氢燃料电池作为清洁能源技术的重要发展方向,其系统建模与仿真一直是工程研究的热点。基于MATLAB/Simulink的建模方法因其可视化编程和模块化特性,成为燃料电池系统开发的标准工具链。这套模型包含三个核心子系统&#xff1…

2026/8/11 1:31:42 阅读更多 →
自主无人机着陆数据集(TEKNOFEST)

自主无人机着陆数据集(TEKNOFEST)

摘要:自主无人机着陆数据集(TEKNOFEST)源自TEKNOFEST航空人工智能竞赛,是一个专门用于无人机自主着陆和障碍物规避的高分辨率航拍目标检测数据集。数据集简介数据集概述自主无人机着陆数据集(TEKNOFEST)源自…

2026/8/11 1:31:42 阅读更多 →
SKILL SELF-EVOLUTION — MICROSOFT SKILLOPT PRINCIPLES (TRAIN SKILLS LIKE WEIGHTS)

SKILL SELF-EVOLUTION — MICROSOFT SKILLOPT PRINCIPLES (TRAIN SKILLS LIKE WEIGHTS)

═══ SKILL SELF-EVOLUTION — MICROSOFT SKILLOPT PRINCIPLES (TRAIN SKILLS LIKE WEIGHTS) ═══ S1 ROLLOUT: every executed task is a forward pass — its outcome isevidence; record what worked and what failed. S2 REFLECT: every failure is a gradient signa…

2026/8/11 1:31:42 阅读更多 →
从离散Token到稠密向量:Embedding核心原理与工程实践全解析

从离散Token到稠密向量:Embedding核心原理与工程实践全解析

1. 项目概述:从离散符号到连续空间的桥梁在自然语言处理(NLP)和现代机器学习领域,我们常常会遇到一个看似简单却至关重要的任务:如何让计算机理解“苹果”这个词?对于人类来说,“苹果”可以联想…

2026/8/11 1:30:42 阅读更多 →

日新闻

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南

如何用Video2X实现专业级视频画质提升:AI视频增强完整指南 【免费下载链接】video2x A machine learning-based video super resolution and frame interpolation framework. Est. Hack the Valley II, 2018. 项目地址: https://gitcode.com/GitHub_Trending/vi/v…

2026/8/11 0:00:02 阅读更多 →
前后端分离项目中控制台与接口工具数据差异排查指南

前后端分离项目中控制台与接口工具数据差异排查指南

1. 问题现象解析:控制台与Apifox的数据差异 最近在调试一个前后端分离项目时,遇到了一个典型问题:后端服务在本地开发环境控制台能正常输出查询数据,但通过Apifox测试时却返回空结果。这种"控制台有数据,接口工具…

2026/8/11 0:00:03 阅读更多 →
AI编程实战:从Claude Code踩坑到游戏开发入门

AI编程实战:从Claude Code踩坑到游戏开发入门

1. 从“AI能帮我做游戏”到“AI让我重新学编程”最近身边不少朋友,尤其是一些非技术背景、但对游戏开发有浓厚兴趣的朋友,都在问我同一个问题:“听说现在用Claude Code这种AI编程工具,小白也能做游戏了,是真的吗&#…

2026/8/11 0:00:03 阅读更多 →

周新闻

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁 【免费下载链接】baidupankey 在线查询网盘提取码(维护中 rm repo) 项目地址: https://gitcode.com/gh_mirrors/ba/baidupankey 你是否曾经在深夜寻找一份重要资料&#x…

2026/8/11 1:08:05 阅读更多 →
如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/11 1:08:05 阅读更多 →
收藏!小白程序员轻松入门大模型,从Harness工程开始实践

收藏!小白程序员轻松入门大模型,从Harness工程开始实践

文章强调学习大模型不应只关注模型本身,而应重视模型外的系统搭建,即Harness。提出AgentModelHarness的实用公式,详细介绍Harness的四个层次:持久化层、执行层、控制层和观察与验证层。文章还探讨了上下文工程、工具设计、AGENTS.…

2026/8/11 1:08:05 阅读更多 →

月新闻

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南

免费解锁百度网盘SVIP加速:macOS用户必备的下载提速终极指南 【免费下载链接】BaiduNetdiskPlugin-macOS For macOS.百度网盘 破解SVIP、下载速度限制~ 项目地址: https://gitcode.com/gh_mirrors/ba/BaiduNetdiskPlugin-macOS 还在为百度网盘macOS版的龟速下…

2026/8/10 17:07:33 阅读更多 →
终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换

终极ncmdump指南:3分钟实现网易云NCM音乐解密与格式转换 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 还在为网易云音乐下载的NCM格式文件无法在其他播放器播放而烦恼吗?ncmdump解密工具帮你轻松解决这个困…

2026/8/11 1:08:06 阅读更多 →
HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

HarmonyOS 应用开发《掌上英语》第81篇: 智能体卡片:为英语学习 App 打造桌面级学习助手

AgentCard 智能体卡片:为英语学习 App 打造桌面级学习助手适用平台:HarmonyOS 7.0 (API 26 Beta)一、引言 HarmonyOS 7.0(API 26 Beta)新增了 AgentCard 智能体卡片能力,这是继 HMAF(鸿蒙智能体框架&#x…

2026/8/10 17:07:33 阅读更多 →