MiniMax 想做视频界的 Claude CodeH3 的野心被极客公园看穿了【免费下载链接】MiniMax-H3MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力能够出色地执行复杂的多模态指令。项目地址: https://ai.gitcode.com/MiniMax-AI/MiniMax-H3极客公园的一篇评论把 MiniMax 的野心摆到了台面上MiniMax 要做的不是又一个文生视频模型而是视频领域的 Claude Code。这个判断并非标题党的修辞——如果你把 H3 的官方系统设计拆开来看会发现它从第一天起就不是按生成器的规格而是按可编排创作系统的规格来搭建的。本文基于 H3 的开源仓库源码与官方文档逐层拆解这个论断视频界 Claude Code 到底指什么、H3 的能力储备离它还有多远以及 MiniMax 正在铺开的商业路径。视频界 Claude Code 具体指什么Agent 化创作 vs 单点生成Claude Code 之所以被称为编程范式革命不在于它能生成一段代码而在于它把编程变成了一个可执行的编排循环理解意图 → 拆解任务 → 调用工具 → 执行 → 检查结果 → 修正重试。对比之下绝大多数视频生成产品仍停留在单点生成给一句 prompt吐一段视频不行就再抽一次签人负责在循环外做判断。H3 的架构刻意地长成了前者。仓库 README.md 明确把完整系统拆成三个模块H3-Context-IR深度理解与提炼多模态输入指令将其转换为 H3 可读的上下文中间表示Context Intermediate RepresentationH3-Base基于 IR 输出生成 768p 音视频H3-Regenerate-2K把 768p 结果连同原始上下文重新喂回模型在 2K 分辨率下再生恢复小字、细节等超分猜不出来的信息。这本质上就是一个 plan-and-execute 流水线Context-IR 是规划层Base 是执行层Regenerate-2K 是精修反馈层。README 对 Context-IR 的职责描述更直白——instruction parsing, cross-modal association, temporal understanding, and complex logical reasoningREADME.md并明确警告H3-Context-IR is critical to the quality of the final output强烈建议生成管线中必须包含它。开源仓库中的调用脚本把这条流水线的编排感暴露无遗。scripts/readme/full-2k-t2va-h3-context-ir.sh 展示了第一步用户只给一句 30 字的创意a female captain stands alone before a massive observation window as the last fleet gathers and jumps awayContext-IR 任务返回的是按时间轴切分的分镜Shot 1/Shot 2、逐秒的运镜与动作、完整的 overall_soundscape 声音场设计和 non_diegetic_music 配乐方案——注意返回 JSON 里 8565 个 token 里 5650 个是 prompt tokens2915 个是扩写产出。也就是说用户面对的不再是生成器而是创作 Agent它替你完成了分镜、转场、声音设计这些本应属于导演和剪辑师的规划劳动再交由生成引擎执行。这与 Claude Code 替你规划文件结构、再逐文件落地代码的工作方式是同构的。H3 的能力储备全模态输入、2K 有声、In-Context 编辑离 Agent 还有多远一个编排系统光有流程不够执行引擎的能力上限决定了 Agent 的天花板。H3 的储备可以分成三块看。全模态输入Agent 的感知层已经打通。仓库 README.md 的系统概览声明 H3 支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解。两个 checkpoint 的输入规格相当激进H3-Base-Ref2VA 的 Omni-reference 模式支持最多 9 张图、3 段视频每段 2–15 秒、3 段音频混合输入文件总数上限 12 个。这意味着 Agent 的上下文窗口可以直接装下一整个素材库——参考视频、参考音色、关键帧、文字脚本可以同时进模型。2K 有声执行层的输出能力。H3-Base 默认短边 768p、24 FPS、输出 4–15 秒音频规格是 32 kHz 立体声左声道与右声道由同一个 H3-AudioVAE 编码器/解码器独立处理再重组README.md。对照 FL2VA/audio_vae/config.yaml采样率 32000、latent channels 32每声道把 32 kHz 音频压成 40 Hz 的 latent token 序列。视觉侧H3-VisualVAE 是时空因果自编码器空间 16×、时间 4× 压缩24 个 latent 通道f16t4d24进入 Transformer 前再按 1×2×2 的 patch 切分等效空间降采样 32×README.mdFL2VA/video_vae/config.json 中 latent_channels: 24、vae_tile_size: 256 可佐证。2K 输出不是外挂超分模块而是自己再生自己的 in-context 方式复用原始多模态上下文找回细节——这条设计本身就是任务泛化能力的体现。In-Context 编辑最接近 Agent 行为的证据。看 scripts/readme/reproducible-768p-ref2va-request.sh 里 Ref2VA 的完整 prompt能直观感受到 H3 的编辑不是重渲染而是结构化操作。prompt 分为 subject_definitions定义视频 1 中的主体、summary[video editing audio reference audio reuse]、retention_analysis逐项标注 fully_preserved / partially_copy / reference、detailed_description 和 overall_soundscape。示例任务是让穿粉色西装的男子开口说话复用原视频的背景音乐、参考另一段音频的音色——嘴型、语种、音色、配乐分层全部一次成型。这套结构化 prompt 恰恰是 Agent 化创作的关键特征对什么该保留、什么该替换、什么只做参考的显式建模而不是整段重生成。H3 已经具备了基于已有素材做受控修改的能力。离 Agent 还有多远关键距离不在模型而在编排层的归属。README 写得很清楚H3-Context-IR 依赖多阶段工作流与多个托管模型未包含在开源发布中只提供 APIH3-Regenerate-2K 同样due to the complexity of the system, this module is not yet open-sourced。开源的只有 H3-Base 执行引擎——这恰恰是 Claude Code 模式的镜像把大脑规划与编排留在服务端闭源把手脚执行模型开源给生态。社区对这个组合的反应印证了生态外溢16 家芯片及平台首日适配SGLang、vLLM、diffusers、ComfyUI 全线接入社区随即产出了 INT4/INT8/NVFP4 量化部署、昇腾 910 NPU 双卡全链路方案端到端推理从 200 秒压到 76 秒、fal 平台的 H3 Max 托管服务等周边工程——执行引擎的可移植性已经过了压力测试。从模型公司到创作平台MiniMax 的商业路径推演把 H3 的系统设计与 MiniMax 的产品矩阵放在一起看商业路径的轮廓非常清晰。第一层开源执行引擎换生态位。H3-Base 权重完整开源含 Qwen3-VL-32B 作为 H3-Encoder 的全量权重text_encoder/config.json 中 architectures 字段为 Qwen3VLForConditionalGeneration 可佐证配合 FL2VA/model_index.json 与根目录 model_index.json 的 diffusers 模块化结构vae、audio_vae、transformer、transformer_ref、scheduler、audio_scheduler 六组件按需加载模型公司下载即部署的信任成本被压到最低。开源吸引开发者生态量化与 NPU 移植让 16GB 显存、国产算力都能跑——执行引擎铺得越广上层服务的议价权越稳。第二层闭源编排层锁商业化闭环。Context-IR 和 Regenerate-2K 只有 API/v2/h3_context_ir、/video-generation-v2-regeneration等见 README.md 与脚本中的调用方式。用户可以在本地跑出 768p 的 Base 结果但要达到官方 2K 质量必须走本地 Base 云端 IR/2K的混合工作流——这正是 README.md 推荐的 Full 2K Workflow。执行开源、编排闭环模型能力免费扩散、系统能力按 API 计费与 Claude Code 开源模型 闭源 Agent 产品的打法完全同构。第三层从 API 到创作平台的产品化。社区情报显示MiniMax 正在把 H3 从能力推向生产工具开放平台提供video-generation-v2-create系列 API 与 3000 积分的新用户体验Hailuo AI 的 WebApp/Desktop 客户端hub.minimax.io把 H3 嵌入交互式创作MiniMax Design被定位为推动 H3 从模型能力走向商业内容生产的下一步。值得注意的是 M3 模型428B 参数、1M 上下文、原生多模态与 Agentic 能力、支持 Function Call 与服务端工具链与 H3 的产品联动——M3 负责思考与调度H3 负责视听执行这已经是标准的多 Agent 分工。回到极客公园的判断与其说 MiniMax 想做视频界的 Claude Code不如说 H3 的整个设计——理解层、执行层、精修层分离上下文显式建模编排闭源、引擎开源——已经把它推上了这条路。Claude Code 证明了执行开源 编排闭环在编程领域的商业可行性而视频创作的需求密度素材、分镜、音画、修改、成品交付远高于代码编辑。H3 现在缺的只是那个把它串成端到端 Agent 工作流的视频界 Agent 运行时——而 Context-IR 的 API 化与 Design 产品线正是朝着这个缺口推进的。野心已经藏不住了剩下的只是时间问题。【免费下载链接】MiniMax-H3MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力能够出色地执行复杂的多模态指令。项目地址: https://ai.gitcode.com/MiniMax-AI/MiniMax-H3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考