比 Seedance 便宜七成还开源视频生成的价格战打到头了吗【免费下载链接】MiniMax-H3MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力能够出色地执行复杂的多模态指令。项目地址: https://ai.gitcode.com/MiniMax-AI/MiniMax-H32026 年 8 月 2 日MiniMax 发布 H3并在随后的 8 月 3 日开放模型权重。社区的反应几乎同步爆炸视频模型的 DS 时刻比 Seedance 便宜七成的模型宣布开源视频模型领域斩杀线——这类标题密集出现在技术媒体与开发者社群中。一方面官方 API 定价把 768P 视频拉低到每秒 0.08 美元、2K 拉低到每秒 0.13 美元另一方面33B 参数的全模态生成模型以开放权重形式落地SGLang、vLLM、diffusers、ComfyUI 首日全线适配连 RTX 3060 都被社区教程拉进了部署清单。便宜七成到底怎么算开源对 SaaS、工作室和独立创作者各意味着什么闭源厂商接下来降价、堆料还是转型这篇文章不炒情绪只做三件事把定价口径拆开算账把开源仓库里的架构与部署证据摆出来再推演这场价格战的真正落点。便宜七成怎么算的定价口径与能力对比先看官方定价表platform.minimax.io 的价格文档当前版本模型 / 接口分辨率计费规则单价MiniMax-H3768P按秒计费0.08 美元/秒MiniMax-H32K按秒计费0.13 美元/秒MiniMax-H3-Max480P按秒计费0.05 美元/秒MiniMax-H3-Max768P按秒计费0.08 美元/秒MiniMax-H3-Regeneration768P → 2K按再生输出秒数计费0.05 美元/秒换算成一条片的口径一条 10 秒 768P 视频约 0.8 美元一条 15 秒 2K 视频约 1.95 美元。便宜七成的说法源自媒体对 Seedance 等竞品价格的对比报道——它是相对价格口径而不是绝对数字。要严谨地理解这个口径得拆三笔账。第一笔单价不是全部输入素材单独计费。官方定价中参考图片前 5 张免费、之后每张 0.04 美元参考视频按输入时长和输出分辨率双重计费768P 输出 0.08 美元/秒、2K 输出 0.13 美元/秒参考音频免费。对纯文生视频用户便宜七成基本成立对重度依赖参考素材的图生视频、视频编辑用户综合成本要按素材量重新算。第二笔2K 是两段式链路。H3 的开源版只能本地出 768P2K 要走官方 API先用 H3-Context-IR 做全模态指令理解输入 0.90 美元/百万 token、输出 3.60 美元/百万 token再生成 768P最后以 0.05 美元/秒的价格再生为 2K且原始任务的输入素材还要再计费一次。也就是说2K 很便宜的前提是把整条流水线成本算进去。第三笔能力对标要放回同一个货架。这里必须强调 H3 卖的不是裸视频它原生生成 32 kHz 立体声音轨支持 4–15 秒时长、24 FPS、21:9 到 9:16 的宽幅比例稳定支持 11 种语言输入侧是全模态的——文本、图像、参考视频、参考音频可以任意组合最多 9 张图、3 段参考视频、3 段参考音频、混合总量 12 个文件。仓库的 README.md 明确把两种任务化 checkpoint 拆开FL2VA 支持文生视频与首/尾帧生视频Ref2VA 支持多模态参考生视频。用纯文生视频的价格去比较一个带原生立体声 全模态参考的系统口径上就已经吃亏了。所以便宜七成更准确的表述是在同等输出规格分辨率、时长、音轨下H3 的单秒单价显著低于头部闭源产品但如果把输入素材、2K 再生、上下文理解这三项叠加总拥有成本需要按场景逐条核算。官方把 Context-IR 和 Regenerate-2K 留在 API 侧、只开源 H3-Base本身就是这个定价体系的一部分——后面会展开。开源价格战对 SaaS、工作室、独立创作者的分层冲击H3 的开源动作不是放出权重这么简单。仓库里是完整的推理闭环每个任务族 checkpointFL2VA、Ref2VA自包含 processor、tokenizer、text_encoder、transformer、video_vae、audio_vae 六个部件配合 model_index.json 即可被 diffusers 直接加载同时提供 SGLang、vLLM、ComfyUI 的部署路线并给出三条可复现的 768P 请求脚本如 scripts/readme/reproducible-768p-t2va-request.sh一条 curl 就完成从提交任务到下载成片的完整链路。对三类参与者的冲击是完全分层的。SaaS 与 API 转售商成本基准被重定义。开源权重把视频生成的成本锚点从API 单价拉到机时成本。仓库给出的 SGLang 部署示例是 4 卡起步README.md 中--num-gpus 4 --ulysses-degree 4这还不是消费级方案但对已有 GPU 池的云厂商和工具平台来说边际成本骤降意味着定价体系必须重构。MiniMax 自己就是这场重构的发起者开源 H3-Base 抢生态位把 Context-IR托管式预处理系统和 2K 再生留在 API 侧形成增值层README 甚至明说强烈建议在生成流水线中接入 H3-Context-IR。这是典型的开源钩子 托管增值双轨打法。工作室与 MCN本地 768P 零边际成本2K 按需购买。社区生态的响应速度最能说明问题。CSDN 上围绕 H3 的教程在发布后密集出现ComfyUI 集成部署、图像修复工作流、LoRA 微调、量化格式选型FP16/FP8/INT4/FP4一应俱全有社区实测称在 RTX 3060 上 8 步采样即可出图较 SDXL 20 步流程提速约 2.5 倍。对需要批量产素材的工作室本地跑 768P 的边际成本约等于电费2K 需求再按 0.05 美元/秒的再生价格按需购买预算结构从每条素材都花钱变成低成本试错 精选成片升级。独立创作者门槛从有没有预算变成有没有显卡。头条社区里12GB/16GB/24GB 跑 MiniMax H3模型怎么选这类内容能出现本身就说明消费级显卡已经进入可跑区间。配合量化权重与 768P 本地链路独立创作者的起跑线被拉平到与工作室同一套模型上差距重新回到提示词工程和审美本身。但必须指出免费的边界。H3 的许可证是 MiniMax H3 Community Licensedocs/QA-about-License.md 有官方问答不是 Apache 2.0开放权重当前排除欧盟、英国、韩国与美国等地区API 全球可用受限地区可申请授权年营收超过 2000 万美元的商业产品需要另行书面授权更重要的是第 V.3 条——不得用 H3 或其输出去改进任何其他 AI 模型。也就是说这场价格战是有条件开放的价格战个人、工作室、中小 SaaS 可以低成本入场大厂和模型公司则被条款挡在门外。社区情报中团队在 Reddit 回应2K 要开源、图像模型在路上、Apache 2.0 也在考虑可以看作对许可证争议的回应与后续版本的预告。架构层面也值得给工程读者划几个重点来自 FL2VA/transformer/config.json 与 FL2VA/video_vae/config.jsonH3-Omni-Transformer50 层、hidden size 5376、56 头注意力的单流稠密 Transformer总参数量约 33B其中约 13B 落在 AdaLN 相关分支——推理时调制输出可预计算缓存这 13B 不必加载显著降低部署显存门槛H3-VisualVAE时间因果视频自编码器空间压缩 16×、时间压缩 4×、24 个 latent 通道f16t4d24patch 化后进入 Transformer 的有效空间降采样达 32×解码端用 ViT 降低成本H3-AudioVAE左右声道共用编解码器独立处理再重组32 kHz 音频压成 40 Hz 的 latent token 流这是原生立体声的技术底座文本侧由 Qwen3-VL-32B 的第 50 层隐藏状态驱动tokenizer 需使用仓库自带配置。值得注意的还有一处留白H3 原生支持稀疏注意力训练与推理但首发开源版只提供全注意力推理稀疏注意力实现将后续发布。这说明开源是分批兑现的而不是一次性全部交出。闭源厂商的三种应对降价、堆料、还是转型当单秒价格被开源权重钉死闭源厂商的牌面其实只剩三张。应对一降价。最直接也最不解决根本问题。H3 的历史版本Hailuo 2.3/2.3-Fast官方 Legacy 定价表里768P 10 秒视频约 0.32–0.56 美元如今 H3 以 0.08 美元/秒的单价入场再叠加开源权重把自部署成本打到边际成本单纯跟进 API 降价无法覆盖客户自建集群的替代选项。价格战的终点不是大家都便宜而是便宜变成默认值——当免费权重存在时任何按秒收费的裸 API 都要回答一个问题我的增量价值在哪。应对二堆料。在分辨率、时长、一致性和控制粒度上继续拉开差距。H3 已经站上 2K 15 秒 原生立体声 全模态参考的档位后来者要超越得在更长记忆多镜头叙事一致性、更强编辑控制对象级、光影级、声音级操控或更短的端到端延迟上找新维度。堆料的本质是把竞争从能不能生成推向生成得多可控。应对三转型。从卖算力转向卖系统、卖工作流、卖垂直场景方案。H3 自己的产品演进就是这个方向8 月下旬 MiniMax Design 上线官方口径是推动 H3 从模型能力走向商业内容生产把生成能力嵌入设计、广告、电商的完整内容链路。H3 的 Context-IR 不开源也是同一逻辑——它把多模态指令理解做成了托管服务这正是闭源厂商可以防御的护城河模型层开源无妨系统层编排、理解、护栏、合规留在手里。回到标题的问题价格战打到头了吗没有但它换了战场。开源把每秒钟多少钱从战略变量变成了常量竞争重心随之转移到三个地方系统集成的完整度Context-IR 这类编排层、质量与合规护栏许可证条款、内容审核、地区合规、垂直场景的落地深度从模型到成片的全链路。对开发者而言真正的红利不是省下的那七成价格而是 33B 全模态权重的可研究、可微调、可改造——这是任何 API 都买不到的。【免费下载链接】MiniMax-H3MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力能够出色地执行复杂的多模态指令。项目地址: https://ai.gitcode.com/MiniMax-AI/MiniMax-H3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考