国产开源视频模型终于能用了:MiniMax H3 上手指南,8 月 3 日开源,2K 直出 0.8 元/秒

如果你最近刷到任何关于 AI 视频的新闻,八成会看到”价格又创新低”或者”开源阵营又添一员”这两条主线。7 月 31 日,这两条主线同时被一款叫 MiniMax H3 的模型撞在了一起。

稀宇科技(MiniMax)正式发布通用多模态视频模型 H3,并宣布北京时间 8 月 3 日 0 点在魔搭社区(ModelScope)正式开源权重。它是 MiniMax 推出的首款开源多模态生成模型,之前这家公司在文本侧已经连开 M1/M2/M2.5/M2.7/M3 五代,但视频/图像/声音这条线一直只通过 Hailuo、Speech、Music 等闭源产品对外。H3 这次的”开源”和”多模态统一”两件事叠在一起,让它在 7 月 31 日的国内 AI 新闻里迅速冒头。

我在 H3 发布当晚就把它官网、知乎专栏、IT 之家报道澎湃新闻深度分析翻了一遍,又顺手查了 ComfyUI 核心开发者的 Reddit 帖子。结论是:H3 不是又一个”参数又多了多少”的发布,而是一个对普通人、创作者、企业、开发者都有具体影响的发布。

如果你已经在用 腾讯混元 AngelSpec 这种推理加速工具,或在 阿里千问 AI 平台 上调用过千问、Kimi、DeepSeek,那对”国内模型把价格卷下来”这件事应该已经不陌生。H3 这次卷的是视频赛道。

这篇文章不打算重复介绍 H3 的”领先性”和”震撼性”,只想讲清楚几件事:H3 到底能做什么、不能做什么、谁该用、怎么用、价格到底便宜到什么程度,以及 8 月 3 日开源后第一时间能去哪下载。


先把 H3 看明白:不是视频模型,是”全模态统一”模型

H3 的官方定义是”通用多模态视频模型”,但它不是只做视频。它有四个输入端:文本、图片、音频、视频;有两个输出端:视频、原生双声道音轨。它把”理解”和”生成”放在同一个上下文里完成,而不是先做文本理解、再去做画面生成、最后再补音频这种流水线式拼接。

这种设计带来一个很直接的结果:H3 在 Artificial Analysis 的视频编辑榜单上拿到了 1130 分,位列全球第一;在有声文生视频榜单上以 1242 分排第二,仅比 Gemini Omni Flash 低 4 分,但比 Seedance 2.0 高。换句话说,它在”能不能用”这件事上,已经跨过了生产门槛。

但榜单分数再高,也得落到实操上才有用。H3 的几个核心参数先列一下:

项目规格
输入模态文本、图片、音频、视频
输出模态视频 + 原生双声道音频
最高分辨率2K(默认输出 2K)
单次生成时长最长 15 秒
商业用途允许
关键架构Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration
视频生成价格0.8 元/秒(2K),约为主流旗舰模型 1/3

几个值得展开说说的点:

  • 原生双声道。以前的”AI 视频 + AI 配音”方案,嘴型对不上、节奏对不上、情绪对不上是常态。H3 把音频也放在多模态上下文里生成,理论上不会出现视频已经播完、配音还没说完的尴尬。
  • 2K 是默认。不是 720P 起步、付额外费用才能开 2K,是默认就给 2K。官方在 IT 之家采访里也明确:768P 分辨率下,定价是主流 720P 模型的 1/2。
  • 支持多轮延长。15 秒只是单次最长,不是死上限。H3 支持在已有素材基础上做多轮延长,类似 Sora 和 Veo 3 的”Extend”功能。

H3 凭什么便宜三分之二

0.8 元/秒这个数字之所以重要,是因为它的对比对象不是别的国产闭源模型,而是当前市面上的视频生成旗舰。

按照官方口径和 IT 之家报道,H3 2K 视频的生成价格约为主流旗舰模型的 1/3,768P 视频价格是主流 720P 模型的 1/2。翻译成场景:一个 10 秒的 2K 视频,H3 大约 8 元,而用一些闭源旗舰做同样规格可能要 25-30 元甚至更多。

这件事能成立,不是稀宇科技突然学会了”亏本卖”,而是有几个具体的技术优化:

  1. 高压缩 Tokenizer:H3-VAE 把视频帧压缩到更少的 Token 里,等于让模型每次”看”更少的内容就能生成视频。这是从底层降低单次推理成本。
  2. 异构训练 + 负载均衡:不同任务(文生视频、图生视频、视频延长、多模态编辑)的计算负载差别很大,传统做法是按最重任务分配资源。H3-Omni Transformer 在异构硬件上做动态调整,训练吞吐量提升接近 30%。
  3. H3 团队主动放弃了前一代 hailuo-02 架构。这条在 IT 之家报道里被特别提到:团队为了”简洁架构 + 通用性”主动放弃了之前花大力气做的专用架构。这种”自我颠覆”在视频生成领域并不常见。

省下来的成本,最终落到调用方头上。对个人创作者和企业内容团队来说,这等同于把”AI 视频生成”从一次性项目变成可批量复用的工具。


四种使用入口,开源前先能试

虽然 8 月 3 日才正式开源权重,但 H3 在 7 月 31 日发布当天,已经有四个可用的入口:

1. MiniMax 官方 API(已上线)

最直接的入口。注册稀宇科技开放平台账号 → 创建 API Key → 调用 image2video / text2video 接口 → 按 0.8 元/秒结算。

需要注意的是:H3 的 API 和 MiniMax 之前的 Hailuo 视频 API 是分开的,老接口调用不到 H3 的能力。要在 API 文档里找”H3″对应的端点。

2. Vercel AI Gateway(已集成)

Vercel 在 H3 发布当天就把它接入了自家的 AI Gateway。如果你已经在用 Vercel 部署前端项目,可以直接在 Vercel 控制台里加一行环境变量,把 H3 接入到工作流里。

这条路对前端开发者特别友好,省掉了单独申请账号、配置跨境支付、调试网络的过程。

3. SeaArt(已上线)

SeaArt 在 7 月 31 日同步宣布上线 H3,国内用户可以直接打开 SeaArt,在视频生成通道里选 H3 模型,输入提示词就能用。

对没有 API 经验、只是想”先试一下”的创作者,SeaArt 是目前最省事的入口。

4. ComfyUI 节点(首日支持)

这是 H3 开源消息里最让本地玩家兴奋的一条:ComfyUI 核心开发者 comfyanonymous 在 Reddit 上确认,团队已经提前拿到 H3 的权重和代码,将提供首日支持。经过社区优化,H3 甚至可以在 RTX 3060 上运行,只是出图速度会慢一些。

更关键的是,社区拿到的是与 API 一致的权重,不是缩水版。这意味着开源版本的能力和闭源 API 是对齐的,不会出现”开源不如闭源”的老问题。

如果你还不熟 ComfyUI,可以把它理解成”AI 图像/视频的 node 式工作流工具”,跟 Midjourney 的 Discord 机器人完全是两种东西。节点拖一拖,就能拼出”文生视频 → 视频延长 → 加音频 → 加字幕”的完整流程。


8 月 3 日开源后,怎么用 ComfyUI 跑起来

虽然 8 月 3 日权重才正式发布,但准备工作今天就能做:

  1. 更新 ComfyUI 到最新版。H3 的节点会作为官方插件提供,老版本识别不了。
  2. 确认显卡。官方说 RTX 3060 也能跑,但速度会慢。想要流畅体验 2K 15 秒视频,至少需要 12GB 显存的卡(RTX 3060 12GB / RTX 4070 / RTX 5070 都行)。
  3. 下载模型权重。8 月 3 日 0 点在魔搭社区(ModelScope)和 Hugging Face 双平台发布,关注 MiniMax 官方账号即可第一时间拿到下载链接。
  4. 准备工作流模板。ComfyUI 的工作流是 JSON 文件,H3 的官方工作流会同步开源,第一次跑建议直接用官方模板。

如果你之前没接触过本地 AI 视频,可以先看 本地部署大模型完全指南 熟悉 Ollama、LM Studio 这些工具的本地部署思路,再来跑 H3 会顺很多。


跟 Seedance 2.5、HappyOyster、Qwen-Image-3.0 怎么选

最近一个月,国内视频/多模态生成赛道肉眼可见地卷起来了。把已经报道过的几款产品放在一起对比,能更清楚 H3 的定位:

  • 字节 Seedance 2.5:闭源,单次 30 秒、单次 30 张参考图、多轮延长和局部重绘,主打”工业级长视频”。
  • 阿里 HappyOyster 1.0:闭源,专注”世界模型”和互动漫游,AI 视频的”游戏化”方向。
  • 阿里 Qwen-Image-3.0:图像模型,覆盖教育课件、UI 原型、12 国语言文字渲染等”生产力图像”场景。
  • Meta Muse Image:图像模型,文字渲染和 @好友 Instagram 生成是亮点。
  • MiniMax H3:开源 + 多模态统一,2K 默认 + 原生双声道,主打”普惠生产力视频”。

选型建议(避坑版):

你想要
一次生成 30 秒以上的长视频,工业流水线Seedance 2.5
进入 AI 生成的”可探索世界”做互动短剧HappyOyster
画图,文字排版、UI 草图、多语言素材Qwen-Image-3.0
发 Instagram、WhatsApp 创意图,跟朋友同框Muse Image
2K 短视频 + 配音一键出 + 想自己跑/改权重H3

简单说:如果你只是想”用”,闭源旗舰都已经够好;如果你想”自己跑、改权重、接入自己工作流”,H3 是目前唯一靠谱的开源选项


普通人和企业能立刻做的事

H3 的发布对不同人群的实际影响差别很大。

普通创作者

如果你是 B 站 UP 主、抖音/视频号博主、小红书图文创作者,0.8 元/秒 的价格意味着同样的预算可以做 3 倍体量的视频。一个 1 分钟的口播视频,按 0.8 元/秒算,60 秒就是 48 元——比请真人配音便宜得多。

建议:

  • 先在 SeaArt 上免费试用几次,熟悉 H3 的提示词风格;
  • 商用项目等开源权重发布后,通过 ComfyUI 跑本地,省去 API 调用费用;
  • 关注 MiniMax 官方的提示词模板,H3 对动作、镜头、风格的控制比一般视频模型更精细,提示词结构化能显著提升成片质量。

独立开发者和工作室

开源 + ComfyUI 节点意味着 H3 可以被嵌入到现有工具链。几个值得提前想的场景:

  • SaaS 工具集成:通过 Vercel AI Gateway 一行配置接入;
  • 批量内容工厂:用 ComfyUI 跑工作流,把”选题 → 文案 → 配音 → 配图 → 视频”一条龙自动化;
  • 客户定制项目:开源权重允许私有部署,对于有合规要求的客户(金融、医疗、政企)这是关键卖点。

企业团队

对企业的最大价值是可控 + 可审计。闭源模型每次升级都可能改变行为,开源权重 + 私有部署意味着行为可锁死、可回滚、可追溯。

建议准备的工作:

  • 让算法/工程团队跟进 8 月 3 日开源发布的权重,先在测试环境跑通;
  • 评估当前 GPU 库存,2K 视频生成对显存要求不低,至少准备 12GB 显存卡一张;
  • 对接稀宇科技商务,了解企业级 API 限速、私有化部署、技术支持的具体政策。

几个还不太确定的点

H3 的发布会信息很完整,但有些细节官方还没完全披露,使用前最好心里有数:

  1. 开源协议。稀宇科技在 M3 发布时明确说”该模型是同级别中唯一开源的”,但 H3 这次的开源协议(Apache 2.0 / MIT / 自定义)还没官方公布。商业使用前需要看 LICENSE 文件。
  2. 多模态理解的边界。H3 的输入端支持文本、图片、音频、视频,但具体每种输入的最大长度、最长时长、文件格式限制还没详细说明。等权重发布后看 README 才准确。
  3. 中文 vs 英文提示词效果。从过去视频生成模型的惯例看,中文提示词通常需要翻译成英文才能拿到最佳效果。H3 是否在中文上有专门优化,官方没明确表态。
  4. 二次开发门槛。H3-Omni Transformer 是新架构,要在它基础上做 LoRA 微调、SFT 训练,需要等社区出训练脚本。这一步可能要到开源后几周才成熟。

这些都不影响”H3 现在就能用”这个判断,但会决定你把它用多深。


写在最后

H3 的发布之所以让人兴奋,不是因为”参数又大了多少”,而是因为多模态生成第一次有了”普惠”的可能性。0.8 元/秒、首日 ComfyUI 支持、官方 API 当天可用、企业可私有部署,这几条凑齐之后,AI 视频生成才真正从”少数大公司能玩得起”变成”任何人都能上手”。

如果你只想试一下,现在就可以去 SeaArt;如果你是开发者,8 月 3 日 0 点盯住魔搭社区和 Hugging Face 的 MiniMax 官方账号;如果你是企业,先让团队跑通 ComfyUI 的官方工作流,再谈私有化部署。

过去两年,AI 视频生成的故事是”大公司砸参数”。H3 的故事是“把已经能用的能力,价格砍到普通人也能用”。这两条路哪个更重要,看完这篇你心里应该有数了。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • 国产开源视频模型终于能用了:MiniMax H3 上手指南,8 月 3 日开源,2K 直出 0.8 元/秒

    如果你最近刷到任何关于 AI 视频的新闻,八成会看到”价格又创新低”或者”开源阵营又添一员”这两条主线。7 月 31 日,这两条主线同时被一款叫 Min…

  • 把大模型推理速度翻倍:腾讯混元开源 AngelSpec,教你部署投机解码

    大模型推理贵、慢、卡,这件事困扰整个行业太久了。 7 月 30 日,腾讯混元团队甩出一个新开源项目:AngelSpec。这是一个端到端的投机解码(Speculative Decoding)训练与部署框…

  • OpenAI 也终于开源了:gpt-oss-120b 和 gpt-oss-20b 上手指南,从下载到本地部署一篇讲清楚

    7 月 29 日凌晨,OpenAI 把两枚模型权重扔到了 Hugging Face 上:gpt-oss-120b 和 gpt-oss-20b。Apache 2.0 协议,可商用、可改、可再分发。这是 …

  • Kimi K3 权重真的开源了:2.8T 模型怎么下载、部署和接入,一篇讲清楚

    7 月 27 日深夜,月之暗面把 Kimi K3 的模型权重、技术报告,以及支撑它训练的三项 Infra——MoonEP、FlashKDA、AgentEnv——一次性全扔了出来。 这不是那种「只发论文…

暗夜独行