MiniMax · 视频模型

MiniMax H3

MiniMax 的多模态视频模型,图文声像都能当参考,原生立体声,最高 2K,也叫 Hailuo 3。

发布 2026-07-31 · 最后核对 2026-09-28

新在哪

和 MiniMax 之前的海螺(Hailuo)01、02 系列相比:

  • 一个模型打通多种任务:以前做视频要分别用文生视频、图生视频、首尾帧、角色参考、运动参考等好几个专门模型,H3 把这些统一成一个模型,直接用自然语言描述"参考素材和目标画面的关系"就行。
  • 原生立体声:生成的视频自带同步立体声,不需要额外的配音步骤。
  • 原生多镜头:预训练阶段就包含多镜头数据,天然支持一条视频里有好几个镜头。
  • 2K 直出:靠模型自己对低分辨率结果做"上下文内重生成",而不是外挂一个超分模块,官方说这样能找回小字、细节这类传统超分找不回的内容。

适合做什么

  • 片头字幕、产品官网视频、动态海报这类需要精致收尾的短内容。
  • 广告和电商场景:官方明确把这两类列为 H3 的目标用例。
  • 需要把参考视频的运镜、参考图里的角色、参考音频的声音混在一起用的复杂创作。

提示词要点

  • 直接用一句话描述参考素材之间的关系,比如"参照视频 1 的运镜,让图片 2 里的角色对口型唱音频 3",不用套固定任务模板。
  • 纯文生视频要指定比例(不支持自适应),参考模式下比例可以留空走自适应。
  • 用方括号写运镜指令,比如 [推镜]、[拉镜],加在关键描述后面控制镜头运动。
  • 参考素材分三类各有上限:参考图最多 9 张、参考视频最多 3 段(每段 2–15 秒,合计不超过 15 秒)、参考音频最多 3 段(合计不超过 15 秒),三类素材总数不超过 12 个。
  • 拿不准复杂提示词怎么写,可以先过一遍官方的 H3-Context-IR 接口,把描述扩写成更详细的结构化提示词,再拿去生成视频。
  • 提示词最长 7000 字符,比大多数视频模型的上限宽松,可以写得更具体。
文生视频,16:9,2K,10 秒。
参照参考视频 1 的希区柯克式变焦运镜,让参考图 2 里的女孩对口型唱参考音频 3 的旋律。
[推镜] 从远景缓慢推近她的脸部特写,光线从逆光转为顺光。
背景是老式电影院的舞台,红色幕布,暖黄射灯。

已知限制

  • 官方在发布时坦言:模型的多模态理解能力还有提升空间。
  • 官方也提到,当前模型规模还限制了部分能力的发挥,一些场景下的画面细节还能再打磨。
  • 首尾帧模式和多模态参考模式不能在同一次请求里混用。

在 Nomi 里怎么用

在生成画布里新建一张视频卡,模型框里选「MiniMax H3」,再选生成方式(文生视频、首帧生视频、多参考、首尾帧),放好参考素材、写提示词,点生成。分镜表里也能给每个镜头单独选它。第一次用,先在「设置 → 模型」里接上面列出的任意一家。

出处

商业级体验,模型按原价。

macOS · Windows · AGPL-3.0 · 不用注册

下载 Nomi
选择适合这台电脑的版本

能识别系统时会直接下载;无法可靠判断 Mac 芯片时,请选择对应安装包。

macOS 第一次打开

当前 macOS 安装包未使用 Apple Developer ID 签名,也未经过 Apple 公证。请只使用本页或 Nomi GitHub 官方仓库的下载链接。

  1. 下载对应的 DMG,把 Nomi 拖到“应用程序”。
  2. 在 Finder 的“应用程序”中右键 Nomi,选择“打开”,再确认“打开”。
  3. 如果仍被拦截,打开“系统设置” → “隐私与安全”,找到 Nomi 后点击“仍要打开”。

仅当 macOS 提示 Nomi“已损坏”时:先确认安装包来自上述官方链接,再打开“终端”运行:

xattr -dr com.apple.quarantine "/Applications/Nomi.app"

不需要、也不要全局关闭 Gatekeeper。