新在哪
和 MiniMax 之前的海螺(Hailuo)01、02 系列相比:
- 一个模型打通多种任务:以前做视频要分别用文生视频、图生视频、首尾帧、角色参考、运动参考等好几个专门模型,H3 把这些统一成一个模型,直接用自然语言描述"参考素材和目标画面的关系"就行。
- 原生立体声:生成的视频自带同步立体声,不需要额外的配音步骤。
- 原生多镜头:预训练阶段就包含多镜头数据,天然支持一条视频里有好几个镜头。
- 2K 直出:靠模型自己对低分辨率结果做"上下文内重生成",而不是外挂一个超分模块,官方说这样能找回小字、细节这类传统超分找不回的内容。
适合做什么
- 片头字幕、产品官网视频、动态海报这类需要精致收尾的短内容。
- 广告和电商场景:官方明确把这两类列为 H3 的目标用例。
- 需要把参考视频的运镜、参考图里的角色、参考音频的声音混在一起用的复杂创作。
提示词要点
- 直接用一句话描述参考素材之间的关系,比如"参照视频 1 的运镜,让图片 2 里的角色对口型唱音频 3",不用套固定任务模板。
- 纯文生视频要指定比例(不支持自适应),参考模式下比例可以留空走自适应。
- 用方括号写运镜指令,比如 [推镜]、[拉镜],加在关键描述后面控制镜头运动。
- 参考素材分三类各有上限:参考图最多 9 张、参考视频最多 3 段(每段 2–15 秒,合计不超过 15 秒)、参考音频最多 3 段(合计不超过 15 秒),三类素材总数不超过 12 个。
- 拿不准复杂提示词怎么写,可以先过一遍官方的 H3-Context-IR 接口,把描述扩写成更详细的结构化提示词,再拿去生成视频。
- 提示词最长 7000 字符,比大多数视频模型的上限宽松,可以写得更具体。
文生视频,16:9,2K,10 秒。
参照参考视频 1 的希区柯克式变焦运镜,让参考图 2 里的女孩对口型唱参考音频 3 的旋律。
[推镜] 从远景缓慢推近她的脸部特写,光线从逆光转为顺光。
背景是老式电影院的舞台,红色幕布,暖黄射灯。
已知限制
- 官方在发布时坦言:模型的多模态理解能力还有提升空间。
- 官方也提到,当前模型规模还限制了部分能力的发挥,一些场景下的画面细节还能再打磨。
- 首尾帧模式和多模态参考模式不能在同一次请求里混用。
在 Nomi 里怎么用
在生成画布里新建一张视频卡,模型框里选「MiniMax H3」,再选生成方式(文生视频、首帧生视频、多参考、首尾帧),放好参考素材、写提示词,点生成。分镜表里也能给每个镜头单独选它。第一次用,先在「设置 → 模型」里接上面列出的任意一家。





