xAI · 视频模型

Grok Imagine 1.5

xAI 的视频模型,文生视频、图生视频都支持,原生 1080p、最长 15 秒,一次最多带 7 个参考图像或语音。

发布 2026-06-03 · 最后核对 2026-09-28

新在哪

  • 加上了纯文字生成视频:6 月刚上线时,1.5 只能"给一张起始图 + 一段文字"做图生视频;7 月底的更新加了文生视频,不用起始图,直接写文字描述镜头就能生成。
  • 画质提到原生 1080p:6 月的预览版和正式上线版都封顶 720p,7 月底这次更新给文生视频和图生视频都加上了原生 1080p。
  • 参考素材升级成图像 + 语音,一次最多 7 个:一张参考图能锁定一张脸、一件产品或一个场景;配上语音参考,声音也能保持一致。
  • 生成更快,动作和物理更稳:官方数据是 6 秒、720p 的片子生成时间从 40 多秒压到大约 25 秒;官方还说这次动作、物理表现和音效都比之前更好。

适合做什么

  • 要角色、产品从头到尾长一个样的片子:把人物图、产品图和语音参考一起交给它,官方举的例子是虚拟试穿、产品植入、角色固定的连续故事。
  • 手头没有起始图,只想快速出个概念小样:一段文字写清楚镜头和节奏就能直接生成,不用先准备一张参考图。
  • 已经有一条视频,只想改一处或接着往后延:用局部编辑改细节(换个配饰、改个颜色),或者从最后一帧继续往后编,不用整条重新生成。

提示词要点

  • 先说镜头怎么走、节奏怎么分、声音怎么配:官方给的建议就是这三件事——运镜、节奏、声音设计——写清楚了效果更稳。
  • 写成一整段电影感描述,别堆关键词:官方文档给的示例是一整句话把主体、动作、场景、氛围串起来,比如"一枚水晶动力火箭从火星红色沙丘升空,背景里古代外星遗迹渐渐亮起"这种写法。
  • 用参考图/参考语音时按编号点名:提示词里用 <IMAGE_0>、<IMAGE_1>、<AUDIO_0> 这样的标签对应到第几张参考图、第几段参考语音,模型才知道谁是谁。
  • 想要固定画幅就明说:图生视频默认沿用参考图自己的比例,想要别的画幅(比如竖屏 9:16)要在参数里单独指定,不然会被参考图带偏。
  • 声音默认是开的,把想要的音效/对白写进去:画面和音效、环境声、对白是同一步生成的,写清楚"雨声""关门声""她说了什么"会比不写效果好;不想要声音也可以单独关掉。
  • 提示词别堆太复杂:官方文档提到提示词复杂度会影响处理时间,非必要的形容词、设定越少,出片越快。
竖屏 9:16。<IMAGE_0> 里的女孩全程保持同一张脸、同一件红色卫衣。
清晨的巷子里挂满灯笼,她小跑穿过窄街,镜头跟着她缓慢横移,转过墙角时她回头笑了一下。
声音:脚步声、远处的鞭炮声、灯笼晃动的轻响。不要换脸,不要出现多余的人。

已知限制

  • 编辑和续写会被原视频框住:用局部编辑或视频延伸时,时长、画幅、分辨率都跟着输入视频走,输出最高只到 720p,到不了这次新加的 1080p。
  • 自己的声音没法直接克隆:参考语音目前只能从官方给的预设声音里选,一次最多 3 个;想用自己录的音频做声音参照,官方文档写的是仅对"可信任合作伙伴"开放、需要申请。
  • 参考生成的时间点比较粗:一次参考生成最多用 4 个关键帧,时间点只能对齐到 1/3 秒的格子,卡不了更精细的时机。

在 Nomi 里怎么用

在生成画布里新建一张视频卡,模型框里选「Grok Imagine 1.5」,再选生成方式(文生视频、首帧生视频),放好参考素材、写提示词,点生成。分镜表里也能给每个镜头单独选它。第一次用,先在「设置 → 模型」里接上面列出的任意一家。

出处

商业级体验,模型按原价。

macOS · Windows · AGPL-3.0 · 不用注册

下载 Nomi
选择适合这台电脑的版本

能识别系统时会直接下载;无法可靠判断 Mac 芯片时,请选择对应安装包。

macOS 第一次打开

当前 macOS 安装包未使用 Apple Developer ID 签名,也未经过 Apple 公证。请只使用本页或 Nomi GitHub 官方仓库的下载链接。

  1. 下载对应的 DMG,把 Nomi 拖到“应用程序”。
  2. 在 Finder 的“应用程序”中右键 Nomi,选择“打开”,再确认“打开”。
  3. 如果仍被拦截,打开“系统设置” → “隐私与安全”,找到 Nomi 后点击“仍要打开”。

仅当 macOS 提示 Nomi“已损坏”时:先确认安装包来自上述官方链接,再打开“终端”运行:

xattr -dr com.apple.quarantine "/Applications/Nomi.app"

不需要、也不要全局关闭 Gatekeeper。