新在哪
- 加上了纯文字生成视频:6 月刚上线时,1.5 只能"给一张起始图 + 一段文字"做图生视频;7 月底的更新加了文生视频,不用起始图,直接写文字描述镜头就能生成。
- 画质提到原生 1080p:6 月的预览版和正式上线版都封顶 720p,7 月底这次更新给文生视频和图生视频都加上了原生 1080p。
- 参考素材升级成图像 + 语音,一次最多 7 个:一张参考图能锁定一张脸、一件产品或一个场景;配上语音参考,声音也能保持一致。
- 生成更快,动作和物理更稳:官方数据是 6 秒、720p 的片子生成时间从 40 多秒压到大约 25 秒;官方还说这次动作、物理表现和音效都比之前更好。
适合做什么
- 要角色、产品从头到尾长一个样的片子:把人物图、产品图和语音参考一起交给它,官方举的例子是虚拟试穿、产品植入、角色固定的连续故事。
- 手头没有起始图,只想快速出个概念小样:一段文字写清楚镜头和节奏就能直接生成,不用先准备一张参考图。
- 已经有一条视频,只想改一处或接着往后延:用局部编辑改细节(换个配饰、改个颜色),或者从最后一帧继续往后编,不用整条重新生成。
提示词要点
- 先说镜头怎么走、节奏怎么分、声音怎么配:官方给的建议就是这三件事——运镜、节奏、声音设计——写清楚了效果更稳。
- 写成一整段电影感描述,别堆关键词:官方文档给的示例是一整句话把主体、动作、场景、氛围串起来,比如"一枚水晶动力火箭从火星红色沙丘升空,背景里古代外星遗迹渐渐亮起"这种写法。
- 用参考图/参考语音时按编号点名:提示词里用
<IMAGE_0>、<IMAGE_1>、<AUDIO_0>这样的标签对应到第几张参考图、第几段参考语音,模型才知道谁是谁。 - 想要固定画幅就明说:图生视频默认沿用参考图自己的比例,想要别的画幅(比如竖屏 9:16)要在参数里单独指定,不然会被参考图带偏。
- 声音默认是开的,把想要的音效/对白写进去:画面和音效、环境声、对白是同一步生成的,写清楚"雨声""关门声""她说了什么"会比不写效果好;不想要声音也可以单独关掉。
- 提示词别堆太复杂:官方文档提到提示词复杂度会影响处理时间,非必要的形容词、设定越少,出片越快。
竖屏 9:16。<IMAGE_0> 里的女孩全程保持同一张脸、同一件红色卫衣。
清晨的巷子里挂满灯笼,她小跑穿过窄街,镜头跟着她缓慢横移,转过墙角时她回头笑了一下。
声音:脚步声、远处的鞭炮声、灯笼晃动的轻响。不要换脸,不要出现多余的人。
已知限制
- 编辑和续写会被原视频框住:用局部编辑或视频延伸时,时长、画幅、分辨率都跟着输入视频走,输出最高只到 720p,到不了这次新加的 1080p。
- 自己的声音没法直接克隆:参考语音目前只能从官方给的预设声音里选,一次最多 3 个;想用自己录的音频做声音参照,官方文档写的是仅对"可信任合作伙伴"开放、需要申请。
- 参考生成的时间点比较粗:一次参考生成最多用 4 个关键帧,时间点只能对齐到 1/3 秒的格子,卡不了更精细的时机。
在 Nomi 里怎么用
在生成画布里新建一张视频卡,模型框里选「Grok Imagine 1.5」,再选生成方式(文生视频、首帧生视频),放好参考素材、写提示词,点生成。分镜表里也能给每个镜头单独选它。第一次用,先在「设置 → 模型」里接上面列出的任意一家。





