新在哪
- 三种生成模式收进一份接口:纯文字(text)、首尾帧关键帧(keyframe)、图/音/视频多参考(reference)三选一,不用切换不同产品。
- 参考素材类型更全:一次最多带 8 张图、1 段 2–12 秒的视频、3 段音频,可以分别当内容、风格、节奏或运镜的参考。
- 首尾帧单独成一种模式:只给首帧、只给尾帧,或者首尾帧一起给,专门控制画面的开头和结尾构图。
- 画幅选择更多:21:9、16:9、4:3、1:1、3:4、9:16 六种比例,横屏、竖屏、方图都能直接出;清晰度也分了好几档(Nomi 里能选哪几档见上面的能力表)。
适合做什么
- 从一句话直接生成有主体运动、镜头运动的短视频。
- 用首尾帧控制一段视频"从哪开始、到哪结束",中间过程交给模型补。
- 用已有图片/音频/视频当参考,延续画面风格、节奏或运镜,而不是从零生成。
提示词要点
- 按顺序交代六件事:Agnes AI 建议的顺序是主体/场景 → 动作/变化 → 镜头语言 → 视觉风格 → 声音/节奏 → 需要保持一致的地方。
- 参考模式下用占位符点名素材:提示词里用
<Picture N>、<Audio N>、<Video N>分别指代第几张图/第几段音频/第几段视频,说清楚每个素材具体管什么。 - 时长按秒数字符串传:范围是 4–12 秒(字符串形式,比如 "8"),不填默认 5 秒。
- 模式之间不能混用字段:text 模式不能带首尾帧或参考素材,keyframe 模式不能再加参考图/音/视频,三选一,字段传错会直接报错。
- 一次只出一版:张数参数固定是 1,想要多个版本就多发几次请求,而不是一次要一批。
镜头语言:手持跟拍,缓慢推进。主体/场景:一位骑手在雨夜城市街道穿行,霓虹灯反光在积水路面上。
动作/变化:从远景骑入,逐渐拉近到侧脸特写。视觉风格:赛博朋克色调,高对比度。
声音/节奏:引擎低鸣与雨声,鼓点式的背景节奏。保持:整段色调统一,不要出现镜头抖动过度的画面。
已知限制
- text / keyframe / reference 三种模式的字段互斥,同一次请求不能混用(比如 keyframe 模式不能再加参考图)。
- 一次生成只能出 1 个版本(
n固定为 1),没有批量出片的张数控制。 - 时长固定在 4–12 秒区间,超出范围会被拒绝;更快的 2.5 Flash 版本只支持 720P、不接受视频参考,其余能力和 2.5 一致。
在 Nomi 里怎么用
在生成画布里新建一张视频卡,模型框里选「Agnes Video 2.5」,再选生成方式(文生视频、首尾帧、多参考),放好参考素材、写提示词,点生成。分镜表里也能给每个镜头单独选它。第一次用,先在「设置 → 模型」里接上面列出的任意一家。





