新在哪
- 原生 30 秒时长:一次生成最长能到 30 秒,官方说这样能讲更完整的故事、创作自由度更大,还支持"智能时长"——不指定具体秒数,让模型自己判断。
- 全能参考,一次最多 20 个素材:图片、视频、音频加起来最多能传 20 个,还能解析复杂文档和网页内容作参考。
- 像素级一致性:官方说能精准还原参考细节,面向要交付的生产场景提升确定性,不是"大致像"而是"细节对得上"。
- 沉浸式视听体验和精准视频编辑:官方强调这一版在真实感、画面质感、音效上全面提升,还支持用指令或参考对已有视频做精准编辑。
适合做什么
- 需要讲完整故事的稍长短片:原生 30 秒,不用像有些模型那样分段再拼接。
- 品牌、产品类素材,需要参考细节被精准还原的场景。
- 已经有一段视频,想用文字指令或参考素材做局部修改,而不是整条重新生成。
提示词要点
- 提示词上限很宽松,最多 2 万字符,可以把场景、人物、运镜写得很具体。
- 首尾帧模式和全能参考模式不能同时用:选了首帧/尾帧就不能再加参考图、参考视频、参考音频,两条路二选一。
- 参考视频、参考音频按段算时长:每段 1–15 秒,加上最终输出的时长,合计不能超过 30 秒。
- 拿不准要什么比例就别选,用默认的自适应:比例会根据参考素材自动判断,手动选反而可能和素材对不上。
- 要不要声音提前想好:音频默认是开启的,不需要生成声音时记得主动关闭。
全能参考,自适应比例,1080P,20 秒。
参考图 1 里的女孩全程保持同一张脸、同一套白色连衣裙。
参考视频 1 提供运镜节奏:缓慢横移接近,再匀速环绕一周。
清晨的花园,阳光透过树叶洒下光斑,她在花丛间穿行,最后停在一棵樱花树下抬头微笑。
声音:鸟鸣、微风吹动树叶、远处的风铃。
已知限制
- 首帧/尾帧模式不能和全能参考模式一起用,两者互斥。
- NSFW 内容过滤默认关闭,官方文档也提示过滤效果不保证,需要自己留意内容合规。
- 参考视频、参考图片对分辨率和文件大小有要求(像素、宽高比、文件体积都有上限),素材不合规会直接影响能不能用。
在 Nomi 里怎么用
在生成画布里新建一张视频卡,模型框里选「Wan 3.0」,再选生成方式(文生视频、首帧生视频、首尾帧、多参考),放好参考素材、写提示词,点生成。分镜表里也能给每个镜头单独选它。第一次用,先在「设置 → 模型」里接上面列出的任意一家。





