快手(可灵 AI)
可灵 3.0
快手可灵的旗舰视频模型,支持文生/图生视频、多镜头故事板、音画同步生成,画质可选到原生 4K。
- 文生视频
- 首帧生视频
- 首尾帧
模型库
能做哪几种生成、能放几份参考素材、最长多久、哪几家能接——都来自 Nomi 调用模型时用的那份档案,模型更新,这里跟着变。
快手(可灵 AI)
快手可灵的旗舰视频模型,支持文生/图生视频、多镜头故事板、音画同步生成,画质可选到原生 4K。
MiniMax
MiniMax 的多模态视频模型,图文声像都能当参考,原生立体声,最高 2K,也叫 Hailuo 3。
字节跳动 Seed
字节跳动的视频模型,一次生成最长 30 秒、带声音的多镜头片段,一次最多参考 30 张图、10 段视频、10 段音频。
阿里巴巴通义万相
阿里通义万相 3.0,原生 30 秒时长,最多 20 个素材参考生成,支持文档和网页解析,自带音效。
谷歌 DeepMind
谷歌「任意到任意」多模态家族里的视频担当,靠对话生成和编辑视频,在 Gemini App 里接替了 Veo。
生数科技
生数科技的视频模型,一次生成最长16秒、声音画面同步的视频,可用最多7张参考图锁定人物和场景一致。
快手(可灵 AI)
可灵 3.0 系列的加速版,出片更快,支持文生/图生视频,默认不带水印。
xAI
xAI 的视频模型,文生视频、图生视频都支持,原生 1080p、最长 15 秒,一次最多带 7 个参考图像或语音。
MiniMax、fal.ai
MiniMax 和 fal.ai 联合推出的 H3 加速版,专注更快出片,支持文生、图生、参考生视频。
Runway
Runway 目前的旗舰视频模型,支持文生视频和图生视频,物理效果(液体、碰撞、动量)比上一代更真实。
Runway
Runway 更快更轻的视频模型,只支持图生视频——给一张图和一句运动描述,就能快速生成一段视频。
阿里云百炼
阿里云百炼出品的 HappyHorse 1.1,一个模型自动识别文生、图生、角色参考三种视频生成方式。
谷歌 DeepMind
谷歌 DeepMind 的视频模型,生成时自带同步音效和对白,能用参考图和场景续接把片段接到一分钟以上。
MiniMax
MiniMax 海螺(Hailuo)2.3,文生/图生视频,内置 15 种运镜指令和提示词自动优化,是 H3 的上一代。
Agnes AI
Agnes AI 的视频模型,一份接口三种模式:纯文字、首尾帧、多素材参考都能生成,另有更快的 2.5 Flash 版。
Higgsfield AI
Higgsfield 出的图生视频模型,主打运镜:选预设就能让一张图动起来,官方给了 50 多种运镜可选。
OpenAI
OpenAI 新一代图像模型,生成和改图合一,支持透明底、最高 4K 出图。
谷歌 DeepMind
谷歌图像模型,Pro 级生成改图效果,Flash 级速度,一次最多带 14 张参考图。
字节跳动 Seed
字节跳动图片模型的主力版,擅长密集版式和像素级精修,点选/套索/换色/换材质都能做,原生支持十多种语言文字。
OpenAI
OpenAI GPT Image 2.5 的快速档,主打日常出图、批量生成和快速试稿。
OpenAI
OpenAI GPT Image 2.5 的精修档,主打广告成片和多轮细节编辑。
Black Forest Labs
Black Forest Labs 图片模型旗舰版,最多融合 10 张参考图、4MP 输出,文字排版和品牌一致性是强项。
谷歌 DeepMind
谷歌 Gemini 3 Pro 图像,也叫 Nano Banana Pro,多轮生成改图效果最好,支持 4K。
xAI
xAI 的图片模型,把编辑做成一等功能:局部改、智能去背景,最多 5 张参考图合成;官方称生成和编辑均为世界第二。
阿里巴巴通义千问
阿里通义新一代图片模型,主打"能用"而不只是"好看":约 4500 token 的长提示词、10px 小字都能清楚渲染。
Meta Superintelligence Labs
Meta 出品、经 Runway 提供的图像模型,先规划排版再画,一次能揉合 10 张参考图,还会自己检查修改。
Runway
Runway 自家的参考图出图模型,最多传 3 张参考图就能把人物、场景原样"搬"进新画面,不带参考图也能纯文字出图。
谷歌 DeepMind
同代最快最省的 Gemini 图像模型,4 秒出图,一次最多带 10 张参考图。
字节跳动 Seed
字节跳动图片模型的轻量版,先推理再画、还能联网查资料,一次最多出 15 张,适合办公场景的信息可视化。
阿里巴巴通义实验室
阿里通义实验室开源的 6B 图片模型极速版,8 步就出图、消费级显卡能跑,中英文文字渲染准确,开源模型里跑分排第一。
谷歌 DeepMind
谷歌 Imagen 4 的快速档,专注纯文生图,速度快,适合大批量出图。
谷歌 DeepMind
谷歌 Imagen 4 的高质量档,细节和指令遵循最强,适合对画质要求高的场景。
Agnes AI
Agnes AI 的图片模型,主打信息密度高、构图复杂的画面,档位式分辨率最高到 4K,支持文生图、改图和多图合成。
阿里巴巴通义实验室
阿里通义实验室开源图片模型基础版,比极速版 Turbo 多花步数换多样性和可微调性,是微调、LoRA 的底座首选。
阿里巴巴通义千问
阿里通义完全开源的图片模型系列,2025 年 8 月首发、持续出新版本,中文文字渲染是招牌能力,权重能直接下载本地跑。
Black Forest Labs
Black Forest Labs 开源图片模型,4 步亚秒出图;官方称 9B 版能比肩体量 5 倍的模型。
Black Forest Labs 与 Krea
Black Forest Labs 与 Krea 出品,主打真实质感、拒绝"AI 脸",评测追平 FLUX.1 Pro。
Higgsfield
Higgsfield 自研的时尚人像图片模型,审美直接做进模型里,20 多个精选预设,还能训练专属角色反复复用。
Higgsfield
Higgsfield Soul 系列里专攻电影感的图片模型,胶片颗粒和氛围光是它的主场,也常被拿来当视频关键帧用。
macOS · Windows · AGPL-3.0 · 不用注册