技能库 · 导演

声音设计

声音设计知识——环境音/音效/配乐情绪/沉默设计/听觉记号(leitmotif)/声画对位,仅供叙事规划与后期剪辑参考;⚠️视频生成提示词不含音频,这些内容不写进 shot 的 prompt,是给 Nomi 时间轴后期配音/配乐用的。

  • 适用:文字
  • 许可证:AGPL-3.0-only

在 Nomi 里

Agent 需要时会自己用;也可以在 Nomi 左侧「技能」里点开它,让 Agent 按这份方法来。

在其他助手里

这是标准的 SKILL.md 技能包。把整个文件夹放进支持技能的助手(如 Claude Code、Codex)的技能目录即可。

先读这一条:这套知识不写进视频提示词

视频生成模型的提示词不含音频——环境音、音效、配乐、台词都不在画面模型的能力范围里,写进去要么被忽略、要么污染画面。所以这个技能的产出绝不写进 shot 的 prompt。

它服务两个阶段:

  • 叙事规划阶段:给角色建声音标签、给场景设声音签名、规划听觉记号,作为一层薄薄的「听觉设计意图」跟着分镜走。它是规划时的参考,不是要塞进任何生成字段。
  • Nomi 时间轴后期阶段:等画面生成好、进了 Nomi 时间轴,用于音频轨的后期配音 / 音效 / 配乐规划——按这套方法给每段画面配底层环境声、中层间歇声、前层动作音效,选配 BGM 情绪曲线。

核心理念:观众闭上眼睛也应该能「听出」这是哪个场景、谁在说话、现在是什么情绪。 声音不是画面的附属品,是独立的叙事层。

角色声音标签

给每个主要角色一套声音标签,作为规划参考、后期配音时照它统一。四个维度:

  1. 说话节奏 — 语速(快/中/慢/极慢);停顿习惯(频繁停顿/流利不停/关键词前停顿);句长(短句 ≤5 字 / 中句 / 一口气长句)。
  2. 声线特征 — 音高(低沉/中等/偏高);质感(沙哑/清亮/鼻音重/气声);力度(轻声/正常/有力/压着嗓子)。
  3. 情绪表达方式 — 外放型(生气会吼、开心笑出声)/ 内收型(生气压低音量、开心只语调微升)/ 极端内收(任何情绪几乎不改变声线)。
  4. 标志性声音习惯 — 说话前清嗓、句尾叹气、思考时「嗯」的鼻音等。小习惯给角色「声音辨识度」。

记录格式示例(全片保持一致):

角色 语速 句长 声线 情绪表达 标志习惯
角色A 中偏快 短句 平板单调 极端内收 说完话后沉默·语气几乎无起伏
角色B 慢 ≤5 字 低沉厚重 内收 句尾带鼻音哼声

环境音层次设计

每个场景的声音由三层构成,从远到近:

底层(Ambience / Room Tone) — 持续不变的背景声,定义「这是什么空间」,同一场景全程一致。例:

  • 走廊:引擎/管线低频嗡鸣 + 远处液冷循环声
  • 舰桥/机房:多终端低频电子嗡声 + 空调系统低鸣
  • 静室/卧室:远处设备极弱低鸣 + 空气循环微弱气流声
  • 户外空旷 / 深空:接近或完全寂静——寂静本身就是空间的声音签名

中层(Specific Sounds) — 间歇出现,增加真实感:广播通知、远处脚步、门的开合、杯子落桌、设备蜂鸣。

前层(Foreground / Action Sounds) — 角色动作产生、与画面动作精确同步:脚步声(不同材质地面声音不同)、呼吸声(平静/急促/屏气)、操作声(按钮/触屏/翻页/拉杆)。

场景声音签名

给每个场景定义一个声音签名——一听就知道「到了这里」。在角色第一次进入该场景时建立,后续每次回到都保持一致:

场景 底层 特征音 情绪感受
舰桥/机房 引擎低鸣 + 终端嗡声 键盘敲击、投影嗞嗞声 冷静有序的技术空间
医护/维生区 循环泵脉冲 + 密封吱呀 偶尔气泡上升、辅助设备嘶嘶 令人不安的安静·机械维生感
主角独处的房间 远处低鸣 空气循环微弱气流 独处的安全感·极简

听觉记号(Sound Motif / Leitmotif)

一个反复出现的声音元素,每次出现承载不同含义——和视觉母题(反复出现的物件)是同一逻辑。

设计原则:

  • 一部作品 2-3 个听觉记号就够,太多失去辨识度。
  • 首次出现要足够清晰,让观众「记住」这个声音。
  • 后续出现可变形(速度变化、混响变化、叠加其他声音)。
  • 最后一次出现应有「回收」感——回到最初形态,或彻底变形。

示例:

  • 某段引擎启动声:第一次 = 任务开始;中段 = 逃离;结尾 = 归途。
  • 某段循环水声:初到 = 陌生不适;适应期 = 平静背景;危机期 = 戛然而止。

硬规则:听觉记号限定在声效层(环境声/机械声/自然声/角色签名声),不包括音乐旋律——旋律属于后期配乐工序。

配乐(BGM)情绪

BGM 是后期独立工序,不在任何视频生成环节。规划时只需给出情绪曲线(哪段紧张、哪段舒缓、哪段留白),到 Nomi 时间轴后期按曲线选配或整段留白:

情绪段落 配乐倾向 常见手法
开场/铺垫 克制、留白 少量氛围垫底,或纯环境声无 BGM
推进/悬疑 低频脉动、渐强 持续低音 + 逐渐加密的节奏
高潮/爆发 满配、强节奏 打击乐/弦乐齐上,与硬同步音效叠
收尾/落点 回收主题、渐弱 呼应开场动机,留一段安静收束

声画同步

  • 硬同步(Hard Sync) — 声音与动作精确对齐(拳到的瞬间听到撞击)。用于动作、打击、爆炸、门的开合、物体碰撞。
  • 软同步(Soft Sync) — 情绪上匹配、不精确到帧。用于环境音随场景渐变、音乐跟随情绪起伏。
  • 反向同步(Counter Sync) — 声音与画面情绪相反(画面暴力但声音安静,或画面安静但声音紧张)。制造不安、讽刺、超现实感——极强的叙事工具,慎用。

沉默的使用:突然的寂静比任何声音都更有力量。用在震惊、顿悟、死亡、时间凝固。原则:寂静之前必须有声音(有对比才有效果),持续一般不超过 2-3 秒。

后期配音描述(给 Nomi 时间轴音频轨用,不写进生成提示词)

进了 Nomi 时间轴后,按三层给每段画面写配音说明:

底层:[场景声音签名的底层描述]
环境:[中层间歇声音]
动作音效:[前层动作声音,与画面动作对应]

示例:

底层:走廊的引擎持续低频嗡鸣,管线液冷循环声若隐若现。
环境:远处偶尔传来门开合的沉闷声,走廊尽头有人说话的模糊回响。
动作音效:角色A靴子踩金属地板的均匀脚步声——每步间隔约一秒。

一句话收束

  • 声音标签 / 场景签名 / 听觉记号都是规划参考 + 后期指导,全片保持一致,不进视频提示词。
  • 场景签名在首次出现该场景时建立;听觉记号与视觉母题并列规划。
  • BGM 是后期独立工序,规划只给情绪曲线,落地在 Nomi 时间轴的音频轨。
  • AI 视频生成对声音控制力有限——精确的声音设计更多是给 Nomi 后期的指导。

商业级体验,模型按原价。

macOS · Windows · AGPL-3.0 · 不用注册

下载 Nomi
选择适合这台电脑的版本

能识别系统时会直接下载;无法可靠判断 Mac 芯片时,请选择对应安装包。

macOS 第一次打开

当前 macOS 安装包未使用 Apple Developer ID 签名,也未经过 Apple 公证。请只使用本页或 Nomi GitHub 官方仓库的下载链接。

  1. 下载对应的 DMG,把 Nomi 拖到“应用程序”。
  2. 在 Finder 的“应用程序”中右键 Nomi,选择“打开”,再确认“打开”。
  3. 如果仍被拦截,打开“系统设置” → “隐私与安全”,找到 Nomi 后点击“仍要打开”。

仅当 macOS 提示 Nomi“已损坏”时:先确认安装包来自上述官方链接,再打开“终端”运行:

xattr -dr com.apple.quarantine "/Applications/Nomi.app"

不需要、也不要全局关闭 Gatekeeper。