音乐与 AI 术语表
44 来自制作、音频工程、生成模型和音乐授权的术语与定义——一次说清,不绕圈子。
已显示 44 / 44
BPM(每分钟节拍数)
制作一首曲子前进的速度,以每分钟的拍数计。抒情歌约70,house约124,drum and bass约174。节奏是提示词里最有用的参数,因为它比配器更能改变手感。
调性
制作一首音乐最终落回的主音,以及用大调还是小调。大调更明亮/安定,小调更阴暗/未解决。两个同调性的曲目可以叠加或混在一起而不冲突。
Camelot轮盘
制作一种DJ记谱法,把每个调性重命名为数字加A或B——8A、8B、9A。轮盘上相邻的调性放一起更好听,把和声混音从乐理题变成了算术题。
歌曲结构
制作歌曲各段落的顺序——主歌、副歌、桥段——以及每段的时长。结构让一首曲子显得必然而非随意。
音色
音频与格式独立于音高与响度的声音特征——为什么小提琴和长笛在同一音高与音量下依然一耳能分。
混响
音频与格式空间的声音——直达声之后抵达的成千上万次反射。混响把录音放进某个地方,从小房间到大教堂。
速度
制作一段音乐的速度,以每分钟节拍数计。速度比任何单一决定更直接地设定曲目的身体感。
Stem(分轨)
制作混音中的一个组成部分,单独导出——鼓、贝斯、人声、以及其余。用stems可以重调平衡或再混音,而不用回到完整工程。把成品立体声重新拆成stems只是近似,不是找回原件。
编排
制作歌曲各段落的顺序与时长——片头、主歌、副歌、桥段、片尾——以及每段使用的乐器。编排让一首曲子像一首歌,而不是一个一直转的循环。
钩子
制作人们能记住并能跟唱的那部分。通常是副歌旋律或一小段重复短语。就算制作精良,没有钩子的曲子也会失手。
主旋律
制作在现有伴奏上写的人声旋律和歌词。在流行制作里,topline和伴奏常由不同的人写,所以“发我个topline”是很正常的请求。
混音
制作把一首歌的各部分彼此平衡——电平、声像、均衡、效果——让所有东西都听得见,各自占好位置。混音决定一个好编曲能不能真正被听懂。
母带处理
制作最后一步:把完成的混音做到足够响、音色一致,并且能在手机扬声器、耳机和夜店音响上都能成立。母带处理是打磨;它修不好烂混音。
量化
制作把音符吸附到网格上的精确位置。能修正节奏松散,但用过头会抹掉让律动有生命的那点人味松紧。
声像
制作声音在左右声道之间的位置。主唱、大鼓和贝斯几乎总是居中;吉他、键盘和和声会往两侧推。这个约定正是中置人声消除所利用的。
DAW
制作数字音频工作站——用来录制、编辑和混音音轨的软件。常见的有 Ableton Live、Logic Pro、FL Studio、Reaper。
文本转音乐
AI 与模型把文字描述生成音频。你写“slow lo-fi beat with dusty piano and vinyl noise”,就能拿回一条音轨。这个描述干的活儿就跟制作人的简报一样。
提示词
AI 与模型给音乐模型的文字指令。好用的提示词会写清风格、情绪、速度、配器,以及要不要人声。含糊的提示词只会给你千篇一律的结果,因为没有方向可追。
扩散模型
AI 与模型一种从噪声出发、反复去噪直到留下有结构输出的生成方法。现在的大多数音频模型不直接在原始采样上做事,而是在声谱图或学到的潜在空间表示上工作,因为原始音频每秒的数值量太夸张。
潜在空间
AI 与模型一种压缩的内部表示,相似的音乐会彼此挨得更近。在潜在空间里生成而不是在原始音频上生成,才让一整条音轨从小时变成几秒。
声谱图
AI 与模型声音的图像:一轴是时间,一轴是频率,亮度代表响度。好些音乐模型先生成声谱图,再把它转回音频,这让图像技术能用在声音上。
音频标记化
AI 与模型把连续音频变成模型可预测的离散符号序列,就像语言模型预测词一样。标记器的质量就是天花板——那一步丢的细节,后面没法找回。
条件引导
AI 与模型给模型的任何引导,用来把生成往某处拽——文字提示词、参考片段、速度、歌词都算。条件引导越多,惊喜越少、可控越多。
推理
AI 与模型把训练好的模型真正跑起来产出结果,而不是训练它。生成器说“generating…”时就是在做推理,你等待的就是算力时间。
音源分离
AI 与模型把完成的混音拆回各分轨。像 Demucs 这类神经分离器会学习每种乐器的声音;而中置消除走的是立体声几何的捷径,快得多,也粗得多。
声音克隆
AI 与模型用某人的录音复刻他的声音。和做一个“某种风格的声音”不是一回事。克隆指名艺人的声音会在越来越多的法域里碰上肖像权和商业代言权问题,这就是 MusicGenerate 不提供它的原因。
采样率
音频与格式每秒采样多少次,用 Hz 表示。44,100 Hz 是 CD 标准,48,000 Hz 是视频标准。更高的采样率能记录更高的频率;本身并不会让音轨更好听。
位深
音频与格式每个采样被存得多精细。16 位是发行级,24 位给制作时更多余量。位深太低会在安静段落里冒出嘶声。
无损 vs 有损
音频与格式WAV 和 FLAC 保留每个采样;MP3 和 AAC 会丢弃被判定为听不见的信息来缩小文件。有损编码是单行道——把 MP3 重新编码只会叠加损伤,不会修复。
LUFS
音频与格式一种按“听起来多响”而不是峰值电平来计的响度标准。流媒体大致归一到 −14 LUFS 左右,所以母带做得更响也只会被拉回去。
余量
音频与格式混音最响点和开始削波的天花板之间的空间。留出几 dB 的余量,母带才有发挥的地儿。
削波
音频与格式信号超过最大电平、峰值被拍平时发生的事。听起来是刺耳的失真,一旦写进文件就无法挽回。
中/侧
音频与格式把立体声拆成声道共享的部分(中)和让它们不同的部分(侧)。只取“中”大致等于居中的内容;只取“侧”会把它去掉。这就是卡拉OK式去人声的原理。
相位抵消
音频与格式当两份相同信号互为反相并相加为静音。麦克风间意外发生是个问题,刻意应用来去除居中内容就是个工具。
ID3 标签
音频与格式存储在 MP3 内部的元数据——标题、艺人、专辑、封面。播放器读取的是这些而不是文件名,这就是为什么文件名对了也可能显示为“Unknown Artist”。
波形
音频与格式振幅随时间变化的可视化形状。方便一眼找静音、瞬态和段落边界;它不告诉你音高或调性。
免版税
权利与授权你一次性付费,或不付,然后不再按次付费。它不等于无版权,也不等于不受限制——许可证仍然规定使用条款。
无版权
权利与授权真的是没人拥有;对音乐来说几乎只会因年代进入公有领域。现代音乐几乎没有无版权的,这个说法通常是在想表达“免版税”时用错了。
机械复制许可
权利与授权发布你自己录制的他人歌曲所需的许可。任何翻唱都要,不管是乐队演奏还是生成出来的。它覆盖的是作品(曲和词),不是原始录音。
同步许可
权利与授权把音乐与画面同步的许可——视频、广告、游戏。它独立于仅分发音频的权利,也是大多数创作者实际需要的许可。
作品 vs 录音
权利与授权每首歌有两种权利:作品(旋律和歌词,归词曲作者)和录音(具体表演,归制作方)。翻唱会产生新的录音,但仍使用原作品。
Content ID
权利与授权YouTube 的自动匹配系统。即便你合法拥有一首曲目,只要它被别人登记了也可能被标记——包括有人先声称与之完全相同的生成音频的情况。
PRO
权利与授权表演权组织——ASCAP、BMI、PRS——为词曲作者收取表演版税。当音乐被公开播放或广播(而不是只做流媒体播放)时才相关。
受雇创作
权利与授权一种由委托方而非创作者本人完全拥有作品的安排。广告和游戏里常见,最好在交付前用书面把这点说清。
音乐术语,不绕圈子的定义
所有“音乐术语表”都有同一个毛病:把音色定义成音色,把 DAW 展开成数字音频工作站软件,却不说你拿它干嘛。这里的每一条都从“它做什么”讲起,点名它属于哪种决策,并说明你在实际中会在哪遇到它。
这些词来自四个很少共用一本词典的传统。乐理词——调、速度、编配、歌曲结构——最古老也最标准化。音频工程词像混响、分轨、混音、母带来自录音棚,描述的是“对录音的操作”,而不是“对作品的操作”。生成相关的词如提示词、种子、模型、推理,近几年从机器学习里进来。授权词——免版税、Content ID、商业用途——是法律语言,决定你能不能发布你做的东西。
意大利音乐术语最让人摸不着,因为它描述的是性格而不是数值。Allegro、andante、largo 是速度标记,每个都能映射到一个可写进提示词的 BPM 区间——这正是“速度”这一条目在做的事,因为生成器能理解 72 BPM,却不一定可靠理解 largo。
术语在上方按类别分组,每条都链接到一页,不止是定义:它的意思、它为什么重要、你知道后在工作里会改什么。
内页
这套词汇分四块
制作、音频、生成式模型和权利。
1 / 5
它也是提示词的语言
说“72 BPM,中频别太挤”是制作指令,比“来点 chill”产出的东西更好。
这里的定义是拿来用的
每个词不只解释是什么意思,还说它会影响你做什么决定。
术语直链工具
哪个词指向可测的东西,就链到能测它的工具。
容易糊的词会留足篇幅
stem 分轨、音色、歌曲结构比一行定义复杂多了,所以给它们整页讲清。
常见问题
混音和母带有什么区别?
混音是在一首歌里平衡各部分;母带是把完成的混音准备好,能在不同播放系统上发布。混音是很多推子,母带是一条立体声文件。
音乐里的 stem 分轨是什么?
歌曲某一部分的子混音(stem 分轨)——比如人声、鼓、贝斯——导出成独立文件。这样你不用整套工程也能重新平衡或做 remix。
音乐里的 BPM 是什么意思?
每分钟节拍数,决定一条音轨有多快。在提示词里这是最有用的信息,因为模型对明确的数字比形容词靠谱得多。
什么是 DAW?
数字音频工作站:用来录音、编曲、编辑、混音的软件。Ableton Live、Logic Pro、FL Studio、Reaper 都是 DAW。
什么是音色?
声音的特性——为什么钢琴和吉他弹同一个音却听起来不同。在提示词里点名音色,比只写流派更能推动结果。
用 AI 音乐生成器需要懂这些术语吗?
开始不需要。但这些词在提示词里都是杠杆,懂四五个,就能把结果从“平均大杂烩”拉到“正是你要的”。

















