技术参考

流媒体的响度归一化:一份写给中文母带与混音工程师的技术参考

核对日期 2026-09-07

简短回答

先把真峰值(true peak,重建后的模拟波形的实际峰值)上限钉死在 −1 dBTP;如果你的母带整体响度大于 −14 LUFS,Spotify 要求你把它压到 −2 dBTP 以下。整体响度(integrated loudness,工程师口语里常直接说 "integrated")不需要硬凑到某个数字上——让音乐自己落在哪儿就是哪儿。真要一个公开发布的目标值:AES TD1008 对音乐推荐 −16 LUFS,Spotify 在播放端把音轨归一化到 −14 LUFS。所有主流流媒体都会在播放时把响的母带调小,所以一张推到 −6 LUFS 的母带并不会比 −14 LUFS 的那张放得更响,它只是以同样的响度、更小的动态范围(dynamic range)播出来。过度使用限制器(limiter)买到的不是响度,是平坦。 正确的数字不存在,正确的做法只有一个:先定上限,再按音乐做母带,最后才去测。


一、这是一道算术题,不是审美之争

做播放归一化的服务,会测量你这首曲子的整体响度,跟自己的目标值比较,然后在播放时给整个文件加上一个固定增益。以 Spotify 的 −14 LUFS 为例:

母带整体响度播放时施加的增益
−14 LUFS0 dB
−11 LUFS−3 dB
−8 LUFS−6 dB
−6 LUFS−8 dB

把同一版混音做成两张母带来看。母带甲:整体 −14 LUFS,峰值 −1 dBTP,峰值–响度比(PLR,peak-to-loudness ratio)13 LU。母带乙:同一混音推到 −8 LUFS,同样 −1 dBTP 上限,PLR 只剩 7 LU。在 −14 LUFS 的目标下,母带乙被衰减 6 dB,它的峰值落到 −7 dBTP,它的响度和母带甲完全一样。限制器抹掉的那 6 dB 波峰因数(crest factor,也写作峰值因数)就这么没了,播放链路上没有任何环节会把它还给你。

响度归一化把"响度战争"变成了"动态范围战争",而在这场战争里,最响的那张母带自动出局。 整个论证到此为止,它不依赖任何人的口味。

比这条警告更有用的是它的反面。既然播放电平由服务决定,那么母带的电平已经不再是竞争变量。还在竞争的是过去被电平吃掉的那些东西:瞬态(transient,起音的头几毫秒)的清晰度、一记板鼓打在持续的京胡上的分量、主歌和副歌之间的落差、人声是站在乐队前面还是被压进乐队里。在归一化之下,你关于响度所做的全部决定里,听众唯一还能听见的部分是 PLR。

两个必须说清楚的限定条件。第一,归一化是可以被绕过的:听众可以在客户端关掉它,而 DJ 软件、影视同步、下载后用车机 AUX 播放的文件,本来就不经过它。第二,也是更重要的一条:向上归一化(upward normalisation)确实存在,但它是有条件的。 Spotify 在其页面上明确写着 "Positive gain is applied to softer masters so the loudness level is -14 dB LUFS"(对更轻的母带施加正增益,使响度达到 −14 dB LUFS),但紧接着又写 "We consider the headroom of the track, and leave 1 dB headroom for lossy encodings to preserve audio quality."(我们会考虑音轨的余量,并为有损编码保留 1 dB 余量以维持音质。)所以一张很轻但峰值很高的母带,可能不会被抬到目标值。这正是"反正它会给我抬上去,那我就做到 −24 LUFS"这个想法错在哪里:它可能抬不满。反过来说,"轻的母带不会被抬"也是错的。两句话都不能写。


二、短视频思路做出来的母带,交到流媒体上到底亏在哪

中文市场有一个绕不开的现实:大量华语作品的母带,是按照在短视频平台和手机外放里够响这个标准做出来的,然后原封不动地交付给流媒体。这不是审美问题,是发行流程的问题——很多项目从头到尾只有一版母带。

先说清楚事实边界:抖音、快手、B 站、小红书等平台都没有公布过任何响度归一化规范。 网上流传的各种数值都是第三方测量或者传言,本文不引用。这里唯一能确定的是:你在为一个没有公开文档的目标做母带,然后把它交给一个有公开文档的目标(Spotify 的 −14 LUFS)。

那就把账算出来。假设一张典型的"短视频响度"母带:整体 −6 LUFS,限制器上限设在 −0.3 dBFS(注意,这是采样峰值,不是真峰值),PLR 大约 5.7 LU。

  1. 播放增益。 Spotify 目标 −14 LUFS,施加 −8 dB。它和一张 −14 LUFS 的母带放出来一样响。为了那 8 dB 你付出的全部代价,听众一分钱好处都没拿到。
  2. 峰值落点。 衰减之后峰值落在 −8.3 dB 左右,而一张 −13 LUFS、−1 dBTP 的母带衰减 1 dB 后峰值在 −2 dBTP。后者在同样响度下保留了大约 6 dB 的波峰因数。
  3. 交付本身就不合规。 因为母带响过 −14 LUFS,Spotify 明确要求真峰值低于 −2 dBTP。−0.3 dBFS 的采样峰值上限意味着真峰值几乎肯定在 0 dBTP 以上(见第六节),距离 −2 dBTP 差了两个多 dB。
  4. 有损编码的过冲。 这一版母带被压得越狠,AAC / Ogg Vorbis 解码后的过冲越大,而它离 0 dBFS 又最近。削波(clipping)就发生在解码器输出上,母带文件里干干净净,你在 DAW 里永远看不到它。
  5. 动态代价。 从 −13 LUFS 推到 −6 LUFS,多出来的 7 dB 全部由限制器承担。对一首有真实打击乐的编曲来说,这 7 dB 基本上就是全部的瞬态余量。

结论很朴素:手机外放的响度感来自能量密度和中频集中度,不来自整体电平;而整体电平恰恰是流媒体唯一会拿走的东西。 如果一定要为短视频单出一版,那就单出一版;不要用那一版去做流媒体交付。


三、LUFS 到底测的是什么

LUFS 是 Loudness Units relative to Full Scale(相对满刻度的响度单位)。LKFS(Loudness, K-weighted, relative to Full Scale)是同一个单位的另一个名字,ITU 的文件用 LKFS,EBU 的文件用 LUFS,数值完全相同。LU 和 dB 一样大——1 个响度单位等于 1 分贝——但 LUFS 是绝对刻度,LU 是相对刻度。 "+3 LU" 和 "+3 dB" 是同一个量;"−14 LUFS" 和 "−14 dB" 完全是两回事。

ITU-R BS.1770 定义的测量既不是 RMS 也不是峰值。它是经过滤波之后的信号的均方值,按声道加权求和,再在时间轴上做门限(gating)。它和普通 RMS 表的区别就在三处:K 计权滤波器、声道求和、两道门限。误解几乎全部集中在滤波器和门限上。

3.1 K 计权:两级滤波器

K 计权是在取均方值之前、对每个声道施加的恰好两级二阶滤波器级联。

第一级——"头部"滤波器(head filter)。 一个高频搁架(high-shelf),把频谱上端抬起来。48 kHz 下公布的系数是 b0 = 1.53512485958697,b1 = −2.69169618940638,b2 = 1.19839281085285,a1 = −1.69065929318241,a2 = 0.73248077421585。它模拟的是人头在声场中的声学效应——遮挡与绕射使真人对正前方来的高频比裸麦克风更敏感。

第二级——RLB 高通。 RLB 是 Revised Low-frequency B-curve(修正的低频 B 曲线),一个把低端滚降掉的高通。它体现的事实是:低频对主观响度的贡献低于它的能量占比。这就是为什么一首超低频巨大的曲子在夜店里体感极响,在响度表上却读得偏轻——很多做电子和嘻哈的工程师第一次看表时都会觉得表坏了。

K 计权曲线在 1 kHz 处的增益是 +0.698 dB,线性系数 1.0836。 这不是随便定的常数,它是搁架和高通在该频点响应的自然结果。整条链路的实际后果是:把一个满刻度 1 kHz 正弦送进立体声对的其中一个声道,表读数是 −3.01 LKFS,与 BS.1770-5 的表述一致——这个 −3.01 来自"二声道里只有一路有信号"的求和,不是来自滤波器。

3.2 为什么要有这条曲线

不加权的 RMS 表会告诉你,同样幅度的 40 Hz 正弦和 3 kHz 正弦一样响。没有一个听众同意。K 计权是对等响曲线行为的一个刻意粗糙的近似——比 Fletcher-Munson 曲线简单得多,而且故意做得这么简单,好让全世界各家独立实现的表在零点几 LU 之内彼此吻合。K 计权不是要精确地建模听觉,而是要让全世界所有的表以同一种方式不精确,这才是它有效的原因。 两台合规的表测同一个文件,读数一致到足以支撑跨服务比较。

3.3 适用的是哪一版

BS.1770 一共有六个版本:-0(2006)、-1(2007)、-2(2011)、-3(2012)、-4(2015-10)、-5(2023-11)。目前生效的是 BS.1770-5(2023 年 11 月);BS.1770-4 已被取代,尽管市面上大多数已部署的表在说明书里引用的仍然是 -4。 本文描述的每一条机制——两级滤波器、400 ms 块、两道门限、4 倍过采样下限——都是对照 BS.1770-5 正式文本核对过的。


四、两道门限,完整说一遍

门限是这份规范里最常被讲错的部分,连一些相当严谨的资料也讲错。整体响度是一个双重门限的测量。

第一步:分块

信号被切成 400 ms 的门限块,重叠 75%。400 ms 块重叠 75%,意味着每 100 ms 开始一个新块。每个块各自算出自己的 K 计权均方响度值。这个重叠不是装饰:它防止一个恰好跨在块边界上的强事件被切成两半从而被低估。

第二步:绝对门限

任何低于 −70 LKFS 的块被丢弃,不再参与后续计算。 这一步剔除的是数字静音、淡出尾巴、房间底噪和曲目之间的空白,使得一首带长静音尾巴的曲子不会比裁剪过的同一首测得更轻。

第三步:相对门限——这一步通常被写错

通过了绝对门限的那些块的平均响度,减去 10,得到相对阈值。低于该阈值的块全部丢弃。整体响度是同时通过两道门限的那些块的平均值。

区别在这里,而且经常被丢掉:相对门限是在"绝对门限之后的平均值"下方 10 LU,不是在整个文件未经门限的平均值下方 10 LU。 BS.1770-5 明确说相对阈值是把绝对门限测量的结果"减去 10"得到的。如果你把所有块(包括那些低于 −70 LKFS 的)都算进平均,你会得到一个更低的平均值、一个更低的阈值、更多被放进来的安静块,以及一个偏低的整体读数——而且文件里静音越多,误差越大。这是两台表在同一个文件上读数不一致的头号原因。

−10 LU 相对门限带来的一个听觉后果值得记牢:你这首曲子的整体响度,实际上是它"响的部分"的平均响度,而不是整首曲子的平均响度。 一首有 40 秒气声低语开头、再接一堵墙一样的副歌的作品,几乎完全是按它的副歌被测量的。这就是为什么在一张做完的母带前面加一段安静的引子,整体读数几乎不动;而期待它会动的工程师会很意外。


五、瞬时、短时、整体:什么时候看哪块表——以京剧为例

三个时间窗是标准化的,它们回答三个不同的问题。EBU Tech 3341 定义了这几种表的行为。

瞬时(Momentary, M)——400 ms,不做门限。 和门限块同一个窗长。瞬时响度跟踪的是单个事件:一记板鼓、一个人声爆破音、一个正拍。用它来东西——比周围高出 6 LU 的一记底鼓、一个突然跳出来的段落。不要用它做电平决定,它太跳了,追着瞬时表做母带,做出来的正是归一化要惩罚的那种东西。

短时(Short-term, S)——3 s,不做门限。 三秒大致是一个乐句。短时响度才是曲内平衡决策该看的表,因为三秒正是听众真正把一个段落感知为"响"或"轻"的时间尺度。 用短时表比较主歌和副歌,检查桥段有没有塌下去,把编曲的形状看成数字。

整体(Integrated, I)——整个节目,双重门限。 这是服务用来做归一化的数字,也是唯一该写进交付规格里的数字。从第一个采样测到最后一个采样,不要只测选中的一段。整体响度是交付规格,不是混音工具;如果你在干活的时候盯着它,你盯错表了。

5.1 文场与武场:为什么京剧是这套时间窗的极限考题

京剧的伴奏结构天然把这三块表分开了。文场是京胡、月琴、三弦(有时加笛、笙),武场是板鼓、大锣、小锣、铙钹。这两组不是"主奏与伴奏"的关系,而是两个电平世界。

下面这组数字是为了说明量级而设的算例,不是任何公布的统计:

素材合适的表量级
京胡+月琴过门短时(3 s)约 −30 LUFS
一段完整唱腔(含文场)短时(3 s)约 −24 LUFS
板鼓一击瞬时(400 ms)约 −9 LUFS
大锣一记瞬时(400 ms)约 −8 LUFS

也就是说,大锣的一记和板鼓的一击,比它们所依托的京胡伴奏高出 20 LU 以上,而整个剧种的戏剧张力恰恰建立在这个落差上。你在文场把电平推上去,武场就没地方去;你为了让武场不炸而全局压缩,文场的京胡就会被顶到前面来,那种"锣鼓一响、满台立住"的感觉当场消失。

正确的做法是分表分工:用短时表决定文场唱腔的段落平衡,用瞬时表去看武场那几击有没有把限制器打穿,用整体表在最后验一次数。 反过来做,你会得到一张所有段落一样响的京剧录音——技术上没有一处错,艺术上什么都不剩。

一条实用规矩:用短时混音和做母带,用整体验收,用瞬时查异常。


六、响度范围(LRA)与 −20 LU 门限

响度范围(Loudness Range,LRA)由 EBU Tech 3342 规定,用一个数字描述曲子的响度随时间变化的幅度。它由短时(3 s)响度值的分布计算而来:LRA 是该分布的第 10 百分位与第 95 百分位估计值之差,正因如此,两端的短暂极值不会主导结果。

LRA 有自己的门限,而且它和整体响度的门限不一样Tech 3342 把 LRA 的相对阈值设在绝对门限响度下方 −20 LU,不是 −10 LU。 这个更宽的门限是刻意的:LRA 要刻画的是"变化",所以它必须放进那些整体测量刻意排除掉的较安静段落。

这是一个真实存在的实现缺陷,不是理论问题。把整体响度的 −10 LU 相对门限拿来复用给 LRA 的表,报出的数值会系统性偏小,因为它恰好把构成"范围"的那部分安静素材扔掉了。如果你的表在同一个文件上报出的 LRA 明显低于另一台表,第一个该怀疑的就是它在该用 −20 LU 的地方用了 −10 LU。 这个你自己就能验:在曲子后面接上 20 秒比主体低 15 LU 的素材。实现正确的表,LRA 会明显上升;坏掉的表几乎不动。

作为方位感而非目标值:压得很狠的电子与流行母带常落在 3–5 LU,控制良好的全频段混音在 6–9 LU,管弦乐与原声录音经常在 12 LU 以上。

中文语境里,这条刻度的两端非常清楚。一端是京剧、民乐大合奏这类以对比为结构的形式——一段做得诚实的京剧现场,LRA 落在两位数是正常的,不是"没做完"。 另一端是民谣和原声创作歌手的录音:一把木吉他、一个人声、也许一把口琴,动态起伏本来就小,LRA 天然就窄,把它硬推到 −7 LUFS 只会让指板噪音、拨片声和呼吸声全部被顶到和人声一样响,听感上像有人把耳朵贴在琴箱上。民谣的问题从来不是不够响,是被压得没有房间感。 LRA 是描述性的;追求一个特定的 LRA 数字和追求一个特定的 LUFS 数字一样没有道理。


七、真峰值与采样峰值:唢呐是这一节的主角

7.1 两者的区别

采样峰值(sample peak)表报告的是文件里绝对值最大的那个采样点。那不是信号真正到达过的最大值:采样点只是连续波形上的一些点,两个采样点之间的波形完全可以高过它们两个。重建出来的模拟波形可以超过文件里最高的那个采样值,而采样峰值表在结构上就不可能看见它。 这些越界叫做采样间峰值(inter-sample peaks),重建波形的电平就是真峰值,单位 dBTP。

一个在数字上"安全"的文件,采样点最高只到 −0.1 dBFS,它的真峰值完全可能远高于 0 dBTP。文件里什么都没削掉。而下游每一个要重建波形的环节——DAC、采样率转换器、有损解码器——都可能把它削掉。

7.2 唢呐:一件让采样峰值表彻底失效的乐器

唢呐大概是当今仍在常规使用的所有原声乐器里最响、瞬态最密集的一件。 它的问题不是"音量大",而是它同时满足了产生采样间峰值的每一个条件:

  • 起音极陡。 一个吹奏得干净的唢呐音头,从底噪到满功率只用几毫秒。陡峭的起音在频域上就是宽带内容,宽带内容里高频分量密集——而高频分量恰恰是采样点之间波形起伏最大的地方
  • 谐波极其丰富且延伸得很高。 唢呐的哨片与铜碗把大量能量推到接近奈奎斯特频率。当一个分量的频率接近采样率的一半,它在两个采样点之间的真实峰值可以显著高于任何一个采样点。
  • 它天生就在拼响度。 唢呐是户外乐器,红白喜事、庙会、鼓吹乐班的场合决定了它的演奏方式就是往上顶。录音时话筒前的声压极高,工程师的第一反应通常是把推子往下拉,然后在母带阶段又用限制器把它推回来。

具体的量级(同样是算例):一段唢呐独奏,采样峰值表读 −0.3 dBFS,看起来还有余量;同一个文件用 8 倍过采样的真峰值表去测,读 +0.8 dBTP。文件里没有一个采样点越界,但重建后的波形已经越界超过 1 dB 了。把它交给 AAC 编码,解码端的过冲会在这个基础上再叠加,削波就发生在听众的手机里。你在 DAW 里永远看不到这次削波,因为它不在你的文件里。

还有第二重代价,纯技术之外:限制器会把唢呐的音头变成一堵墙。 唢呐的表现力有很大一部分在那个音头的形状——它是抹上去的、还是顶上去的、有没有那一下"炸"。限制器一介入,所有音头被削到同一个高度,唢呐听起来就不再像唢呐,而像一件被塞进罐头里的、音色很尖的合成音源。这是母带阶段最容易在不知不觉中做掉的一件事:你解决了一个电平问题,同时删掉了这件乐器之所以是这件乐器的原因。

处理办法不是"少压一点"这种含糊话,而是:把唢呐的动态控制放到混音阶段用自动化和分频处理来做,让总线限制器在唢呐进来的时候几乎不动作。 母带的限制器不该是第一道防线。

7.3 为什么必须过采样

要看见真峰值,你必须把采样点之间的波形重建出来。BS.1770 规定的做法就是过采样(oversampling):在 48 kHz 下最低 4 倍过采样,同时建议指出 "Higher sampling rates and over-sampling ratios are preferred."(更高的采样率与过采样倍数更佳。)4 倍是合规下限,不是准确答案;在 4 倍下,测量仍可能把真实峰值低读零点几个 dB。如果你的表提供 8 倍或 16 倍,就用 8 倍或 16 倍;多出来的 CPU 开销微不足道,多出来的准确度不是。 一块没有明确的 true peak / dBTP 模式的表,就是一块采样峰值表,不管说明书怎么写。

7.4 有损编码为什么会抬高峰值

有损编码器——AAC、Ogg Vorbis、MP3——不会逐采样地复现波形,它复现的是一个感知上相似的波形,而解码器的输出常规性地超过编码器的输入。这个过冲不是缺陷,而是量化和丢弃频谱细节不可避免的后果,并且它的幅度随源素材被压得多狠而增大。一张正好做到 0.0 dBTP 的母带,解码出来峰值在 0 dBFS 之上,解码器把它削掉。

每一份处理到这一点的公开规范说的都是同一件事。AES TD1008:"For all content, it is recommended that the Maximum True Peak level not exceed −1 dBTP at the codec input of lossy-encoded streams."(对所有内容,建议在有损编码流的编解码器输入端,最大真峰值不超过 −1 dBTP。)Spotify:真峰值保持在 "below −1dB TP (True Peak) max",且对响过 −14 LUFS 的母带,"keep True Peak below −2dB to avoid extra distortion."(把真峰值保持在 −2 dB 以下以避免额外失真。)

7.5 到底该设多少

普通母带把限制器的真峰值上限设为 −1.0 dBTP;如果整体响度大于 −14 LUFS,设为 −2.0 dBTP。 这不是迷信性的裕量,两个数字都来自上面的公开要求,而第二个之所以存在,正是因为压得更狠的素材在编解码环节过冲更大。

两条脚注。第一,把上限设在 −0.1 dBTP 对流媒体交付来说是一个错误,不是一种风格选择。第二,一台设在 −1.0 dBTP 的限制器必须真的是真峰值限制器:很多限制器的 ceiling 控制是采样峰值的,你把它设成 −1.0,得到的采样间峰值会在 −0.5 dBTP 上方某处。

如果你想检查一个做完的文件:mazufa.com 提供一个免费的浏览器端响度与真峰值检查工具,全部计算在你自己的设备上完成,不上传任何音频。


八、各家服务实际公布了什么

"公布"和"广泛流传"的区别是这一节里最重要的东西,而几乎所有关于这个话题的中文文章都没有守住这条线。

8.1 有公开规范的

Spotify。 目标:整体 −14 LUFS。Spotify 说明它把音轨调整到 "−14 dB LUFS",并按 "the ITU 1770 standard" 测量。真峰值上限:低于 −1 dBTP;对响过 −14 LUFS 的母带,低于 −2 dBTP。Spotify 同时说明 "positive gain is applied to softer masters so the loudness level is −14 dB LUFS",但附带余量(headroom,中文口语里常说"动态余量"或直接说"留头")限制:"We consider the headroom of the track, and leave 1 dB headroom for lossy encodings to preserve audio quality." 关于专辑归一化,Spotify 说明专辑是作为一个整体被归一化的,使得 "the softer tracks are as soft as you intend them to be"——专辑内各曲之间的相对电平关系被保留。这一条对概念专辑、戏曲全剧录音、民乐组曲这类"曲间落差本身就是作品结构"的项目非常关键。

EBU R 128。 目标 −23 LUFS。这是广播建议,不是流媒体音乐目标,之所以在这里列出,是因为它常被误用:一张 −23 LUFS 的音乐母带并不因此更"合规",而且因为向上归一化受余量限制,它有可能播出来比你预期的还轻。

AES TD1008(《Recommendations for Loudness of Internet Audio Streaming and On-Demand Distribution》)。这是对音乐人最有用的一份公开文件,也是被引用错得最多的一份:

  • 按单曲归一化的音乐:−16 LUFS,容差 +0.2 LU。
  • 按专辑归一化时,最响的一首:−14 LUFS,容差 +0.2 LU。
  • 以语音为主的内容:−18 LUFS,容差 +1 LU,按对白整体响度测量。
  • 最大真峰值:有损编码流的编解码器输入端 −1 dBTP

TD1008 里的 −18 LUFS 是"以语音为主的内容"(新闻、谈话、广播剧)的目标值,把它当成音乐目标值引用是一个常见且严重的错误。 音乐的数字是 −16 LUFS。你如果看到有人把 −18 LUFS 说成 AES 的音乐建议,那份材料读错了原文。

TD1008 还有一句关于动态的明确表述值得原样引用:"A recording with high peak to loudness ratio (PLR) is often perceived as clearer and less fatiguing than one that has been excessively peak-limited."(高 PLR 的录音通常被感知为更清晰、更不容易听疲劳,相比之下过度峰值限制的录音则不然。)

8.2 未公布归一化目标的服务

Apple Music、YouTube Music、Amazon Music、TIDAL、Deezer 都没有公布归一化目标值。 它们做归一化是可观察的,但具体数字不是一份公开规范,任何把某个数字当成规范来呈现的文章,都是把测量或推断当成了文件。

常见流传的数值是:Apple ≈ −16 LUFS,YouTube Music ≈ −14 LUFS,Amazon Music ≈ −14 LUFS,TIDAL ≈ −14 LUFS,Deezer ≈ −15 LUFS。这些数字广泛流传,但服务方并未公布;请把它们当作第三方对一个移动目标的观测,而不是规范。 它们来自独立测量,随时间变化过,没有任何一家服务对它们做过承诺。不要用它们去推算播放增益,也不要照着其中某一个做母带。

同样地,本文第二节已经说过:抖音、快手、B 站、小红书等中文短视频与社区平台,也没有公布过任何响度归一化规范,我们不引用任何流传的数字。

实际后果比看上去小得多:所有被报道的数字都落在 −16 到 −14 LUFS 之间,跨度 2 LU。没有哪张母带值得为 2 LU 重做。


九、实践建议

9.1 怎么决定目标

从音乐往回推,不要从数字往前推。

  1. 先定上限。 −1 dBTP,真峰值,过采样。这是整张清单里唯一真正硬性的约束。
  2. 按音乐做母带。 把平衡、音色、动态做对,让限制器尽可能少干活。这个阶段不要看整体响度表。
  3. 测结果。 无论你落到多少整体响度,那就是你的候选值。
  4. 检查范围合不合理。 如果整体值落在大约 −14 到 −9 LUFS 之间,你就处在所有公开目标和所有流传数值都相距不过几个 LU 的区间里,没有服务会对你的曲子做出剧烈动作。如果你响过 −9 LUFS,问问自己那些限制换来了什么,因为播放归一化会把电平拿回去。
  5. 然后才考虑调整,而且要靠改母带来调,不是靠加限制。

"往上加限制直到表读到某个 LUFS 数字",正是响度归一化被设计出来要让其失去意义的那种行为。 如果你需要这个数字动,用增益结构、用混音决定、用更少的压缩去让它动,不要用更多的限制。

风格类型的影响不是一个数字能概括的。密集的电子、金属和现代流行母带常落在 −10 到 −8 LUFS,因为素材本身就是持续型的;爵士、民谣、管弦乐与传统民乐落在 −18 到 −13 LUFS,因为它们不是。两者都对。错的是一张被压到 −8 LUFS 的民谣唱片,不是一张测出 −16 LUFS 的民谣唱片。

9.2 拨弦、弓噪与"噪音就是信号"

有几类中文录音里最容易被母带处理误伤的成分,值得单独点名,因为它们在频谱上看起来像噪音,在听感上却是这件乐器的身份。

古筝的义甲触弦声。 一个古筝音的前 5–10 ms 是义甲刮过弦的宽带声,之后才是琴弦的基频建立起来。把这段瞬态压掉,古筝会变成一件音高正确但没有"手"的乐器——你还能听出这是古筝,但听不出这是谁在弹。刮奏(滑音扫过全弦)尤其危险:它是一长串连续的高电平瞬态,限制器会在整个刮奏过程中持续动作,把它抹成一条平的沙沙声。

琵琶的轮指与扫弦。 轮指是五个手指依次快速触弦形成的连续音,它的听感依赖于每一次触弦的独立性。总线上一个起音时间稍慢的压缩器会把前两三个音头压住、后面的放过去,轮指听起来就变成了颤抖而不是滚动。扫弦更极端:四条弦在几毫秒内被一次扫过,这是琵琶动态范围的顶点,也是最先撞上限制器的地方。判断母带压得过不过的最快办法之一,就是听扫弦有没有变成"噗"的一声。

二胡的弓噪。 弓毛与琴弦、琴筒与蟒皮之间的摩擦声,长期被一些工程师当成需要清理的噪音去做降噪或高频衰减。它不是噪音,它是运弓信息——听众正是靠它判断力度、速度和换弓位置。把它去掉,二胡会变得"干净"而毫无表情。同样地,过度的多段压缩会在长音的持续段把弓噪抬起来(因为它是持续段里唯一的高频能量),造成一种奇怪的"沙沙作响的二胡"。

共同的原则只有一句:在这些乐器上,瞬态和摩擦声不是要被控制的副产品,它们是主奏内容。

9.3 如果母带已经压完了

你手上有一张压得很狠的成品母带,刚读完上面这些。三个诚实的选项,按推荐顺序:

从混音重做母带。 唯一真正的修复。峰值限制不可逆,被削掉的瞬态不在文件里。如果混音还在,把限制器退回去重新渲染。

只降上限,别动其他。 如果你只有母带、而它的真峰值高于 −1 dBTP,就用真峰值限制或安全增益衰减把它压到 −1 dBTP(响过 −14 LUFS 就压到 −2 dBTP),到此为止。这修的是交付错误,不假装在修动态。

什么都不做。 一张 −8 LUFS、−1 dBTP 的母带并没有坏。它播出来和别的东西一样响,只是比它本可以做到的稍微平一点——这是真实的代价,但比一次仓促的重做要小。过度限制是一次错过的机会,不是一个缺陷——文件能播,只是播得不如它本可以的那么好。

9.4 把电平和动态分开想

这两件事必须在脑子里分开,绝大多数糟糕的决定都源自把它们混为一谈。

电平是整首曲子坐在哪儿。它是一个数字,由一个推子决定,它是免费的,而且在归一化之下它由服务选、不由你选。

动态是响的部分和轻的部分之间的关系,既包括逐个瞬间的(波峰因数、PLR),也包括段落之间的(LRA)。它的创造是有成本的,它会被限制器摧毁,而且下游无法恢复。

你已经不在电平这条赛道上竞争了——服务替你定了——所以你花在电平上的每一个 dB,都是从听众根本看不见的预算里花掉的。 响度归一化没有剥夺你做出一张听起来很有劲的唱片的能力,它剥夺的是"靠响来做到这一点"的能力。现在的力度感来自编配密度、瞬态对比、中低频的重量,以及段落之间落差的大小——这些东西经过 −6 dB 的播放增益之后毫发无损。

9.5 真的不重要的事

  • 精确命中某个 LUFS 数值。 不会有四舍五入,不会有审核不通过,−14.0 和 −13.4 LUFS 之间的差别听不出来。±1 LU 的容差已经很宽松,没人会注意到。
  • 为不同服务做不同母带。 公开的和流传的目标值总共跨度约 2 LU。一张 −1 dBTP、动态合理的母带在所有地方都是对的。为每家服务单独做母带,是在解决一个归一化已经解决掉的问题。
  • 24 bit 母带的采样率与抖动。 按混音的原生采样率交付;升采样什么也不增加,而 24 bit 的抖动远在任何能挺过分发链路的东西之下。
  • −23 LUFS 这个广播数值。 除非你交的是广播,R 128 不是你的规格。
  • 表头插件的牌子。 任何符合 BS.1770、带真峰值模式且过采样倍数足够的表,与另一台的差异都在零点几 LU 之内。读数不一致要去查门限或过采样的实现,不是查"质量"。

十、小结

用一台符合 BS.1770 的表在完成的母带上测整体响度。把真峰值上限设为 −1 dBTP,响过 −14 LUFS 则设为 −2 dBTP。用短时响度做平衡决定,整体响度只用于验收。记住整体响度的相对门限是在绝对门限后的平均值下方 10 LU,而 LRA 的门限是 20 LU。记住 BS.1770-5(2023 年 11 月)是现行版本,−4 只是大多数表还在引用的版本。记住向上归一化是真实存在的,但受余量限制——所以既不能指望它,也不能否认它。播放电平由服务决定,不由你决定;把原本要花在电平上的力气,花在听众还能听见的地方。

对唢呐、板鼓、大锣、琵琶扫弦这些东西来说,"听众还能听见的地方"就是那一下有没有真的响起来。

Mazufa 的发行是免费的:没有上传费、没有订阅费、没有单张发行费;唯一的扣除是所收到版税的 5%;每一份完整的申请都由人工审核。


来源

ITU-R BS.1770 —— 测量算法、K 计权、门限、真峰值

EBU —— 广播目标值、表头时间窗、响度范围

AES —— 流媒体建议

Spotify —— 已公布的归一化规范

未由服务方公布的部分。 文中给出的 Apple Music、YouTube Music、Amazon Music、TIDAL、Deezer 数值属于广泛流传的第三方测量结果;本文不为其提供一手来源,因为一手来源并不存在——这些服务没有公布任何归一化规范。抖音、快手、B 站、小红书等中文平台同样没有公布归一化规范,本文因此不引用任何相关数值。

其他技术参考

为从业者而写,直接取自原始标准,免费阅读。

打开这一主题的免费工具 →

检查已完成,接下来就发行吧。

文件准备好后,申请只需几分钟,并且由真人阅读。

提交审核

申请免费,不会创建账号;由真人审核并通过邮件回复。

其他免费工具

免费、无需账号、不上传任何内容。一切都在你的浏览器中运行。

在封面被退回之前先检查它
封面是发行被退回最常见的原因。把封面放进来,对照各平台公开的要求逐项检查,再看看它在人们真正会看到的尺寸下是什么样子。一切都在浏览器内运行——图片不会被上传。
用平台规则检查你的元数据
标题里的特邀艺人、括号里的版本信息、艺人栏里的搜索词——这些正是发行前那个周五送来的退回理由。把你准备提交的内容输入进来,现在就查清楚。一切都在浏览器内运行。
检查你的 ISRC 和条形码
有两组代码承载着你的收入:标识录音的 ISRC,和标识发行物的条形码。任何一个数字写错,版税就会流向别处。提交之前先粘贴进来核对一遍。
从发行日往回倒推
一次发行中错过的机会,多半是错过的截止日期,而不是欠缺才华。输入你想上线的日期,每一个步骤都会按它往回排出具体日子——包括那个错过就补不回来的推荐截止日。
在平台改动之前先检查你的母带
把你的混音放进来,用流媒体平台相同的方式测量整体响度、真峰值与响度范围,然后看到每个平台将要施加的确切增益。文件在浏览器内完成分析,不会离开你的设备。