Normalização de loudness para streaming: LUFS, K-weighting, os dois gates, LRA e true peak
Referência técnica para quem mixa e masteriza no Brasil.
Resposta curta
Feche o master com teto de true peak (pico real, medido em sinal superamostrado) em −1 dBTP — ou −2 dBTP se o master ficar mais alto que −14 LUFS — e deixe o loudness integrado cair onde a música mandar, em vez de espremer o limitador até bater num número. Se quiser uma referência publicada, a AES TD1008 recomenda −16 LUFS para música normalizada por faixa, e o Spotify normaliza a reprodução para −14 LUFS. Todo serviço grande abaixa os masters altos na hora de tocar: um master a −5 LUFS não toca mais alto que um a −14 LUFS, toca no mesmo nível e com menos dinâmica sobrando. Ou seja: limitar demais não compra volume, compra achatamento. A única exceção honesta é que a normalização para cima existe mas é limitada pela folga de pico (headroom) — um master muito baixo com picos altos pode não subir até o alvo. E, para o funk de paredão, existe uma resposta prática que não é um sermão: dois masters, um para o sistema de som e outro para o streaming.
1. A aritmética que decide tudo — com o funk carioca no centro
O argumento contra o "master estourado" não é estético. É conta.
Um serviço que normaliza a reprodução mede o loudness integrado da sua faixa, compara com o alvo dele e aplica um ganho fixo ao arquivo inteiro no momento da reprodução. Se o alvo do Spotify é −14 LUFS e o seu master mede −14 LUFS, o ganho aplicado é 0 dB. Se mede −8 LUFS, o ganho é −6 dB. Se mede −11 LUFS, o ganho é −3 dB. Não há negociação, não há análise artística, não há exceção por gênero.
O que um master de funk a −5 LUFS perde — conta fechada
O funk carioca é, provavelmente, a música mais alta do mundo em termos de masterização. Um beat de 150 BPM com um tamborzão gigante, voz gritada e montagem de tuia é rotineiramente entregue a −6, −5 ou até −4 LUFS integrados, porque o destino real dele é um paredão, uma equipe de som de baile e o alto-falante de um celular. Vamos fazer a conta com −5 LUFS.
Master A — o master de rua:
- Loudness integrado: −5 LUFS
- True peak: −1 dBTP
- PLR (peak-to-loudness ratio, relação pico–loudness): −1 − (−5) = 4 LU
Master B — o mesmo mix, masterizado com o limitador trabalhando menos:
- Loudness integrado: −11 LUFS
- True peak: −1 dBTP
- PLR: 10 LU
Agora toque os dois no Spotify, alvo −14 LUFS:
| Master A (−5 LUFS) | Master B (−11 LUFS) | |
|---|---|---|
| Ganho de normalização | −9 dB | −3 dB |
| Loudness na saída | −14 LUFS | −14 LUFS |
| Picos na saída | −10 dBTP | −4 dBTP |
| PLR que sobra | 4 LU | 10 LU |
Os dois tocam no mesmo volume. Exatamente o mesmo. O que muda é que o Master A chega no ouvido do ouvinte com 6 LU a menos de fator de crista — 6 dB de diferença entre o corpo da faixa e o ataque do tamborzão, que o limitador removeu e que nada na cadeia de reprodução devolve. O ganho de −9 dB não "descomprime" nada: ele abaixa tudo junto, achatado do jeito que estava.
E tem um detalhe de entrega que dobra o problema. O Spotify pede true peak abaixo de −1 dBTP e abaixo de −2 dBTP quando o master é mais alto que −14 LUFS — exatamente o caso do funk. Se você respeitar isso (e deve, porque o motivo é distorção no codec), o Master A sai com −2 dBTP e PLR de 3 LU, chegando ao ouvinte com picos em −11 dBTP.
A normalização transforma a guerra de loudness numa guerra de dinâmica que o master mais alto perde automaticamente. Não depende de gosto.
E, sendo honesto: o master alto está certo para o paredão
Aqui é onde a maior parte dos textos sobre loudness mente por omissão. O master de funk a −5 LUFS não é um erro técnico. Ele é uma decisão correta para o destino real dele:
- Paredão e equipe de som não normalizam nada. O arquivo sai de um pen drive ou de um celular, entra num processador, e o operador empurra o ganho até onde o sistema aguenta. Ali, densidade média é o que produz pressão sonora contínua no corpo de quem está na frente da caixa. Um master com PLR de 12 LU nesse contexto exige que o operador suba muito mais o ganho médio — e o limitador do processador do sistema, que é bem pior que o seu, vai fazer o trabalho por você, com resultado pior.
- Alto-falante de celular não reproduz nada abaixo de uns 500 Hz com autoridade. O que sobra é médio-agudo, e a densidade média é o que mantém a faixa audível no ônibus, na laje, no fone barato.
- WhatsApp, story, montagem — reprodução curta, alta, sem normalização confiável.
Então não existe "o funk está errado". Existe um master certo para cada cadeia de reprodução, e a cadeia do streaming é a única que devolve o ganho para você quando você não gasta ele.
A conclusão prática: dois masters, não um sermão
O fluxo que funciona de verdade, e que produtores de funk que trabalham com distribuição já usam:
- Master de rua / paredão. Do jeito que você já faz. −5 LUFS, densidade máxima, teto onde a equipe pede. Esse arquivo vai para pen drive, para DJ, para o baile.
- Master de streaming. O mesmo mix, com o limitador recuando de 4 a 6 dB. Alvo típico entre −9 e −7 LUFS integrados, teto −2 dBTP (porque ainda está acima de −14 LUFS), com o tamborzão e a voz mantendo transiente. Esse arquivo é o que sobe no distribuidor.
Custa uma renderização a mais e nenhuma discussão estética. Se você só puder ter um, tenha o de streaming com o teto correto: ele ainda funciona no paredão depois de o operador subir o ganho, enquanto o contrário não é verdade.
2. O que o LUFS mede de fato
LUFS significa Loudness Units relative to Full Scale. LKFS (Loudness, K-weighted, relative to Full Scale) é a mesma unidade com outro nome: documentos da ITU usam LKFS, documentos da EBU usam LUFS, e os números são idênticos.
LU tem o mesmo tamanho que dB — uma Loudness Unit é um decibel — mas LUFS é escala absoluta e LU é relativa. "+3 LU" e "+3 dB" significam a mesma variação; "−14 LUFS" e "−14 dB" não significam a mesma coisa.
A medição definida na ITU-R BS.1770 não é RMS e não é pico. É a média quadrática de um sinal filtrado, somada entre canais com peso por canal, e depois gateada no tempo. Três coisas a separam de um VU ou de um RMS: o filtro K-weighting, a soma de canais e o gating. O filtro e o gating são onde mora praticamente todo o mal-entendido.
K-weighting: dois estágios de filtro
O K-weighting é uma cascata de exatamente duas seções de segunda ordem aplicadas a cada canal antes de tirar a média quadrática.
Estágio 1 — o filtro "de cabeça" (head filter). Um high-shelf que levanta a parte alta do espectro (coeficientes publicados para 48 kHz: b0 = 1,53512485958697; b1 = −2,69169618940638; b2 = 1,19839281085285; a1 = −1,69065929318241; a2 = 0,73248077421585). Ele modela o efeito acústico de uma cabeça no campo sonoro — o sombreamento e a difração que tornam um ouvinte humano mais sensível a agudos vindos da frente do que um microfone nu seria.
Estágio 2 — o passa-altas RLB. Revised Low-frequency B-curve: um passa-altas que corta a base, refletindo que graves contribuem menos para o loudness percebido do que a energia deles sugere.
O ganho da curva K-weighting em 1 kHz é +0,698 dB (fator linear 1,0836). Não é constante arbitrária: cai naturalmente das respostas do shelf e do passa-altas naquela frequência. A consequência prática da cadeia toda: uma senoide de 1 kHz em fundo de escala aplicada a um canal de um par estéreo lê −3,01 LKFS, exatamente como a BS.1770-5 afirma — e o −3,01 vem da soma de um-de-dois-canais, não do filtro.
O que essa curva faz com a bateria de samba e pagode
Aqui a teoria vira consequência de estúdio, e no Brasil ela aparece o tempo todo numa levada de pagode ou numa bateria de escola.
A cozinha de percussão — surdo, tamborim, pandeiro, cuíca, agogô, repique, reco-reco — não é medida uniformemente pelo K-weighting:
- O surdo (primeira, segunda e terceira) vive entre uns 50 e 120 Hz de fundamental. É a coisa que mais move o corpo e é justamente onde o passa-altas RLB corta. Um surdo enorme, gordo, que faz a caixa do estúdio tremer, move o medidor de LUFS muito menos do que o engenheiro espera. Todo mundo já viveu isso: a mixagem "está gigante" e o integrado marca −16 LUFS.
- O tamborim e o agogô estão do lado oposto. Ataque curtíssimo, energia concentrada entre 2 e 8 kHz — exatamente a região que o head filter levanta. Eles pesam no medidor bem mais do que a impressão de "volume" deles no monitor sugere.
Resultado típico e previsível: o engenheiro olha o medidor, acha que a faixa está baixa por causa do surdo, e sobe o limitador. Quem paga a conta é o tamborim — porque é o transiente mais rápido e mais alto da mesa, é o primeiro elemento que o limitador agarra, e é o primeiro que borra. A levada perde o ping, o tamborim vira um "psh" difuso, o agogô perde a definição das duas alturas, e o samba perde a coisa que o define, que é a precisão rítmica do agudo sobre a sustentação do grave.
Regra prática para pagode e samba: se o tamborim começou a perder ataque, você já passou do ponto — pare, independentemente do que o medidor diz. O medidor não está errado; ele só está medindo uma coisa que não é a que você está tentando preservar.
Qual edição da BS.1770 vale
A BS.1770 tem seis edições: -0 (2006), -1 (2007), -2 (2011), -3 (2012), -4 (2015) e -5 (novembro de 2023).
A BS.1770-5 (11/2023) é a que está em vigor. A BS.1770-4 (10/2015) está superada — embora seja a edição que a maioria dos medidores instalados ainda cita na tela. Se o seu plugin diz "BS.1770-4", ele não está quebrado; está citando a edição anterior. Todo mecanismo descrito neste texto — os dois estágios de filtro, os blocos de 400 ms, os dois gates, o piso de 4× de oversampling — está verificado contra a BS.1770-5 publicada.
3. O mecanismo de gating, completo
O gating é a parte da norma mais frequentemente descrita errado, inclusive por fontes cuidadosas. O loudness integrado é uma medição com dois gates.
Passo 1: dividir o sinal em blocos
O sinal é dividido em blocos de 400 ms com 75% de sobreposição. Sobreposição de 75% num bloco de 400 ms significa que um bloco novo começa a cada 100 ms. Cada bloco recebe seu próprio valor de loudness K-weighted. A sobreposição não é enfeite: ela impede que um evento alto que cai em cima da fronteira entre dois blocos seja partido e subcontado — o que, numa faixa de percussão com ataques a cada 100–150 ms, aconteceria o tempo todo.
Passo 2: o gate absoluto
Todo bloco que mede abaixo de −70 LKFS é descartado e não participa mais da medição. Isso remove silêncio digital, cauda de fade, ruído de sala e os espaços entre faixas — de modo que uma música com trinta segundos de silêncio no fim não meça mais baixa que a mesma música cortada.
Passo 3: o gate relativo — a parte que quase sempre é dita errado
Calcule a média de loudness dos blocos que sobreviveram ao gate absoluto. Subtraia 10. Esse resultado é o limiar relativo. Descarte todo bloco abaixo dele. O loudness integrado é a média dos blocos que sobrevivem aos dois gates.
A distinção que se perde: o gate relativo fica 10 LU abaixo da média já gateada em −70 LKFS, e não 10 LU abaixo da média bruta do arquivo inteiro. A BS.1770-5 é explícita ao derivar o limiar relativo "subtraindo 10 do resultado" da medição com gate absoluto. Se você calcular a média sobre todos os blocos, incluindo os abaixo de −70 LKFS, obtém média menor, limiar menor, mais blocos silenciosos admitidos e um integrado que lê baixo demais — e o erro cresce com a quantidade de silêncio no arquivo. Essa é a causa número um de dois medidores discordarem sobre o mesmo arquivo.
O que isso significa na prática para uma faixa brasileira
A consequência audível do gate relativo de −10 LU vale ser internalizada: o loudness integrado da sua faixa é, na prática, a média das partes altas dela, não da faixa inteira.
Pense num choro que abre com trinta segundos de cavaquinho e violão sozinhos e depois entra o regional completo com flauta e pandeiro. Ou numa faixa de MPB que começa com voz e violão e abre para banda no último refrão. Nos dois casos, o integrado é decidido quase inteiramente pela parte cheia. Adicionar ou tirar uma introdução silenciosa quase não muda o número — e engenheiros que esperam que mude ficam surpresos.
Isso também explica por que aquela vinheta de dois segundos no começo do seu single não "salva" o integrado de nada, e por que colar um trecho baixinho no fim do arquivo é inútil como estratégia de medição.
4. Momentary, short-term, integrated: qual medidor, quando
Três janelas de tempo são padronizadas, e elas respondem a três perguntas diferentes. A EBU Tech 3341 define o comportamento dos medidores.
Momentary (M) — 400 ms, sem gate. A mesma janela do bloco de gating. O momentâneo acompanha eventos individuais: uma caixa, uma consoante da voz, o tempo forte do surdo. Use para pegar coisas — um bumbo que salta 6 LU acima de tudo em volta, um refrão que pula. Não use para decidir nível: ele é nervoso demais, e perseguir medidor momentâneo produz exatamente o resultado super-comprimido que a normalização pune.
Short-term (S) — 3 s, sem gate. Três segundos é mais ou menos uma frase musical — ou, num samba a 100 BPM, uns cinco compassos de percussão. O short-term é o medidor certo para decisões de balanço dentro da faixa, porque três segundos é a escala em que o ouvinte de fato percebe um trecho como alto ou baixo. Use para comparar estrofe com refrão, para checar se a passagem de cavaquinho não desaba, para ver o desenho do arranjo virar número.
Integrated (I) — programa inteiro, com os dois gates. Esse é o número contra o qual os serviços normalizam e o único que pertence a uma especificação de entrega. Meça do primeiro ao último sample, não de um trecho selecionado. O integrado é especificação de entrega, não ferramenta de mixagem; se você está olhando para ele enquanto trabalha, está olhando para o medidor errado.
Regra prática: mixe e masterize pelo short-term, verifique pelo integrado, investigue anomalia pelo momentâneo.
5. Loudness Range (LRA) e o gate de −20 LU
O Loudness Range, especificado na EBU Tech 3342, é um número único que descreve o quanto o loudness de uma faixa varia ao longo do tempo. Ele é calculado a partir da distribuição dos valores de loudness short-term (3 s): o LRA é a diferença entre as estimativas dos percentis 10 e 95 dessa distribuição — por isso extremos breves nas duas pontas não dominam o resultado.
O LRA tem gating próprio, e ele não é o mesmo do integrado. A Tech 3342 fixa o limiar relativo do LRA em −20 LU abaixo do nível de loudness com gate absoluto, não −10 LU. O gate mais largo é proposital: o LRA está tentando caracterizar variação, então precisa admitir as passagens quietas que a medição integrada foi feita justamente para excluir.
Isso é bug real, não teórico. Medidores que reaproveitam o gate relativo de −10 LU para o LRA reportam valores sistematicamente pequenos demais, porque jogaram fora exatamente o material quieto que constitui a faixa dinâmica. Se o seu medidor reporta um LRA visivelmente menor que outro no mesmo arquivo, a primeira suspeita é gate de −10 LU onde deveria estar −20 LU. Dá para testar: cole 20 segundos de material 15 LU abaixo do corpo da faixa. Numa implementação correta o LRA sobe bastante; numa quebrada, quase não se move.
Como orientação, e não como alvo: masters de funk, trap e pop denso caem tipicamente em 3–5 LU; um mix de banda bem controlado, em 6–9 LU; gravações acústicas e orquestrais, frequentemente acima de 12 LU. O LRA é descritivo. Perseguir um valor de LRA é tão equivocado quanto perseguir um valor de LUFS.
Choro e MPB: o polo dinâmico — o que a normalização faz por essas gravações
Se o funk é um extremo, o choro e a MPB de voz e violão são o outro, e é aqui que a normalização deixa de ser inimiga e vira aliada.
Pegue uma gravação de choro de regional — cavaquinho, violão de sete cordas, pandeiro e flauta — feita com microfones bem posicionados e com o limitador praticamente desligado. Uma gravação dessas tem LRA genuíno de 12 LU ou mais: a flauta descendo para um pianíssimo no fim de uma parte B e voltando com o regional inteiro no refrão é uma variação real de 12 a 15 LU. O mesmo vale para uma gravação de voz e violão de MPB, em que o cantor sussurra um verso e abre o peito no seguinte.
Antes da normalização, essa gravação era punida: colocada num rádio, num CD coletânea ou numa playlist ao lado de material comprimido, ela simplesmente soava baixa, e a reação comercial era mandar "levantar no master" — o que destruía exatamente o que fazia a gravação valer.
Sob normalização, a conta muda. Um master de choro a −17 LUFS integrados com true peak em −6 dBTP tem folga de 5 dB até o teto de −1 dBTP. O alvo do Spotify é −14 LUFS, faltam 3 dB, e há folga de pico suficiente para eles. A faixa toca no mesmo nível médio que o funk que discutimos antes — e chega com 12 LU de LRA intactos em vez de 4. A gravação dinâmica não é mais penalizada por ser dinâmica; ela passou a ser a única das duas que ainda tem alguma coisa para mostrar depois do ganho de reprodução.
Duas ressalvas honestas para quem grava choro e MPB:
- Deixe folga de pico de verdade. É a folga, não o loudness baixo, que permite que a normalização para cima funcione (seção 7). Um master a −18 LUFS com picos em −0,3 dBTP é o pior dos dois mundos: baixo e sem espaço para subir.
- A normalização é desligável. Quem ouve com normalização desativada, ou em software de DJ, ou num arquivo baixado tocando no aux do carro, vai ouvir a faixa baixa mesmo. Isso não é motivo para achatar; é motivo para não masterizar a −24 LUFS "porque vão subir".
6. True peak contra sample peak
A diferença
Um medidor de sample peak (pico de amostra) reporta o maior valor absoluto de amostra do arquivo. Isso não é o maior valor que o sinal alcança: amostras são pontos sobre uma forma de onda contínua, e a onda entre duas amostras pode subir acima das duas. A forma de onda analógica reconstruída pode ultrapassar a maior amostra do arquivo, e um medidor de sample peak é estruturalmente incapaz de ver isso. Essas excursões são os inter-sample peaks (picos entre amostras); o nível da onda reconstruída é o true peak, em dBTP.
Um arquivo digitalmente "seguro", com amostras parando em −0,1 dBFS, pode ter true peaks bem acima de 0 dBTP. Nada está clipado no arquivo. Tudo que reconstrói a onda depois — um DAC, um conversor de taxa de amostragem, um decodificador lossy — pode clipar.
Tamborim e agogô: os campeões brasileiros de inter-sample peak
Inter-sample peak é um fenômeno de transiente rápido com energia em alta frequência. Quanto mais curto e mais agudo o ataque, mais a onda reconstruída pode disparar entre duas amostras. Isso descreve, com precisão quase cômica, dois instrumentos:
- Tamborim — pele tensa, baqueta de varetas, ataque com energia forte de 3 a 8 kHz e decaimento quase inexistente. É o transiente mais afiado de uma bateria de samba.
- Agogô — metal batido com metal, com parciais bem acima de 5 kHz e ataque abrupto.
Junte a isso o que vimos na seção 2: são exatamente os instrumentos que o head filter do K-weighting levanta. Ou seja, tamborim e agogô simultaneamente (a) pesam no medidor de loudness, (b) geram os maiores inter-sample peaks da mixagem e (c) são os primeiros elementos que qualquer limitador agarra.
Consequência concreta e verificável no seu próprio arquivo: um master de pagode com sample peak em −0,2 dBFS pode facilmente medir acima de 0 dBTP em true peak, com os disparos coincidindo com os ataques de tamborim. Quando esse arquivo é codificado em AAC ou Ogg Vorbis e decodificado no celular do ouvinte, é ali — no tamborim — que aparece a distorção. Não é "o master está sujo"; é um ataque específico clipando no decoder.
Por que o oversampling é obrigatório
Para ver um true peak você precisa reconstruir a onda entre as amostras. A BS.1770 especifica fazer isso por superamostragem: mínimo de 4× em 48 kHz, e a recomendação observa que taxas e razões de superamostragem maiores são preferíveis. 4× é o piso de conformidade, não a resposta exata: nele a medição ainda pode subestimar picos reais por alguns décimos de dB. Use 8× ou 16× se o seu medidor oferecer — o custo de CPU é irrelevante e a diferença de precisão não é. Um medidor sem modo explícito de true peak / dBTP é um medidor de sample peak, diga o que disser o manual.
Por que codificação lossy levanta os picos
Um codec com perdas — AAC, Ogg Vorbis, MP3 — não reproduz a onda amostra por amostra. Ele reproduz uma onda perceptualmente parecida, e a saída do decodificador rotineiramente ultrapassa a entrada do codificador. O excesso não é defeito: é consequência inevitável de quantizar e descartar detalhe espectral, e ele escala com o quanto a fonte foi limitada. Um master exatamente em 0,0 dBTP decodifica com picos acima de 0 dBFS, e o decodificador clipa.
Toda especificação pública que trata disso diz a mesma coisa. AES TD1008: "For all content, it is recommended that the Maximum True Peak level not exceed −1 dBTP at the codec input of lossy-encoded streams." Spotify: mantenha o true peak "below −1dB TP (True Peak) max", e para masters mais altos que −14 LUFS, "keep True Peak below −2dB to avoid extra distortion."
Que teto usar de verdade
Ajuste o teto do seu limitador, em modo true peak, para −1,0 dBTP em masters normais, e −2,0 dBTP se o master for mais alto que −14 LUFS integrados. Não é margem supersticiosa: os dois valores são exigências publicadas pelas fontes acima, e o segundo existe justamente porque material mais limitado dispara mais no codec. Como praticamente todo master de funk, trap nacional e sertanejo universitário fica acima de −14 LUFS, −2 dBTP é o teto correto para esses gêneros, não −0,1.
Dois rodapés. Um teto de −0,1 dBTP é erro de entrega para streaming, não escolha estética. E um limitador ajustado em −1,0 precisa mesmo estar em modo true peak: em muitos plugins o controle de teto é sample peak, e ajustá-lo em −1,0 entrega inter-sample peaks acima de −0,5 dBTP.
Se você quiser conferir um arquivo pronto, a mazufa.com tem um verificador gratuito de loudness e true peak que roda inteiramente no navegador, no seu próprio aparelho, e não faz upload de áudio.
7. O que cada serviço realmente publica
A diferença entre publicado e amplamente reportado é a coisa mais importante desta seção, e quase nenhum artigo sobre o assunto a mantém.
Especificações publicadas
Spotify. Alvo: −14 LUFS integrados. O Spotify afirma ajustar as faixas "to −14 dB LUFS" e medir "according to the ITU 1770 standard". Teto de true peak: abaixo de −1 dBTP; abaixo de −2 dBTP para masters mais altos que −14 LUFS. O Spotify também afirma que "positive gain is applied to softer masters so the loudness level is −14 dB LUFS", com a ressalva de folga: "We consider the headroom of the track, and leave 1 dB headroom for lossy encodings to preserve audio quality." Sobre normalização de álbum, o Spotify observa que o álbum é normalizado como unidade, de modo que "the softer tracks are as soft as you intend them to be" — as relações de nível entre as faixas de um álbum são preservadas.
EBU R 128. Alvo: −23 LUFS. Isso é recomendação de radiodifusão, não alvo de música em streaming, e está aqui porque é rotineiramente mal aplicada: um master de música a −23 LUFS não é "mais conforme" com nada e — porque a normalização para cima é limitada pela folga de pico — pode acabar tocando mais baixo do que você pretendia.
AES TD1008 (Recommendations for Loudness of Internet Audio Streaming and On-Demand Distribution). É o documento público mais útil para músicos, e o mais mal citado.
- Música normalizada por faixa: −16 LUFS, tolerância +0,2 LU.
- Normalização de álbum, faixa mais alta: −14 LUFS, tolerância +0,2 LU.
- Conteúdo falado (podcast, jornalismo, dramaturgia): −18 LUFS, tolerância +1 LU, medido como loudness integrado de diálogo.
- True peak máximo: −1 dBTP na entrada do codec para streams com codificação lossy.
O valor de −18 LUFS na TD1008 é o alvo de conteúdo falado — e citá-lo como alvo de música é um erro comum e grave. O número para música é −16 LUFS. Se você vir −18 LUFS apresentado como recomendação da AES para música, a fonte leu o documento errado.
A TD1008 também faz um argumento explícito sobre dinâmica que vale citar: "A recording with high peak to loudness ratio (PLR) is often perceived as clearer and less fatiguing than one that has been excessively peak-limited."
Serviços que não publicam alvo de normalização
Apple Music, YouTube Music, Amazon Music, TIDAL e Deezer não publicam alvo de normalização. Eles normalizam — isso é observável — mas o valor específico não é especificação publicada, e qualquer artigo que apresente um deles como spec está apresentando uma medição ou uma inferência como se fosse documento.
Os números que circulam são: Apple ≈ −16 LUFS, YouTube Music ≈ −14 LUFS, Amazon Music ≈ −14 LUFS, TIDAL ≈ −14 LUFS, Deezer ≈ −15 LUFS.
Amplamente reportado, não publicado pelo serviço. Trate esses valores como observações de terceiros sobre um alvo móvel, não como especificação. Eles vêm de medição independente, mudaram ao longo do tempo, e nenhum serviço se comprometeu com eles. Não calcule um ganho de reprodução esperado a partir deles e não masterize para um deles.
A consequência prática é menor do que parece: todos os valores reportados ficam entre −16 e −14 LUFS, uma dispersão de 2 LU. Nenhum master merece ser refeito por causa de 2 LU.
Normalização para cima: a conta honesta
Essa é a parte em que praticamente toda cartilha em português erra, nas duas direções.
Está errado dizer "masters baixos não são levantados". O Spotify diz explicitamente que aplica ganho positivo a masters mais baixos.
Está igualmente errado dizer "masters baixos são sempre levantados até o alvo". O Spotify condiciona: ele considera a folga de pico da faixa e deixa 1 dB de folga para a codificação lossy.
Juntando as duas afirmações, o princípio é: o ganho para cima é limitado pela folga de pico disponível. Uma ilustração do princípio, com o teto de −1 dBTP como referência de folga (o algoritmo exato não é publicado — a aritmética abaixo é uma ilustração do mecanismo descrito, não uma especificação do serviço):
| Caso | Integrado | True peak | Ganho desejado até −14 | Folga até −1 dBTP | Resultado plausível |
|---|---|---|---|---|---|
| MPB, voz e violão, bem entregue | −18 LUFS | −6,0 dBTP | +4 dB | 5,0 dB | sobe os 4 dB inteiros |
| Choro sem folga | −19 LUFS | −1,5 dBTP | +5 dB | 0,5 dB | sobe pouco; toca bem abaixo do alvo |
| Sertanejo já alto | −8 LUFS | −1,0 dBTP | −6 dB | — | desce 6 dB, sempre |
A lição para quem grava acústico no Brasil é direta e nada intuitiva: não é o loudness baixo que impede a subida, é a falta de folga de pico. Um master de choro a −18 LUFS com picos em −6 dBTP está numa posição excelente. O mesmo −18 LUFS com picos raspando em −0,2 dBTP está numa posição ruim — baixo e sem espaço. Se você masteriza material dinâmico, cuide do pico antes de cuidar do número.
8. A realidade do home studio brasileiro
Vale dizer a parte que os documentos técnicos não dizem, porque ela explica por que tanta gente boa toma a decisão errada.
O julgamento acontece no celular e no YouTube
A maior parte da música lançada no Brasil hoje é masterizada em quarto, com monitoramento de fone, e o teste final é sempre o mesmo: manda no WhatsApp, escuta no alto-falante do celular, sobe no YouTube e compara com a concorrência.
Os três testes empurram na mesma direção — a errada:
Alto-falante de celular. Não reproduz grave. O que sobrevive é médio e agudo, e a impressão de "cheio" vem de densidade média, não de dinâmica. Um master achatado soa melhor nesse alto-falante que um master dinâmico. Se o seu critério é o celular, você vai comprimir demais, sempre.
Comparar no YouTube. O YouTube normaliza, mas não publica alvo (ver seção 7), e a normalização não se aplica de forma idêntica em todo lugar e toda hora — em alguns contextos de reprodução ela não entra. Então às vezes a comparação parece confirmar que "o master mais alto ganha", e o produtor conclui a coisa errada a partir de uma observação verdadeira.
Comparar de ouvido sem igualar o nível. O mais alto sempre parece melhor nos primeiros dez segundos. Isso é psicoacústica básica e não tem nada a ver com qualidade. Toda comparação A/B de master feita sem igualar o loudness integrado dos dois arquivos é inválida. Iguale pelo integrado — não pelo pico — antes de decidir qualquer coisa.
A correção é barata: faça a comparação no short-term com os dois arquivos igualados em loudness, e faça o teste do celular depois de decidir, para checar tradução, não para decidir dinâmica.
Sertanejo universitário e a competição de loudness nas playlists
O sertanejo universitário consolidou uma convenção de produção bastante fechada: violão de aço e viola caipira dobrados e brilhantes, bateria de gênero com caixa muito à frente, baixo curto, voz duplicada e centralizada com automação apertada, coro largo no refrão, e um master denso — comumente entre −9 e −7 LUFS, às vezes mais alto. Some a isso a estética de gravação "ao vivo em estúdio" e a presença de plateia, que já vem com muita sustentação e pouca variação dinâmica de origem.
O que acontece nas playlists brasileiras é uma corrida: a faixa do artista A entra numa playlist ao lado da do artista B, alguém do time percebe que "a nossa parece mais fraca", e a ordem que chega ao mastering é "levanta". O ciclo se repete. Mas, numa playlist, a normalização por faixa está ligada por padrão — que é exatamente o contexto em que o nível não é mais variável competitiva. Duas faixas a −8 e a −12 LUFS tocam no mesmo nível na sequência da playlist; a diferença perceptível vem do arranjo, do transiente da caixa, do contraste entre estrofe e refrão e do peso de médio-grave — não do número no medidor.
Se você produz sertanejo e quer ganhar essa competição de fato, a alavanca não é o limitador. É abrir o refrão em relação à estrofe (2 a 4 LU de short-term já são muito audíveis) e deixar a caixa e o ataque do violão respirarem, porque isso sobrevive intacto a um ganho de reprodução de −6 dB, e a densidade média não sobrevive a nada.
O mesmo raciocínio vale, com números diferentes, para arrocha, piseiro e trap nacional — todos gêneros com convenção de master alto e distribuição majoritariamente em serviços que normalizam.
9. Guia prático
Como decidir o alvo
Trabalhe de trás para frente a partir da música, não para frente a partir de um número.
- Fixe o teto primeiro. −1 dBTP, em true peak, com oversampling. É a única restrição genuinamente dura da lista. Se o master vai ficar acima de −14 LUFS (funk, trap, sertanejo, piseiro), use −2 dBTP.
- Masterize para a música. Acerte balanço, timbre e dinâmica com o limitador fazendo o mínimo. Não olhe para o integrado nessa etapa.
- Meça o resultado. O integrado que apareceu é o seu candidato.
- Confira a faixa dinâmica. Se o integrado ficou entre −14 e −9 LUFS, você está dentro da região onde todos os alvos publicados e todos os valores reportados ficam a poucos LU de distância, e nenhum serviço vai fazer nada dramático com a sua faixa. Se ficou acima de −9 LUFS, pergunte o que o limitador comprou — porque a normalização vai devolver o nível.
- Só então considere ajustar, e ajuste mudando a masterização, não adicionando limitação.
Perseguir um número de LUFS empilhando limitador até o medidor bater é exatamente o comportamento que a normalização foi feita para tornar inútil.
Gênero importa de um jeito que um número único não captura. Funk, trap, piseiro e pop denso caem naturalmente entre −10 e −7 LUFS porque o material é sustentado; choro, MPB acústica, samba de raiz bem gravado e jazz caem entre −18 e −13 LUFS porque não é. Os dois estão certos. O erro é um choro limitado a −8 LUFS, não um choro medindo −16 LUFS.
Se o master já está limitado
Você tem um master pronto, muito limitado, e acabou de ler o acima. Três opções honestas, em ordem de preferência:
Refaça a partir do mix. É a única correção real. Limitação de pico não é reversível: os transientes removidos não estão no arquivo. Se você tem o mix, recue o limitador e renderize de novo.
Baixe só o teto. Se você só tem o master e o true peak dele está acima de −1 dBTP, aplique limitação true peak (ou redução de ganho) até −1 dBTP — ou −2 dBTP se estiver acima de −14 LUFS — e pare por aí. Isso corrige o erro de entrega sem fingir corrigir a dinâmica.
Não faça nada. Um master a −8 LUFS com teto em −2 dBTP não está quebrado. Ele toca no mesmo nível que todo o resto, um pouco mais achatado do que poderia — custo real, mas menor que o de uma remasterização apressada. Limitar demais é oportunidade perdida, não defeito: o arquivo toca, só não toca tão bem quanto poderia.
Dinâmica e nível são coisas separadas
Mantenha os dois separados na cabeça, porque a confusão entre eles é a origem da maioria das decisões ruins.
Nível é onde a faixa inteira senta. É um número, é ajustado por um fader, é de graça, e sob normalização quem escolhe é o serviço, não você.
Dinâmica é a relação entre partes altas e baixas, tanto instante a instante (fator de crista, PLR) quanto trecho a trecho (LRA). Custa alguma coisa para ser criada, é destruída pelo limitador e não pode ser restaurada depois.
Você não compete mais em nível — o serviço define isso — então cada decibel gasto em nível sai de um orçamento que o ouvinte nunca vê. A normalização não tirou a sua capacidade de fazer um disco que soa grande. Ela tirou a capacidade de fazer isso sendo alto. Intensidade percebida agora vem de densidade de arranjo, contraste de transiente, peso de médio-grave e do tamanho do salto entre seções — coisas que sobrevivem intactas a um ganho de reprodução de −9 dB.
O que genuinamente não importa
- Bater o alvo de LUFS na casa decimal. Nada arredonda, nada reprova, e a diferença entre −14,0 e −13,4 LUFS é inaudível. ±1 LU é tolerância generosa.
- Masters diferentes por serviço de streaming. Os alvos publicados e reportados cobrem cerca de 2 LU. Um master a −1 dBTP com dinâmica sensata está certo em todos. (Master separado para paredão é outra história — ali a cadeia de reprodução é realmente diferente, e aí sim faz sentido.)
- Taxa de amostragem e dither num master de 24 bits. Entregue na taxa nativa do mix; fazer upsampling não acrescenta nada, e dither de 24 bits fica muito abaixo de qualquer coisa que sobreviva à distribuição.
- O número de −23 LUFS de radiodifusão. A menos que você esteja entregando para TV ou rádio, a R 128 não é a sua especificação.
- A marca do plugin de medição. Qualquer medidor conforme à BS.1770 com modo true peak e oversampling adequado concorda com qualquer outro dentro de uma fração de LU. Discordâncias vêm de implementação de gating ou de oversampling, não de qualidade.
10. Resumo
Meça o loudness integrado do master pronto com um medidor conforme à BS.1770 (a edição em vigor é a -5, de novembro de 2023; a -4 está superada, mesmo que seu plugin ainda a cite). Fixe o teto de true peak em −1 dBTP, ou −2 dBTP se estiver acima de −14 LUFS. Use short-term para decisões de balanço e integrado só para verificação. Lembre que o gate relativo do integrado é −10 LU abaixo da média já gateada em −70 LKFS, e que o do LRA é −20 LU. Se você faz funk, mantenha o master de rua para o paredão e entregue um segundo master, 4 a 6 dB mais aberto, para o streaming. Se você faz choro ou MPB, deixe folga de pico de verdade e deixe o LRA em paz. Em todos os casos: o serviço define o nível de reprodução — gaste no que o ouvinte ainda pode ouvir.
A Mazufa distribui música sem taxa de upload, sem assinatura e sem cobrança por lançamento; a única dedução é 5% dos royalties recebidos, e toda inscrição completa passa por revisão humana.
Fontes
ITU-R BS.1770 — algoritmo de medição, K-weighting, gating, true peak
- Recomendação ITU-R BS.1770-5 (11/2023), Algorithms to measure audio programme loudness and true-peak audio level (PDF completo): https://www.itu.int/dms_pubrec/itu-r/rec/bs/R-REC-BS.1770-5-202311-I!!PDF-E.pdf
- Página da recomendação e histórico de edições (BS.1770-0 a BS.1770-5): https://www.itu.int/rec/R-REC-BS.1770/en
EBU — alvo de radiodifusão, janelas de medição, Loudness Range
- EBU R 128, Loudness normalisation and permitted maximum level of audio signals (−23 LUFS): https://tech.ebu.ch/publications/r128
- EBU Tech 3341, Loudness Metering: EBU Mode metering to supplement EBU R 128 (momentary 400 ms, short-term 3 s): https://tech.ebu.ch/publications/tech3341
- EBU Tech 3342, Loudness Range: A measure to supplement EBU R 128 loudness normalisation (gate de −20 LU; percentis 10/95), PDF: https://tech.ebu.ch/docs/tech/tech3342.pdf
AES — recomendações para streaming
- AES TD1008.1.21-9, Recommendations for Loudness of Internet Audio Streaming and On-Demand Distribution (−16 LUFS música, −14 LUFS álbum, −18 LUFS conteúdo falado, −1 dBTP), PDF: https://aes2.org/wp-content/uploads/2024/01/20210924_TD1008_v3.13.pdf
- Página do documento AES TD1008: https://aes.org/technical-council/technical-document-aestd1008/
Spotify — especificação de normalização publicada
- Spotify for Artists, Loudness normalization (−14 LUFS; −1 dBTP / −2 dBTP; ganho positivo e folga de pico; normalização de álbum): https://support.spotify.com/us/artists/article/loudness-normalization/
Não publicado por nenhum serviço. Os valores citados para Apple Music, YouTube Music, Amazon Music, TIDAL e Deezer são medições de terceiros amplamente reportadas. Nenhuma fonte primária é citada para eles porque nenhuma existe: esses serviços não publicam especificação de normalização.