Qué es realmente un máster inmersivo
No es un archivo estéreo con un efecto encima. Es un archivo multicanal en un contenedor BW64 — el formato wave de forma larga definido en la ITU-R BS.2088, que existe porque el formato wave original no puede superar los cuatro gigabytes — que lleva dos chunks adicionales. El chunk axml contiene los metadatos del Audio Definition Model en XML, definidos en la ITU-R BS.2076. El chunk chna asocia cada pista del archivo con un identificador de esos metadatos. Sin los dos chunks tienes un archivo wave multicanal corriente, y se rechazará como entrega inmersiva.
El bed y los objetos
El renderizador publicado admite hasta ciento veintiocho entradas. Las diez primeras son el bed: una configuración fija de canales, habitualmente siete punto uno punto dos. Todo lo que va de la entrada once en adelante es un objeto: un elemento mono o estéreo con metadatos de posición que lo mueven por la sala en lugar de asignarlo a un altavoz. Eso da hasta ciento dieciocho rutas de canal de objeto. No hay ningún límite publicado específico para música por debajo de esa cifra; el consejo de dejar la música en un bed y un par de docenas de objetos es convención de la práctica, no una regla.
Las cifras que publican los servicios
La guía de material de Apple indica que el loudness integrado de un máster inmersivo no debe superar menos dieciocho, medido según la ITU-R BS.1770, y que el true peak no debe superar menos un decibelio dBTP. Exige audio lineal de veinticuatro bits a cuarenta y ocho kilohercios, entregado como archivo BW64 con metadatos ADM. Exige además una versión estéreo conformada y sincronizada con la inmersiva. Fíjate en la redacción: esas cifras de loudness son un techo, no un objetivo de normalización, y la diferencia importa cuando decides cuánto apretar.
Convertir una mezcla estéreo no está permitido
Esta es la parte que más se vende y la que más sorprende. La guía publicada de Apple es explícita: los archivos inmersivos generados a partir de mezclas estéreo no están permitidos. Un máster inmersivo se construye desde la sesión multipista, por una persona, en un renderizador con licencia, decidiendo qué pertenece al bed y qué se convierte en objeto. Cualquier servicio que ofrezca convertir un máster estéreo terminado en uno inmersivo o está haciendo algo que la especificación prohíbe o está describiendo otra cosa.
Por qué el binaural es lo que casi todos van a oír
Muy pocos oyentes tienen un array de altavoces. La inmensa mayoría escucha música inmersiva con auriculares, mediante un render binaural. El formato lleva metadatos por elemento que describen cómo debe virtualizarse cada objeto en ese render, pero cuáles de esas instrucciones sobreviven depende de la vía de entrega, y en el mayor servicio de música el render de auriculares es el de la propia plataforma y no el que monitorizaste. La consecuencia práctica: comprueba tu mezcla con auriculares a través del servicio real antes de darla por terminada.
Lo que esta herramienta se niega a fingir
Lee las partes abiertas y publicadas del archivo: el contenedor definido por la ITU-R BS.2088 y el modelo de metadatos definido por la ITU-R BS.2076, ambas recomendaciones de acceso público. No renderiza. El algoritmo que convierte objetos en señales de altavoz es propietario y está licenciado, así que ningún navegador puede producir un render conforme, y una cifra de loudness sacada de una aproximación sin licencia no sería una medida válida de entrega. Tampoco codifica ni decodifica los códecs de difusión que transportan música inmersiva, que están patentados. Un validador que admite su límite es más útil que un renderizador que miente sobre el suyo.