El enmascaramiento auditivo: por qué un sonido tapa a otro
En resumen
Hay enmascaramiento cuando un sonido deja de oírse, o se oye peor, porque suena otro. Es máximo cuando los dos caen en la misma banda crítica de la cóclea, y se extiende mucho más hacia los agudos que hacia los graves, sobre todo a niveles altos. También actúa en el tiempo, justo antes y después de un sonido fuerte. Los códecs como el MP3 o el AAC eliminan lo que queda enmascarado.
En un ensayo de orquesta, la flauta toca un solo precioso en el registro grave. En el papel está todo correcto. Pero en cuanto entran las trompas en mezzoforte, la flauta desaparece: sigue tocando, el sonido sigue llegando a tu oído, y sin embargo no la oyes. El director pide a las trompas que bajen, o el compositor tendrá que revisar la orquestación. Ese fenómeno tiene nombre: enmascaramiento.
Escucha estos tres sonidos. El primero es un tono puro de 1000 Hz. El segundo, un tono de 1100 Hz con unas tres veces más amplitud (unos 10 dB más). El tercero, los dos a la vez. Intenta seguir el tono de 1000 Hz dentro del tercero:
En el tercero no oyes dos notas: oyes un sonido áspero, rugoso, con la altura del tono fuerte. El tono de 1000 Hz ha perdido su identidad. Los dos caen en la misma banda crítica de la cóclea y el más fuerte domina.
Qué es el enmascaramiento
El enmascaramiento es la reducción de la audibilidad de un sonido (la señal) causada por otro sonido (el enmascarador). Se mide en decibelios, como el aumento del umbral de audición de la señal: si un tono de 1000 Hz se oía a partir de 3 dB en silencio y con ruido hace falta que llegue a 43 dB, hay 40 dB de enmascaramiento.
Hay dos grandes tipos:
- Simultáneo: enmascarador y señal suenan a la vez. Depende sobre todo de su separación en frecuencia.
- Temporal: no suenan a la vez, pero están muy próximos en el tiempo.
No hay que confundirlo con la suma de niveles que viste en los decibelios: allí un sonido 10 dB más débil apenas cambiaba el nivel total. Aquí la pregunta es otra: si lo oyes o no.
El enmascaramiento simultáneo
Las curvas de enmascaramiento
Los primeros en medirlo con detalle fueron R. L. Wegel y C. E. Lane, en los laboratorios Bell, en 1924. Ponían un tono enmascarador fijo y buscaban el umbral de un segundo tono a distintas frecuencias. El resultado son las curvas de enmascaramiento, con tres rasgos fundamentales:
- El enmascaramiento es máximo cerca de la frecuencia del enmascarador y cae al alejarse.
- Es asimétrico: se extiende mucho más hacia los agudos que hacia los graves.
- La asimetría crece con el nivel: cuanto más fuerte es el enmascarador, más ancha es su «sombra» hacia arriba.
A este tercer efecto se le llama en inglés upward spread of masking, el ensanchamiento hacia los agudos.
Por qué los graves tapan a los agudos
La explicación está en la membrana basilar. La vibración entra por la base, donde se analizan los agudos, y avanza como una onda viajera hasta el punto de su frecuencia, donde se apaga enseguida. Un sonido grave recorre, por tanto, toda la zona de los agudos antes de llegar a su sitio, y la excita. Un sonido agudo, en cambio, se apaga antes de llegar a la zona de los graves.
Un modelo sencillo (Terhardt, 1979) describe cómo decae la excitación de un tono a medida que nos alejamos de él, en decibelios por Bark (la unidad de banda crítica, que verás enseguida):
| Enmascarador | Hacia los graves | Hacia los agudos |
|---|---|---|
| 1000 Hz a 40 dB | 27 dB/Bark | 16 dB/Bark |
| 1000 Hz a 60 dB | 27 dB/Bark | 12 dB/Bark |
| 1000 Hz a 80 dB | 27 dB/Bark | 8 dB/Bark |
Hacia los graves, la pendiente es fuerte y fija. Hacia los agudos, es suave y se suaviza más cuanto más fuerte es el sonido. Con este modelo, un tono de 500 Hz a 80 dB todavía produce, a 1000 Hz (casi 4 Bark más arriba), una excitación de unos 48 dB: puede tapar un sonido débil. Un tono de 1000 Hz a 80 dB, en cambio, no deja rastro a 500 Hz.
Escucha la asimetría. En los dos ejemplos hay un tono fuerte y otro débil a la misma distancia:
A volumen alto, el tono débil suele resultar más difícil de seguir en el primer caso, cuando queda por encima del fuerte. A volumen moderado la diferencia es sutil.
Bandas críticas y escala Bark
En 1940, Harvey Fletcher propuso que el oído se comporta como un banco de filtros solapados. Solo el ruido que cae dentro del filtro de la señal contribuye a enmascararla. Al ancho de cada filtro lo llamó banda crítica. Es la misma banda crítica que explica la aspereza de los intervalos en consonancia y disonancia.
Eberhard Zwicker (1961) dividió el rango audible en 24 bandas críticas consecutivas y llamó Bark a la unidad de esa escala, en honor a Heinrich Barkhausen. Una fórmula de uso habitual (Zwicker y Terhardt, 1980) da el ancho de la banda crítica y la posición en Bark:
donde es la frecuencia central (Hz), el ancho de banda (Hz) y la posición en Bark. Más tarde, Brian Glasberg y Brian Moore (1990) propusieron otra medida, el ancho de banda rectangular equivalente (ERB), algo más estrecha en el grave:
| Frecuencia | Banda crítica (Zwicker) | Posición (Bark) | ERB (Glasberg y Moore) |
|---|---|---|---|
| 100 Hz | 101 Hz | 1,0 | 35 Hz |
| 500 Hz | 117 Hz | 4,7 | 79 Hz |
| 1000 Hz | 162 Hz | 8,5 | 133 Hz |
| 2000 Hz | 301 Hz | 13,1 | 241 Hz |
| 4000 Hz | 685 Hz | 17,3 | 456 Hz |
| 8000 Hz | 1706 Hz | 21,3 | 888 Hz |
Por debajo de unos 500 Hz, la banda crítica mide unos 100 Hz; por encima, crece hasta rondar el 20 % de la frecuencia, algo más que una tercera menor. En el ejemplo inicial, 1000 y 1100 Hz están separados 0,6 Bark: bien dentro de la misma banda.
El enmascaramiento temporal
El enmascaramiento no se limita a los sonidos simultáneos:
- Postenmascaramiento (forward masking): un sonido fuerte enmascara lo que suena después de él durante unos 100-200 ms. El efecto es intenso en los primeros milisegundos y va disminuyendo.
- Preenmascaramiento (backward masking): un sonido fuerte enmascara también lo que sonó justo antes, pero solo durante unos pocos milisegundos (hasta unos 20 ms). Parece imposible, pero tiene explicación: un sonido fuerte se procesa más deprisa en la vía auditiva y «adelanta» al débil.
En música, el postenmascaramiento explica que una nota débil justo después de un golpe de platos o de un acorde en sforzando se pierda, aunque esté escrita. Y también ayuda a entender por qué la reverberación de una sala tapa los detalles rápidos, como se explica en el tiempo de reverberación.
El enmascaramiento en la orquestación
Muchos principios clásicos de la orquestación son enmascaramiento aplicado:
- Los graves fuertes tapan a los agudos, no al revés. Unas trompas o unos trombones en el registro medio-grave pueden anular una flauta o un clarinete que tocan por encima en el mismo ámbito. Un flautín, en cambio, apenas tapa a los contrabajos.
- Instrumentos en el mismo registro compiten. Si un solista toca en la misma zona de frecuencias que el acompañamiento, sus armónicos caen en las mismas bandas críticas. Por eso los compositores dejan un hueco de registro para la melodía o aligeran el acompañamiento cuando entra el solista.
- El solista busca frecuencias libres. Un cantante lírico se oye sobre una orquesta gracias al formante del cantante, una concentración de energía hacia los 2500-3000 Hz donde la orquesta es más débil. Lo tienes explicado en la voz humana. En un concierto para violín, la escritura del solista en el registro agudo cumple la misma función.
- La dinámica no es absoluta. Un piano de trompa y un piano de flauta no son iguales. Si varias secciones comparten un mismo matiz, las más potentes y las más graves dominarán.
El enmascaramiento en la mezcla y en los códecs
En el estudio
Un técnico de mezcla lucha contra el enmascaramiento todo el tiempo. El bombo y el bajo eléctrico compiten en los graves; las guitarras, el piano y la voz, en los medios. Las herramientas son las mismas ideas de la orquestación: ecualizar para dejar a cada instrumento su propia zona del espectro, repartir los instrumentos en el panorama estéreo y reducir el nivel de un instrumento cuando suena otro (por ejemplo, con compresión por cadena lateral o sidechain).
El panorama funciona porque el enmascaramiento es menor cuando la señal y el enmascarador llegan a los oídos con diferencias de tiempo o de fase. El cerebro compara los dos oídos y consigue separar lo que viene de sitios distintos.
Los códecs perceptivos: MP3 y AAC
Un CD guarda el audio sin comprimir: 44 100 muestras por segundo, 16 bits por muestra y dos canales. Eso da:
donde es la tasa de bits. Un MP3 a 128 kbit/s ocupa unas 11 veces menos, y a oídos de la mayoría de oyentes suena parecido. La clave es el enmascaramiento. El codificador:
- Divide la señal en bandas de frecuencia y en bloques de tiempo muy cortos.
- Aplica un modelo psicoacústico que calcula, en cada bloque, el umbral enmascarado: lo que no se oiría por culpa de los componentes más fuertes y del umbral de audición.
- Reparte los bits de forma que el ruido de cuantificación quede por debajo de ese umbral en cada banda. Lo que está totalmente enmascarado apenas recibe bits.
El MP3 (formalmente, MPEG-1 Audio Layer III) se desarrolló sobre todo en el Instituto Fraunhofer de Alemania, con Karlheinz Brandenburg como una de sus figuras principales, y se normalizó en ISO/IEC 11172-3 (1993). El AAC, su sucesor, se normalizó en MPEG-2 (1997) y es el formato de muchas plataformas de streaming y de vídeo.
Un tono de señal y un enmascarador (tono o ruido de banda estrecha) con frecuencia y nivel ajustables, para encontrar tu umbral enmascarado y ver la asimetría hacia los agudos.
Ejercicios
Ejercicio 1. En silencio, un oyente detecta un tono de 2000 Hz a partir de 0 dB. Con un ruido de fondo, necesita que el tono llegue a 35 dB. ¿Cuánto enmascaramiento produce el ruido?
Ver solución
El enmascaramiento es el aumento del umbral: dB.
Ejercicio 2. Con la fórmula de Zwicker, calcula el ancho de la banda crítica a 1000 Hz. ¿Están 1000 y 1100 Hz dentro de la misma banda? ¿Y 1000 y 1250 Hz?
Ver solución
La separación de 100 Hz queda dentro de una banda crítica. La de 250 Hz la supera: los tonos se enmascaran menos y se oyen como dos sonidos.
Ejercicio 3. Un trombón toca un Fa3 (174,61 Hz) en forte y una flauta un Fa5 (698,46 Hz) en piano. ¿Quién tiene más riesgo de quedar tapado? Razónalo.
Ver solución
La flauta. Los armónicos del trombón llegan con mucha energía a la zona de la flauta (el 4.º armónico del Fa3, 698,44 Hz, coincide prácticamente con la nota de la flauta), y además el enmascaramiento se extiende hacia los agudos y aumenta con el nivel. La flauta, más aguda y más débil, apenas afecta a la región del trombón.
Ejercicio 4. Un archivo de audio de 4 minutos ocupa en calidad CD unos 42 MB. ¿Cuánto ocuparía en MP3 a 128 kbit/s y a 320 kbit/s?
Ver solución
A 128 kbit/s: bytes, unos 3,8 MB (11 veces menos). A 320 kbit/s: bytes, unos 9,6 MB (4,4 veces menos).
Fuentes y bibliografía
- Zwicker, E. y Fastl, H. (2007). Psychoacoustics: Facts and Models (3.ª ed.). Berlín: Springer.
- Moore, B. C. J. (2012). An Introduction to the Psychology of Hearing (6.ª ed.). Bingley: Emerald.
- Wegel, R. L. y Lane, C. E. (1924). «The auditory masking of one pure tone by another and its probable relation to the dynamics of the inner ear». Physical Review, 23(2), 266-285.
- Fletcher, H. (1940). «Auditory patterns». Reviews of Modern Physics, 12(1), 47-65.
- Zwicker, E. (1961). «Subdivision of the audible frequency range into critical bands (Frequenzgruppen)». The Journal of the Acoustical Society of America, 33(2), 248.
- Zwicker, E. y Terhardt, E. (1980). «Analytical expressions for critical-band rate and critical bandwidth as a function of frequency». The Journal of the Acoustical Society of America, 68(5), 1523-1525.
- Glasberg, B. R. y Moore, B. C. J. (1990). «Derivation of auditory filter shapes from notched-noise data». Hearing Research, 47(1-2), 103-138.
- Terhardt, E. (1979). «Calculating virtual pitch». Hearing Research, 1(2), 155-182.
- Painter, T. y Spanias, A. (2000). «Perceptual coding of digital audio». Proceedings of the IEEE, 88(4), 451-515.
- ISO/IEC 11172-3:1993. Information technology. Coding of moving pictures and associated audio for digital storage media at up to about 1,5 Mbit/s. Part 3: Audio.
Preguntas frecuentes
¿Qué es el enmascaramiento auditivo?
Es el fenómeno por el que un sonido (el enmascarador) hace inaudible o menos audible otro sonido (la señal). Se mide como cuánto sube el umbral de audición de la señal en presencia del enmascarador, en decibelios.
¿Qué diferencia hay entre enmascaramiento simultáneo y temporal?
En el simultáneo, los dos sonidos suenan a la vez y el más fuerte tapa al otro si están próximos en frecuencia. En el temporal, no coinciden en el tiempo. Un sonido fuerte enmascara lo que suena justo después, durante unos 100-200 ms (postenmascaramiento), y también, durante unos pocos milisegundos, lo que suena justo antes (preenmascaramiento).
¿Por qué los graves enmascaran a los agudos?
Porque la onda viajera de la membrana basilar entra por la base, donde se analizan los agudos, y avanza hasta su punto de máxima vibración. Un sonido grave hace vibrar también la zona de los agudos, mientras que uno agudo apenas llega a la zona de los graves. El efecto aumenta con el nivel.
¿Qué son las bandas críticas y la escala Bark?
Una banda crítica es el ancho de frecuencias que el oído integra como un solo canal. Mide unos 100 Hz por debajo de 500 Hz y, por encima, alrededor del 20 % de la frecuencia central. Zwicker dividió el rango audible en 24 bandas críticas consecutivas y llamó Bark a la unidad de esa escala.
¿Cómo usa el MP3 el enmascaramiento?
El codificador divide la señal en bandas de frecuencia, calcula con un modelo psicoacústico qué partes quedarán enmascaradas y codifica esas partes con menos bits o no las codifica. El ruido de cuantificación queda por debajo del umbral enmascarado y no se oye. Así, a 128 kbit/s, un MP3 ocupa unas 11 veces menos que el audio de un CD.