Saltar al contenido
Acústica Musical

05 // Percepción

El enmascaramiento auditivo: por qué un sonido tapa a otro

Nivel 2 · Ondas y armónicosActualizado 

En resumen

Hay enmascaramiento cuando un sonido deja de oírse, o se oye peor, porque suena otro. Es máximo cuando los dos caen en la misma banda crítica de la cóclea, y se extiende mucho más hacia los agudos que hacia los graves, sobre todo a niveles altos. También actúa en el tiempo, justo antes y después de un sonido fuerte. Los códecs como el MP3 o el AAC eliminan lo que queda enmascarado.

En un ensayo de orquesta, la flauta toca un solo precioso en el registro grave. En el papel está todo correcto. Pero en cuanto entran las trompas en mezzoforte, la flauta desaparece: sigue tocando, el sonido sigue llegando a tu oído, y sin embargo no la oyes. El director pide a las trompas que bajen, o el compositor tendrá que revisar la orquestación. Ese fenómeno tiene nombre: enmascaramiento.

Escucha estos tres sonidos. El primero es un tono puro de 1000 Hz. El segundo, un tono de 1100 Hz con unas tres veces más amplitud (unos 10 dB más). El tercero, los dos a la vez. Intenta seguir el tono de 1000 Hz dentro del tercero:

En el tercero no oyes dos notas: oyes un sonido áspero, rugoso, con la altura del tono fuerte. El tono de 1000 Hz ha perdido su identidad. Los dos caen en la misma banda crítica de la cóclea y el más fuerte domina.

Qué es el enmascaramiento

El enmascaramiento es la reducción de la audibilidad de un sonido (la señal) causada por otro sonido (el enmascarador). Se mide en decibelios, como el aumento del umbral de audición de la señal: si un tono de 1000 Hz se oía a partir de 3 dB en silencio y con ruido hace falta que llegue a 43 dB, hay 40 dB de enmascaramiento.

Hay dos grandes tipos:

  • Simultáneo: enmascarador y señal suenan a la vez. Depende sobre todo de su separación en frecuencia.
  • Temporal: no suenan a la vez, pero están muy próximos en el tiempo.

No hay que confundirlo con la suma de niveles que viste en los decibelios: allí un sonido 10 dB más débil apenas cambiaba el nivel total. Aquí la pregunta es otra: si lo oyes o no.

El enmascaramiento simultáneo

Las curvas de enmascaramiento

Los primeros en medirlo con detalle fueron R. L. Wegel y C. E. Lane, en los laboratorios Bell, en 1924. Ponían un tono enmascarador fijo y buscaban el umbral de un segundo tono a distintas frecuencias. El resultado son las curvas de enmascaramiento, con tres rasgos fundamentales:

  1. El enmascaramiento es máximo cerca de la frecuencia del enmascarador y cae al alejarse.
  2. Es asimétrico: se extiende mucho más hacia los agudos que hacia los graves.
  3. La asimetría crece con el nivel: cuanto más fuerte es el enmascarador, más ancha es su «sombra» hacia arriba.

A este tercer efecto se le llama en inglés upward spread of masking, el ensanchamiento hacia los agudos.

Por qué los graves tapan a los agudos

La explicación está en la membrana basilar. La vibración entra por la base, donde se analizan los agudos, y avanza como una onda viajera hasta el punto de su frecuencia, donde se apaga enseguida. Un sonido grave recorre, por tanto, toda la zona de los agudos antes de llegar a su sitio, y la excita. Un sonido agudo, en cambio, se apaga antes de llegar a la zona de los graves.

Un modelo sencillo (Terhardt, 1979) describe cómo decae la excitación de un tono a medida que nos alejamos de él, en decibelios por Bark (la unidad de banda crítica, que verás enseguida):

EnmascaradorHacia los gravesHacia los agudos
1000 Hz a 40 dB27 dB/Bark16 dB/Bark
1000 Hz a 60 dB27 dB/Bark12 dB/Bark
1000 Hz a 80 dB27 dB/Bark8 dB/Bark

Hacia los graves, la pendiente es fuerte y fija. Hacia los agudos, es suave y se suaviza más cuanto más fuerte es el sonido. Con este modelo, un tono de 500 Hz a 80 dB todavía produce, a 1000 Hz (casi 4 Bark más arriba), una excitación de unos 48 dB: puede tapar un sonido débil. Un tono de 1000 Hz a 80 dB, en cambio, no deja rastro a 500 Hz.

Escucha la asimetría. En los dos ejemplos hay un tono fuerte y otro débil a la misma distancia:

A volumen alto, el tono débil suele resultar más difícil de seguir en el primer caso, cuando queda por encima del fuerte. A volumen moderado la diferencia es sutil.

Bandas críticas y escala Bark

En 1940, Harvey Fletcher propuso que el oído se comporta como un banco de filtros solapados. Solo el ruido que cae dentro del filtro de la señal contribuye a enmascararla. Al ancho de cada filtro lo llamó banda crítica. Es la misma banda crítica que explica la aspereza de los intervalos en consonancia y disonancia.

Eberhard Zwicker (1961) dividió el rango audible en 24 bandas críticas consecutivas y llamó Bark a la unidad de esa escala, en honor a Heinrich Barkhausen. Una fórmula de uso habitual (Zwicker y Terhardt, 1980) da el ancho de la banda crítica Δf\Delta f y la posición zz en Bark:

Δf=25+75[1+1,4(f1000)2]0,69\Delta f = 25 + 75 \left[1 + 1{,}4 \left(\frac{f}{1000}\right)^2\right]^{0{,}69} z=13arctan(0,00076f)+3,5arctan[(f7500)2]z = 13 \arctan(0{,}00076\, f) + 3{,}5 \arctan\left[\left(\frac{f}{7500}\right)^2\right]

donde ff es la frecuencia central (Hz), Δf\Delta f el ancho de banda (Hz) y zz la posición en Bark. Más tarde, Brian Glasberg y Brian Moore (1990) propusieron otra medida, el ancho de banda rectangular equivalente (ERB), algo más estrecha en el grave:

ERB=24,7(4,37f1000+1)\mathrm{ERB} = 24{,}7 \cdot \left(4{,}37 \cdot \frac{f}{1000} + 1\right)
FrecuenciaBanda crítica (Zwicker)Posición (Bark)ERB (Glasberg y Moore)
100 Hz101 Hz1,035 Hz
500 Hz117 Hz4,779 Hz
1000 Hz162 Hz8,5133 Hz
2000 Hz301 Hz13,1241 Hz
4000 Hz685 Hz17,3456 Hz
8000 Hz1706 Hz21,3888 Hz

Por debajo de unos 500 Hz, la banda crítica mide unos 100 Hz; por encima, crece hasta rondar el 20 % de la frecuencia, algo más que una tercera menor. En el ejemplo inicial, 1000 y 1100 Hz están separados 0,6 Bark: bien dentro de la misma banda.

El enmascaramiento temporal

El enmascaramiento no se limita a los sonidos simultáneos:

  • Postenmascaramiento (forward masking): un sonido fuerte enmascara lo que suena después de él durante unos 100-200 ms. El efecto es intenso en los primeros milisegundos y va disminuyendo.
  • Preenmascaramiento (backward masking): un sonido fuerte enmascara también lo que sonó justo antes, pero solo durante unos pocos milisegundos (hasta unos 20 ms). Parece imposible, pero tiene explicación: un sonido fuerte se procesa más deprisa en la vía auditiva y «adelanta» al débil.

En música, el postenmascaramiento explica que una nota débil justo después de un golpe de platos o de un acorde en sforzando se pierda, aunque esté escrita. Y también ayuda a entender por qué la reverberación de una sala tapa los detalles rápidos, como se explica en el tiempo de reverberación.

El enmascaramiento en la orquestación

Muchos principios clásicos de la orquestación son enmascaramiento aplicado:

  • Los graves fuertes tapan a los agudos, no al revés. Unas trompas o unos trombones en el registro medio-grave pueden anular una flauta o un clarinete que tocan por encima en el mismo ámbito. Un flautín, en cambio, apenas tapa a los contrabajos.
  • Instrumentos en el mismo registro compiten. Si un solista toca en la misma zona de frecuencias que el acompañamiento, sus armónicos caen en las mismas bandas críticas. Por eso los compositores dejan un hueco de registro para la melodía o aligeran el acompañamiento cuando entra el solista.
  • El solista busca frecuencias libres. Un cantante lírico se oye sobre una orquesta gracias al formante del cantante, una concentración de energía hacia los 2500-3000 Hz donde la orquesta es más débil. Lo tienes explicado en la voz humana. En un concierto para violín, la escritura del solista en el registro agudo cumple la misma función.
  • La dinámica no es absoluta. Un piano de trompa y un piano de flauta no son iguales. Si varias secciones comparten un mismo matiz, las más potentes y las más graves dominarán.

El enmascaramiento en la mezcla y en los códecs

En el estudio

Un técnico de mezcla lucha contra el enmascaramiento todo el tiempo. El bombo y el bajo eléctrico compiten en los graves; las guitarras, el piano y la voz, en los medios. Las herramientas son las mismas ideas de la orquestación: ecualizar para dejar a cada instrumento su propia zona del espectro, repartir los instrumentos en el panorama estéreo y reducir el nivel de un instrumento cuando suena otro (por ejemplo, con compresión por cadena lateral o sidechain).

El panorama funciona porque el enmascaramiento es menor cuando la señal y el enmascarador llegan a los oídos con diferencias de tiempo o de fase. El cerebro compara los dos oídos y consigue separar lo que viene de sitios distintos.

Los códecs perceptivos: MP3 y AAC

Un CD guarda el audio sin comprimir: 44 100 muestras por segundo, 16 bits por muestra y dos canales. Eso da:

R=44100162=1411200 bit/s1411 kbit/sR = 44\,100 \cdot 16 \cdot 2 = 1\,411\,200\ \text{bit/s} \approx 1411\ \text{kbit/s}

donde RR es la tasa de bits. Un MP3 a 128 kbit/s ocupa unas 11 veces menos, y a oídos de la mayoría de oyentes suena parecido. La clave es el enmascaramiento. El codificador:

  1. Divide la señal en bandas de frecuencia y en bloques de tiempo muy cortos.
  2. Aplica un modelo psicoacústico que calcula, en cada bloque, el umbral enmascarado: lo que no se oiría por culpa de los componentes más fuertes y del umbral de audición.
  3. Reparte los bits de forma que el ruido de cuantificación quede por debajo de ese umbral en cada banda. Lo que está totalmente enmascarado apenas recibe bits.

El MP3 (formalmente, MPEG-1 Audio Layer III) se desarrolló sobre todo en el Instituto Fraunhofer de Alemania, con Karlheinz Brandenburg como una de sus figuras principales, y se normalizó en ISO/IEC 11172-3 (1993). El AAC, su sucesor, se normalizó en MPEG-2 (1997) y es el formato de muchas plataformas de streaming y de vídeo.

🛠 Herramienta pendiente: Demostrador de enmascaramiento

Un tono de señal y un enmascarador (tono o ruido de banda estrecha) con frecuencia y nivel ajustables, para encontrar tu umbral enmascarado y ver la asimetría hacia los agudos.

Ejercicios

Ejercicio 1. En silencio, un oyente detecta un tono de 2000 Hz a partir de 0 dB. Con un ruido de fondo, necesita que el tono llegue a 35 dB. ¿Cuánto enmascaramiento produce el ruido?

Ver solución

El enmascaramiento es el aumento del umbral: 350=3535 - 0 = 35 dB.

Ejercicio 2. Con la fórmula de Zwicker, calcula el ancho de la banda crítica a 1000 Hz. ¿Están 1000 y 1100 Hz dentro de la misma banda? ¿Y 1000 y 1250 Hz?

Ver solución
Δf=25+75(1+1,412)0,69=25+752,40,6925+751,83162 Hz\Delta f = 25 + 75 \cdot (1 + 1{,}4 \cdot 1^2)^{0{,}69} = 25 + 75 \cdot 2{,}4^{0{,}69} \approx 25 + 75 \cdot 1{,}83 \approx 162\ \text{Hz}

La separación de 100 Hz queda dentro de una banda crítica. La de 250 Hz la supera: los tonos se enmascaran menos y se oyen como dos sonidos.

Ejercicio 3. Un trombón toca un Fa3 (174,61 Hz) en forte y una flauta un Fa5 (698,46 Hz) en piano. ¿Quién tiene más riesgo de quedar tapado? Razónalo.

Ver solución

La flauta. Los armónicos del trombón llegan con mucha energía a la zona de la flauta (el 4.º armónico del Fa3, 698,44 Hz, coincide prácticamente con la nota de la flauta), y además el enmascaramiento se extiende hacia los agudos y aumenta con el nivel. La flauta, más aguda y más débil, apenas afecta a la región del trombón.

Ejercicio 4. Un archivo de audio de 4 minutos ocupa en calidad CD unos 42 MB. ¿Cuánto ocuparía en MP3 a 128 kbit/s y a 320 kbit/s?

Ver solución

A 128 kbit/s: 128000240/8=3840000128\,000 \cdot 240 / 8 = 3\,840\,000 bytes, unos 3,8 MB (11 veces menos). A 320 kbit/s: 320000240/8=9600000320\,000 \cdot 240 / 8 = 9\,600\,000 bytes, unos 9,6 MB (4,4 veces menos).

Fuentes y bibliografía

  • Zwicker, E. y Fastl, H. (2007). Psychoacoustics: Facts and Models (3.ª ed.). Berlín: Springer.
  • Moore, B. C. J. (2012). An Introduction to the Psychology of Hearing (6.ª ed.). Bingley: Emerald.
  • Wegel, R. L. y Lane, C. E. (1924). «The auditory masking of one pure tone by another and its probable relation to the dynamics of the inner ear». Physical Review, 23(2), 266-285.
  • Fletcher, H. (1940). «Auditory patterns». Reviews of Modern Physics, 12(1), 47-65.
  • Zwicker, E. (1961). «Subdivision of the audible frequency range into critical bands (Frequenzgruppen)». The Journal of the Acoustical Society of America, 33(2), 248.
  • Zwicker, E. y Terhardt, E. (1980). «Analytical expressions for critical-band rate and critical bandwidth as a function of frequency». The Journal of the Acoustical Society of America, 68(5), 1523-1525.
  • Glasberg, B. R. y Moore, B. C. J. (1990). «Derivation of auditory filter shapes from notched-noise data». Hearing Research, 47(1-2), 103-138.
  • Terhardt, E. (1979). «Calculating virtual pitch». Hearing Research, 1(2), 155-182.
  • Painter, T. y Spanias, A. (2000). «Perceptual coding of digital audio». Proceedings of the IEEE, 88(4), 451-515.
  • ISO/IEC 11172-3:1993. Information technology. Coding of moving pictures and associated audio for digital storage media at up to about 1,5 Mbit/s. Part 3: Audio.

Preguntas frecuentes

¿Qué es el enmascaramiento auditivo?

Es el fenómeno por el que un sonido (el enmascarador) hace inaudible o menos audible otro sonido (la señal). Se mide como cuánto sube el umbral de audición de la señal en presencia del enmascarador, en decibelios.

¿Qué diferencia hay entre enmascaramiento simultáneo y temporal?

En el simultáneo, los dos sonidos suenan a la vez y el más fuerte tapa al otro si están próximos en frecuencia. En el temporal, no coinciden en el tiempo. Un sonido fuerte enmascara lo que suena justo después, durante unos 100-200 ms (postenmascaramiento), y también, durante unos pocos milisegundos, lo que suena justo antes (preenmascaramiento).

¿Por qué los graves enmascaran a los agudos?

Porque la onda viajera de la membrana basilar entra por la base, donde se analizan los agudos, y avanza hasta su punto de máxima vibración. Un sonido grave hace vibrar también la zona de los agudos, mientras que uno agudo apenas llega a la zona de los graves. El efecto aumenta con el nivel.

¿Qué son las bandas críticas y la escala Bark?

Una banda crítica es el ancho de frecuencias que el oído integra como un solo canal. Mide unos 100 Hz por debajo de 500 Hz y, por encima, alrededor del 20 % de la frecuencia central. Zwicker dividió el rango audible en 24 bandas críticas consecutivas y llamó Bark a la unidad de esa escala.

¿Cómo usa el MP3 el enmascaramiento?

El codificador divide la señal en bandas de frecuencia, calcula con un modelo psicoacústico qué partes quedarán enmascaradas y codifica esas partes con menos bits o no las codifica. El ruido de cuantificación queda por debajo del umbral enmascarado y no se oye. Así, a 128 kbit/s, un MP3 ocupa unas 11 veces menos que el audio de un CD.