Saltar al contenido
Acústica Musical

06 // Electroacústica

Audio digital: frecuencia de muestreo, bits y teorema de Nyquist

Nivel 2 · Ondas y armónicosActualizado 

En resumen

El audio digital representa la onda sonora con números: se mide su valor muchas veces por segundo (frecuencia de muestreo) y cada medida se redondea a un número entero de bits (profundidad). Según el teorema de Nyquist-Shannon, para reproducir una frecuencia hay que muestrear a más del doble de ella; por eso los 44,1 kHz del CD cubren hasta 22,05 kHz. Cada bit añade unos 6 dB de rango dinámico: 16 bits dan unos 98 dB y 24 bits, unos 146 dB teóricos.

Un sonido es una variación continua de presión. Un ordenador, en cambio, solo sabe manejar números. Convertir lo uno en lo otro sin que el oído note la diferencia es el problema del audio digital, y su solución descansa en dos preguntas muy simples: cada cuánto medimos la onda y con cuánta precisión apuntamos cada medida. La primera respuesta es la frecuencia de muestreo; la segunda, la profundidad de bits.

Antes de empezar, comprueba hasta dónde llega tu oído. Baja el volumen: estos tonos son muy agudos y pueden resultar molestos. Muchos adultos dejan de oír los últimos:

El límite superior del oído joven está en torno a 20 kHz y baja con la edad, como verás en el umbral de audición. Ese límite es el que marca todo lo demás.

La cadena de conversión

Para grabar, un conversor analógico-digital (ADC) toma la tensión que sale del micrófono y del preamplificador, la mide a intervalos regulares y guarda cada medida como un número. Para escuchar, un conversor digital-analógico (DAC) hace el camino contrario. Entre los dos, la señal es una lista de números que se puede copiar, editar y transmitir sin degradarse.

El muestreo y el teorema de Nyquist-Shannon

Muestrear es tomar el valor de la señal cada cierto tiempo. El número de muestras por segundo es la frecuencia de muestreo fsf_s, y el intervalo entre muestras, T=1/fsT = 1/f_s. A 44,1 kHz se toma una muestra cada 22,7 µs.

¿Cuántas muestras hacen falta? El teorema de muestreo responde:

fs>2fmaˊxf_s > 2 \, f_{\text{máx}}

Una señal que no contiene frecuencias por encima de fmaˊxf_{\text{máx}} se puede reconstruir exactamente a partir de sus muestras si se muestrea a más del doble de esa frecuencia. La mitad de la frecuencia de muestreo, fs/2f_s/2, se llama frecuencia de Nyquist.

Fíjate en la palabra exactamente. Es la idea más contraintuitiva del audio digital: entre dos muestras no se «pierde» nada, siempre que la señal no tenga componentes por encima de fs/2f_s/2. El conversor no une los puntos con una escalera ni con rectas; reconstruye la única curva suave, limitada en banda, que pasa por todos ellos.

El aliasing

Si al conversor llega una frecuencia por encima de fs/2f_s/2, no desaparece: se pliega y aparece como otra frecuencia, reflejada respecto a la de Nyquist. Ese fantasma se llama alias:

falias=fkfsf_{\text{alias}} = \left| f - k \, f_s \right|

donde kk es el número entero que hace el resultado menor que fs/2f_s/2. A 44,1 kHz, un componente de 30 kHz aparece como 3044,1=14,1|30 - 44{,}1| = 14{,}1 kHz, en plena zona audible y sin ninguna relación armónica con la música. Es lo mismo que ves en el cine cuando las ruedas de un carro parecen girar hacia atrás: la cámara «muestrea» demasiado despacio.

Para evitarlo, antes del ADC se coloca un filtro antialiasing, un paso bajo que elimina todo lo que está por encima de fs/2f_s/2. Los conversores modernos muestrean internamente a una frecuencia mucho mayor (sobremuestreo) y filtran después en digital, lo que permite filtros muy precisos.

fsf_sFrecuencia de NyquistUso principal
8 kHz4 kHzTelefonía
44,1 kHz22,05 kHzCD, distribución de música
48 kHz24 kHzVídeo, cine, televisión, estándar de estudio
88,2 / 96 kHz44,1 / 48 kHzGrabación y producción en alta resolución
192 kHz96 kHzArchivo, algunos formatos de alta resolución

¿Por qué 44,1 kHz?

Había que cubrir hasta 20 kHz y dejar margen para el filtro antialiasing, que no puede cortar de golpe: de 20 a 22,05 kHz hay unos 2 kHz para que el filtro pase de dejarlo todo a eliminarlo todo. Pero el número exacto tiene una historia curiosa. A finales de los setenta, antes de que hubiera discos duros capaces de guardar tanta información, el audio digital se grababa en cintas de vídeo mediante adaptadores PCM, que escribían las muestras como puntos blancos y negros en las líneas de la imagen. Con tres muestras por línea:

NTSC: 60×245×3=44100PAL: 50×294×3=44100\text{NTSC: } 60 \times 245 \times 3 = 44\,100 \qquad \text{PAL: } 50 \times 294 \times 3 = 44\,100

(campos por segundo × líneas útiles por campo × muestras por línea). La misma cifra servía en América y Japón y en Europa. Sony y Philips la adoptaron en el estándar del CD (el llamado Red Book, de 1980), junto con 16 bits y dos canales. Los 48 kHz, más cómodos para sincronizar con la imagen, se impusieron en vídeo y en los estudios.

La cuantificación y la profundidad de bits

Cada muestra se redondea al valor más próximo de una escala de 2N2^N niveles, donde NN es la profundidad de bits. El error de redondeo se llama error de cuantificación y se comporta como un ruido de fondo. Cuantos más bits, más fino es el escalón y más bajo el ruido.

Para una senoide a plena escala, la relación entre la señal y el ruido de cuantificación es:

SNR6,02N+1,76 dB\text{SNR} \approx 6{,}02 \, N + 1{,}76\ \text{dB}

Cada bit duplica el número de niveles y, por tanto, reduce el ruido a la mitad en amplitud: 20log10(2)6,0220\log_{10}(2) \approx 6{,}02 dB. El término de 1,76 dB sale de comparar la potencia de una senoide con la de un error repartido uniformemente.

BitsNivelesRango dinámico teóricoUso
8256≈ 50 dBPrimeros muestreadores y videojuegos
1665 536≈ 98 dBCD, distribución
201 048 576≈ 122 dBLímite práctico de los mejores conversores
2416 777 216≈ 146 dBGrabación y producción
32 (coma flotante)EnormeProcesado interno de los programas

Ningún conversor real alcanza los 146 dB de los 24 bits: el ruido de los circuitos analógicos limita el rango real a unos 115-125 dB. Aun así, grabar a 24 bits tiene una ventaja práctica enorme: puedes dejar mucho margen (headroom) para que los picos no saturen, sin que el ruido de cuantificación sea un problema. Una costumbre sensata es grabar con los picos entre −12 y −6 dBFS.

El dither

Con señales muy débiles, el error de cuantificación deja de parecer ruido y se vuelve distorsión, porque sigue el ritmo de la señal. La solución, a primera vista absurda, es añadir un poco de ruido antes de redondear: el dither. Con un ruido del orden de un escalón, el error se vuelve independiente de la señal y la distorsión se transforma en un siseo uniforme, mucho menos molesto. Incluso se pueden oír sonidos más débiles que el propio escalón, «dentro» del ruido.

El dither se aplica cada vez que se reducen los bits, por ejemplo al pasar una mezcla de 24 bits a los 16 bits de un CD. Con técnicas de conformado del ruido (noise shaping) se desplaza ese siseo a las frecuencias donde el oído es menos sensible.

Cuánto ocupa el audio digital

La tasa de datos del audio sin comprimir es fácil de calcular:

tasa (bit/s)=fs×N×canales\text{tasa (bit/s)} = f_s \times N \times \text{canales}

Un CD: 44100×16×2=141120044\,100 \times 16 \times 2 = 1\,411\,200 bit/s, unos 1 411 kbit/s o 10,6 MB por minuto. Una sesión a 48 kHz y 24 bits en estéreo: 2 304 kbit/s, unos 17,3 MB por minuto y pista estéreo.

Formatos: con pérdida y sin pérdida

FormatoTipoTamaño respecto al originalUso
WAV, AIFFSin comprimir (PCM)100 %Grabación, edición, masterización
FLAC, ALACComprimido sin pérdida≈ 50-70 %Archivo y escucha de alta calidad
MP3, AAC, Ogg Vorbis, OpusComprimido con pérdida≈ 5-20 %Distribución, streaming

La compresión sin pérdida funciona como un zip: al descomprimir, recuperas exactamente las mismas muestras. La compresión con pérdida es otra cosa. Un MP3 a 128 kbit/s ocupa unas 11 veces menos que el CD porque descarta información: un modelo del oído decide qué componentes quedarán tapados por otros más fuertes y los codifica con menos precisión o los elimina. Es el enmascaramiento, que tienes explicado en su artículo de psicoacústica. A tasas altas (256-320 kbit/s), la mayoría de los oyentes no distingue un buen MP3 o AAC del original; a tasas bajas aparecen artefactos: agudos «burbujeantes», platillos borrosos, ecos antes de los ataques.

La latencia

Un ordenador no procesa el audio muestra a muestra, sino en bloques (buffers). Mientras se llena un bloque, la señal espera. Esa espera es la latencia:

t=taman˜o del buˊfer (muestras)fst = \frac{\text{tamaño del búfer (muestras)}}{f_s}
BúferA 48 kHzDistancia equivalente en el aire
64 muestras1,3 ms≈ 0,46 m
128 muestras2,7 ms≈ 0,91 m
256 muestras5,3 ms≈ 1,83 m
1 024 muestras21,3 ms≈ 7,3 m

La latencia real de ida y vuelta (entrar, procesar y salir) es al menos el doble, más el retardo de los propios conversores. Compárala con la velocidad del sonido: cada milisegundo equivale a unos 34 cm de aire. En un escenario, un violinista oye a los instrumentos situados a 10 m con unos 30 ms de retraso y está acostumbrado a ello; pero muchos intérpretes notan una latencia de unos 10 ms cuando es la de su propio sonido en los auriculares. Por eso se graba con búferes pequeños y se mezcla con búferes grandes, que descargan el procesador.

Ejercicios

Ejercicio 1. Un sistema muestrea a 48 kHz. ¿Cuál es su frecuencia de Nyquist? Si por un fallo del filtro entra un componente de 29 kHz, ¿en qué frecuencia aparecerá?

Ver solución

La frecuencia de Nyquist es 24 kHz. El componente de 29 kHz se pliega: 2948=19|29 - 48| = 19 kHz. Aparecerá un tono de 19 kHz que no estaba en el sonido original.

Ejercicio 2. Calcula el rango dinámico teórico de un sistema de 12 bits y el de uno de 20 bits. ¿Cuántos bits harían falta, como mínimo, para 110 dB?

Ver solución
6,0212+1,7674 dB6,0220+1,76122 dB6{,}02 \cdot 12 + 1{,}76 \approx 74\ \text{dB} \qquad 6{,}02 \cdot 20 + 1{,}76 \approx 122\ \text{dB}

Para 110 dB: N(1101,76)/6,0218N \geq (110 - 1{,}76)/6{,}02 \approx 18 bits.

Ejercicio 3. ¿Cuánto ocupa una grabación de 10 minutos de un cuarteto con 8 micrófonos, a 96 kHz y 24 bits, sin comprimir?

Ver solución

Tasa: 96000×24×8=1843200096\,000 \times 24 \times 8 = 18\,432\,000 bit/s. En 600 s: 1,10610101{,}106 \cdot 10^{10} bits, es decir, unos 1 382 MB (casi 1,4 GB).

Ejercicio 4. Grabas una voz con un búfer de 512 muestras a 44,1 kHz. ¿Cuál es la latencia de un solo búfer? ¿Por qué el cantante puede quejarse al escucharse por los auriculares?

Ver solución
t=5124410011,6 mst = \frac{512}{44\,100} \approx 11{,}6\ \text{ms}

La latencia de ida y vuelta será, como mínimo, del orden de 23 ms. Es un retraso claramente perceptible respecto a la propia voz, que el cantante oye también por dentro de la cabeza sin retraso: la sensación es de eco o de «ir detrás». Hay que reducir el búfer o usar la monitorización directa de la interfaz.

Fuentes y bibliografía

  • Pohlmann, K. C. (2011). Principles of Digital Audio (6.ª ed.). Nueva York: McGraw-Hill.
  • Watkinson, J. (2001). The Art of Digital Audio (3.ª ed.). Oxford: Focal Press.
  • Shannon, C. E. (1949). «Communication in the presence of noise». Proceedings of the IRE, 37(1), 10-21.
  • Nyquist, H. (1928). «Certain topics in telegraph transmission theory». Transactions of the AIEE, 47, 617-644.
  • Lipshitz, S. P., Wannamaker, R. A. y Vanderkooy, J. (1992). «Quantization and dither: a theoretical survey». Journal of the Audio Engineering Society, 40(5), 355-375.
  • Rumsey, F. y McCormick, T. (2014). Sound and Recording (7.ª ed.). Oxford: Focal Press.

Preguntas frecuentes

¿Qué es la frecuencia de muestreo?

Es el número de veces por segundo que se mide la señal de audio para convertirla en números. Se expresa en hercios; 44,1 kHz significa 44 100 medidas (muestras) por segundo. Limita la frecuencia más aguda que se puede grabar, que es la mitad de la frecuencia de muestreo.

¿Qué dice el teorema de Nyquist?

Que una señal que no contiene frecuencias por encima de un valor f máx puede reconstruirse exactamente a partir de sus muestras si se muestrea a más del doble de esa frecuencia. La mitad de la frecuencia de muestreo se llama frecuencia de Nyquist.

¿Por qué el CD usa 44,1 kHz?

Porque había que cubrir el oído humano (hasta unos 20 kHz) con margen para el filtro antialiasing, y porque los primeros sistemas de grabación digital guardaban el audio en cintas de vídeo. 44 100 es un número compatible con los dos sistemas de televisión, 60 campos × 245 líneas × 3 muestras en NTSC y 50 × 294 × 3 en PAL.

¿Es mejor grabar a 24 bits que a 16?

Para grabar, sí. Los 24 bits dan un margen de ruido enorme y permiten dejar mucho espacio libre sin perder calidad. Para escuchar el resultado final, 16 bits bien tratados (con dither) superan el rango dinámico útil de casi cualquier sala y equipo.

¿Qué es el aliasing?

Es la distorsión que aparece cuando entra en el conversor una frecuencia superior a la mitad de la frecuencia de muestreo. Esa frecuencia se «pliega» y aparece como otra más grave que no existía; por ejemplo, 30 kHz muestreados a 44,1 kHz aparecen como 14,1 kHz. Se evita con un filtro antes del conversor.

¿Qué diferencia hay entre WAV, FLAC y MP3?

WAV guarda las muestras sin comprimir. FLAC las comprime sin pérdida, como un zip, y ocupa aproximadamente la mitad. MP3 y AAC comprimen con pérdida: eliminan lo que un modelo psicoacústico considera inaudible y ocupan en torno a una décima parte o menos.