Tasas de muestreo de audio: 44.1 kHz, 48 kHz y 96 kHz explicadas
La tasa de muestreo (sample rate) es uno de los parámetros peor entendidos del audio digital. "Más es mejor" no funciona aquí — más allá de cierto punto, subir la tasa solo aumenta el tamaño del archivo sin ganancia perceptible. Esta guía explica qué hace realmente cada tasa, cuándo elegir cuál, y cómo convertir entre ellas sin degradar calidad.
El teorema de Nyquist en una frase
Para representar una frecuencia X sin distorsión, necesitas muestrear al menos a 2×X. El oído humano joven escucha hasta ~20.000 Hz (20 kHz); para captarlo todo necesitas 40.000 muestras/segundo como mínimo.
Las tasas estándar añaden margen para los filtros anti-aliasing necesarios en la cadena de conversión:
| Tasa | Captura hasta | Origen / uso típico |
|---|---|---|
| 8.000 Hz | 4 kHz | Telefonía clásica (G.711) |
| 22.050 Hz | 11 kHz | Audio web de baja calidad, MIDI sintetizado |
| 44.100 Hz | 22 kHz | CD audio, Spotify, streaming musical |
| 48.000 Hz | 24 kHz | Vídeo profesional (cine, TV, YouTube), DAW estándar |
| 88.200 Hz | 44 kHz | Mastering musical alto (poco común) |
| 96.000 Hz | 48 kHz | Producción profesional, archivado, post audio cine |
| 176.400 Hz | 88 kHz | Mastering audiófilo extremo (debate sobre utilidad real) |
| 192.000 Hz | 96 kHz | Análisis científico, ultrasonidos, archivado máximo |
¿Por qué 44.100 Hz si el oído llega a 20 kHz?
Los CDs eligieron 44.100 porque era compatible con los grabadores de vídeo PAL/NTSC de la época (el medio físico para masterizar antes de existir hardware específico de audio). El número exacto es: 3 muestras × 245 líneas × 60 frames = 44.100 (NTSC) y 3 × 294 × 50 = 44.100 (PAL). Coincidencia mágica que sentenció el estándar.
¿Por qué 48.000 Hz en vídeo?
Cuando llegó el vídeo digital profesional, los ingenieros eligieron 48.000 Hz porque divide limpio en frame rates de vídeo (24, 25, 30, 60 fps) — 48.000/24 = 2.000 muestras/frame, sin floats. Hoy 48 kHz es el estándar de todo audio asociado a vídeo: cine, TV, YouTube, broadcast.
Consecuencia práctica: si tu audio es para vídeo, graba/produce en 48 kHz desde el principio. Convertir 44.1→48 después introduce artefactos sutiles que un mastering profesional detecta.
¿Vale la pena 96 kHz para música?
Para reproducción final: NO. Estudios doble ciego repetidos (Meyer & Moran 2007 entre otros) muestran que oyentes entrenados no distinguen 44.1 kHz de 96 kHz cuando todo lo demás se mantiene constante. Tu oído físicamente no puede.
Para producción y mastering: SÍ tiene sentido. Las razones reales:
- Headroom para procesar — al estirar tiempo, hacer pitch shift o resampling complejo, partir de 96 kHz produce menos artefactos que 44.1 kHz.
- Filtros anti-aliasing más suaves — los filtros necesarios para llegar a 22 kHz limpios en 44.1 kHz son agresivos; con 96 kHz son trivialmente suaves.
- Material para futuro-proofing — si dentro de 20 años hay un nuevo formato de distribución a 96 kHz, conservas el original.
Para reproducción final siempre exporta a 48 kHz (para vídeo) o 44.1 kHz (para CD/streaming musical).
Conversión entre tasas — cuándo se nota la pérdida
Subir la tasa (upsampling) es matemáticamente lossless: 44.1 → 88.2 simplemente intercala muestras calculadas. No mejora calidad pero tampoco la empeora.
Bajar la tasa (downsampling) requiere filtro anti-aliasing y SÍ puede introducir artefactos si se hace mal:
# FFmpeg con resampler de calidad (soxr)
ffmpeg -i input-96k.wav -af "aresample=resampler=soxr:precision=28" -ar 48000 output-48k.wav
# Sox (la referencia de calidad)
sox input-96k.wav -r 48000 output-48k.wav rate -v
Los flags precision=28 (FFmpeg) y rate -v (Sox) usan el algoritmo más lento + mejor calidad. La diferencia con el default es inaudible para 99% de usuarios pero crítica para mastering profesional.
Conversiones problemáticas
44.1 ↔ 48 kHz: el peor caso. Ratio 147/160 — fraccional, difícil de hacer perfecto. Usa siempre soxr o sox, nunca el resampler básico de un editor amateur.
Cualquier tasa → 22.050 Hz o menos: para audio de voz/podcast esto está bien. Para música pierde el agudo (cymbals, sibilantes) audiblemente.
44.1 → 192 kHz: solo añade tamaño. No mejora nada. Si necesitas 192 kHz, debes haber GRABADO a 192 kHz desde el principio.
Bit depth: la otra mitad de la ecuación
Tasa de muestreo controla rango de frecuencias; profundidad de bits (bit depth) controla rango dinámico:
| Bit depth | Rango dinámico | Uso típico |
|---|---|---|
| 8 bits | 48 dB | Telefonía vintage |
| 16 bits | 96 dB | CD, distribución (Spotify, Apple Music) |
| 24 bits | 144 dB | Producción profesional, masters |
| 32 bits float | ~1500 dB | Mezcla y procesado interno DAW |
Para producción graba en 24 bits y exporta a 16 bits solo en el master final para distribución. La diferencia entre 16 y 24 bits es audible en pasajes muy silenciosos (las "colas" de reverbs, fadeouts) — irrelevante en música rock o pop, importante en clásica y cine.
Recomendaciones por caso de uso
| Tu caso | Sample rate / bit depth |
|---|---|
| Podcast de voz | 44.1 kHz / 16 bits, mono o estéreo |
| Música para Spotify/distribución | 44.1 kHz / 16 bits estéreo |
| Audio para vídeo YouTube | 48 kHz / 16 bits estéreo |
| Producción musical en DAW | 48 kHz / 24 bits (alguno usa 96 kHz) |
| Cine / post-producción | 48 kHz o 96 kHz / 24 bits |
| Archivado high-end (clásica, jazz) | 96 kHz / 24 bits |
| Análisis científico ultrasonido | 96 kHz o 192 kHz / 24 bits |
Detectar y verificar tasa
# Inspeccionar archivo
ffprobe -v quiet -show_streams input.wav | grep -E 'sample_rate|bits_per_sample'
# Cambiar metadato sin recodificar (raro, casi siempre quieres recodificar)
ffmpeg -i input.wav -c copy -ar 48000 output.wav # Esto NO funciona — debe recodificar
Conversiones relacionadas
- WAV a MP3 — comprimir a formato distribución
- WAV a FLAC — archivado lossless
- FLAC a MP3 — librería personal a streaming portátil
- MP3 a WAV — descomprimir para edición (sin recuperar info perdida)
- M4A a MP3 — desde Apple Music a universal
- MP4 a MP3 — extraer audio de vídeo