¿Cómo se guarda la pista de audio en un archivo de vídeo? Lógica de demux y copia directa
9 min de lectura
Cuando extraes el audio de un vídeo, ¿qué ocurre dentro del archivo? El sonido no "se separa", porque ya está ahí como una pista independiente, solo que empaquetado entrelazado con los datos de vídeo. En este artículo explicamos la estructura interna de los contenedores, cómo se guardan las pistas y la diferencia técnica entre copia directa y recodificación.
Cómo están las pistas dentro del contenedor
Si abrieras un archivo de vídeo y miraras dentro, no verías una estructura ordenada del tipo "primero todo el vídeo y luego todo el audio". Lo que encontrarías es un flujo de pequeños paquetes entrelazados:
[paquete de vídeo 0.00s][paquete de audio 0.00s][paquete de vídeo 0.04s]
[paquete de audio 0.02s][paquete de vídeo 0.08s][paquete de audio 0.04s]...
Eso se llama multiplexado. El motivo es la eficiencia de reproducción: al ver un vídeo necesitas a la vez la imagen y el sonido de un instante concreto. Si estuvieran guardados en extremos distintos del archivo, el reproductor tendría que ir constantemente adelante y atrás. Al reproducir en streaming por red, esa estructura sería totalmente inservible.
El demux (demultiplexado) consiste en separar ese flujo mezclado y reunir cada pista por su cuenta. Es el primer paso de la extracción de audio.
Punto clave: el demux no incluye ninguna decodificación. Lee los paquetes, mira a qué pista pertenecen y los separa. No mira en ningún momento dentro de los datos de audio.
Estructura de pistas y metadatos
Cada contenedor tiene una estructura que guarda información sobre las pistas. En MP4 son las estructuras trak dentro del átomo moov; en MKV es el elemento Tracks.
La información que se guarda de cada pista:
| Información | Significado | |---|---| | Tipo de pista | Vídeo, audio, subtítulos, metadatos | | Identificador de códec | AAC, H.264, AC3, Opus... | | Escala de tiempo | La unidad de las marcas de tiempo | | Duración | La longitud de la pista | | Idioma | Español, inglés... | | Número de canales | Mono, estéreo, 5.1 | | Frecuencia de muestreo | 44100, 48000 Hz | | Bitrate | Velocidad media de datos | | Datos específicos del códec | Los parámetros iniciales que necesita el decodificador |
La última fila es importante: muchos códecs necesitan un bloque de configuración antes de empezar a decodificar. En AAC se llama AudioSpecificConfig y lleva datos como la frecuencia de muestreo, la disposición de canales y la información de perfil. Ese bloque no se guarda dentro de los paquetes de audio, sino en los metadatos de la pista.
Durante la extracción de audio, ese bloque de configuración también tiene que trasladarse correctamente al archivo nuevo; si no, el archivo resultante no se podrá reproducir o sonará a la velocidad equivocada.
Copia directa: la vía sin pérdidas
En la operación de stream copy (copia de flujo) ocurre esto:
- Se hace el demux del contenedor y se separan los paquetes de audio.
- No se mira dentro de los paquetes. Los datos codificados se quedan tal cual.
- Se crea un contenedor nuevo (o un archivo en bruto).
- Los paquetes se escriben en el contenedor nuevo junto con sus marcas de tiempo.
- Se trasladan los metadatos de la pista y la configuración del códec.
Resultado: los datos de audio son idénticos bit a bit. No hay ninguna pérdida de calidad. La operación se ejecuta a la velocidad de copiar un archivo porque no se hace ningún cálculo.
Condición: el formato de archivo de destino debe poder albergar ese códec.
| Códec de audio de origen | Destinos con copia directa | |---|---| | AAC | .m4a, .aac, .mp4, .mkv | | MP3 | .mp3, .mkv, .mp4 | | Opus | .opus, .ogg, .mkv, .webm | | Vorbis | .ogg, .mkv, .webm | | FLAC | .flac, .mkv | | PCM | .wav, .mkv, .mov | | AC3 / DTS | .ac3, .dts, .mkv |
La consecuencia práctica de esta tabla: si al extraer audio de tus vídeos MP4 eliges M4A como destino, se hace copia directa y no pierdes nada de calidad. Si quieres ese mismo contenido en MP3, la recodificación se vuelve obligatoria.
Recodificación: la vía con pérdidas
Si el formato de destino no es compatible con el origen, hace falta un proceso de dos pasos:
1. Decodificación. Los paquetes de audio codificados se decodifican a PCM (una secuencia de muestras en bruto).
2. Recodificación. Esos datos PCM se comprimen desde cero con el códec de destino.
Al ir de una fuente con pérdidas a un destino con pérdidas, el problema es este: la información que descartó el primer codificador ya no existe, y el segundo codificador vuelve a descartar información según su propio modelo psicoacústico. Dos "descartes" distintos se superponen y la pérdida se acumula.
Además, el ruido de cuantización que dejó la primera codificación le parece "sonido real" al segundo codificador, que gasta presupuesto de bits intentando conservarlo.
Por eso hay que dejar el bitrate de destino un escalón por encima del de la fuente: no elimina la pérdida, pero la limita.
Excepción: si la fuente es sin pérdidas (PCM o FLAC), la recodificación añade una única pérdida y es una operación de codificación normal. En ese caso la calidad depende por completo del bitrate que elijas.
Marcas de tiempo y sincronía
Cada paquete lleva una marca de tiempo. En realidad, dos:
PTS (Presentation Timestamp): cuándo se mostrará o reproducirá ese paquete.
DTS (Decoding Timestamp): cuándo hay que decodificar ese paquete.
Para el audio suelen ser iguales. Para el vídeo pueden ser distintas: como los fotogramas B predicen mirando hacia delante, el orden de decodificación es distinto del de presentación.
En la extracción de audio, las marcas de tiempo importan por dos motivos:
Desplazamiento inicial. En algunas grabaciones, la pista de audio empieza en un momento distinto del vídeo. En el contenedor eso se compensa con una edit list o un valor de desplazamiento. Si esa información no se traslada durante la extracción, el audio resultante quedará desplazado unos cientos de milisegundos respecto al del vídeo.
Huecos. En algunas grabaciones (sobre todo en flujos recibidos por red) puede haber huecos en los paquetes de audio. La copia directa traslada esos huecos; algunas herramientas los rellenan y otras los ignoran, con lo que la duración se acorta.
El problema de la velocidad de fotogramas variable
Los programas de grabación de pantalla y algunas cámaras de móvil usan velocidad de fotogramas variable (VFR): ahorran espacio saltándose fotogramas cuando no hay movimiento.
El audio, en cambio, fluye siempre a velocidad constante: 48000 muestras por segundo, sin excepción.
Esa asimetría complica los cálculos de tiempo en los vídeos VFR. Algunas herramientas calculan la velocidad media del vídeo, la dan por constante e interpretan según ella las marcas de tiempo del audio. El resultado es un desfase que aumenta a medida que avanza el vídeo.
El audio que extraigas de una grabación de pantalla de una hora puede estar desplazado varios segundos hacia el final. La solución es convertir antes el vídeo a velocidad de fotogramas constante.
Varias pistas de audio
El contenedor MKV puede transportar un número ilimitado de pistas de audio. En un archivo de película típico:
- Pista 1: idioma original, 5.1 AC3
- Pista 2: doblaje, 2.0 AAC
- Pista 3: comentarios del director, 2.0 AAC
- Pista 4: audiodescripción
Cada pista lleva su propia etiqueta de idioma, su disposición de canales y su códec.
Las herramientas de extracción suelen tomar la pista predeterminada o la primera pista. Si quieres una pista concreta, la herramienta tiene que ofrecer selección de pista.
El contenedor MP4 también admite varias pistas de audio, pero en la práctica se usa menos y algunos reproductores solo ven la primera.
Mezcla de canales
El sonido de las películas suele ser de 5.1 o 7.1 canales. Al extraerlo a un archivo estéreo se hace un downmix (mezcla descendente): seis canales se reducen a dos.
La fórmula estándar es aproximadamente esta:
- Izquierdo = Frontal Izquierdo + 0,707 × Central + 0,707 × Trasero Izquierdo
- Derecho = Frontal Derecho + 0,707 × Central + 0,707 × Trasero Derecho
- El LFE (canal de graves) normalmente se descarta o se añade con poco peso
Esa mezcla a veces da problemas: en el sonido de las películas, los diálogos están en el canal central y los efectos en los laterales. Si las proporciones de mezcla no son adecuadas, los diálogos pueden quedar en segundo plano: por eso, al extraer el audio de una película, a veces no se oyen bien las conversaciones.
Algunas herramientas ofrecen opciones "centradas en el diálogo" que mezclan el canal central con más fuerza.
PCM: la fuente sin pérdidas
En algunos vídeos, el audio se guarda sin comprimir en formato PCM. Aparece en cámaras profesionales, en algunos programas de grabación de pantalla y en los discos Blu-ray.
El PCM son los mismos datos que hay dentro de un archivo WAV. En ese caso:
- Extracción a WAV: copia directa, ninguna pérdida.
- Extracción a FLAC: compresión sin pérdidas, los datos se conservan exactamente y el archivo se reduce.
- Extracción a MP3/AAC: la primera codificación con pérdidas; la calidad depende por completo del bitrate que elijas y con un buen bitrate el resultado es excelente.
Las extracciones a partir de PCM son el mejor punto de partida para editar.
En resumen
En un archivo de vídeo, el audio está como una pista independiente empaquetada entrelazada con los datos de vídeo; el primer paso de la extracción es separar esos paquetes (demux) y ese paso no incluye ninguna decodificación. Si el formato de destino es compatible con el códec de origen, los paquetes se trasladan tal cual: copia directa, cero pérdida y una operación de segundos. Si no lo es, hacen falta decodificación y recodificación, y en fuentes con pérdidas se añade una segunda pérdida. Las marcas de tiempo determinan la sincronía y son la causa principal del desfase en las fuentes con velocidad de fotogramas variable. En el sonido multicanal de las películas, la mezcla a estéreo puede debilitar los diálogos: es una consecuencia natural de las proporciones de mezcla.
Preguntas frecuentes
¿Qué significa exactamente demux?
Es la abreviatura de demultiplexing. Dentro de un contenedor, los datos de vídeo, audio y subtítulos se guardan como paquetes entrelazados, porque al reproducir se necesitan todos a la vez. El demux consiste en separar ese flujo mezclado y quedarse con cada pista por su cuenta. Es el primer paso de la extracción de audio y no requiere ninguna decodificación.
¿Por qué se guardan entrelazados los datos de audio y vídeo?
Por eficiencia de reproducción. Al ver un vídeo necesitas a la vez la imagen y el sonido de un instante concreto. Si estuvieran en extremos distintos del archivo, el reproductor tendría que ir constantemente adelante y atrás, algo desastroso sobre todo al reproducir en streaming por red. El entrelazado te permite obtener las dos cosas con una lectura secuencial.
¿Por qué a veces no puedo elegir el formato al hacer copia directa?
Porque la copia directa traslada los datos tal cual y el archivo de destino tiene que poder albergarlos. Puedes meter datos de audio AAC en un archivo .m4a, pero no en un .mp3: el formato de archivo MP3 espera datos MP3. Si quieres un formato de destino distinto, la recodificación se vuelve obligatoria.
¿Qué es el audio PCM y en qué vídeos aparece?
PCM son datos de audio en bruto, sin comprimir: lo mismo que hay dentro de un archivo WAV. Aparece en cámaras profesionales, en algunos programas de grabación de pantalla y en los discos Blu-ray. Al ser sin pérdidas, durante la extracción se puede pasar a WAV o FLAC sin ninguna pérdida. El tamaño de archivo es grande, pero es una fuente ideal para editar.
Pruébalo ahora mismo con Videodan Ses Çıkar.
Probar Videodan Ses Çıkar