¿Qué son el contenedor y el códec de vídeo? El origen real de los problemas de compatibilidad
9 min de lectura
¿Por qué un archivo de vídeo se abre en un dispositivo y en otro no? ¿Por qué entre dos vídeos de la misma duración puede haber diez veces de diferencia de tamaño? La respuesta a esas preguntas está en la estructura de dos capas de los archivos de vídeo. En este artículo explicamos la distinción entre contenedor y códec, cómo funcionan los códecs y cuál es el origen real de los problemas de compatibilidad.
Una estructura de dos capas
Un archivo de vídeo es en realidad un paquete. Dentro hay esto:
- Una o más pistas de vídeo
- Una o más pistas de audio (idiomas distintos, configuraciones de canales distintas)
- Pistas de subtítulos
- Metadatos (título, duración, fecha de creación, marcas de capítulo)
- Marcas de tiempo: cuándo se muestra cada fotograma
El contenedor es la estructura que mantiene juntas esas partes. La extensión del archivo indica el contenedor: .mp4, .mkv, .avi, .mov, .webm.
El códec determina cómo se comprimen las pistas. Para vídeo, H.264, H.265, VP9 y AV1; para audio, AAC, MP3, Opus y AC3.
La consecuencia más práctica de esta distinción: la extensión no dice si el archivo se va a reproducir. De dos archivos MP4, uno puede funcionar en todas partes y el otro no abrirse en un televisor antiguo, porque los códecs que llevan dentro son distintos.
Características de los contenedores
| Contenedor | Punto fuerte | Punto débil | Uso típico | |---|---|---|---| | MP4 | Soporte universal, apto para streaming | Soporte limitado de códecs y subtítulos | Web, compartir, móvil | | MKV | Lo transporta todo, varias pistas, subtítulos flexibles | Menos soporte por hardware | Archivo, colección de películas | | MOV | Nativo en el ecosistema Apple, apto para edición | Menos extendido que MP4 | Producción de vídeo, macOS | | AVI | Muy antiguo, amplio soporte heredado | No transporta bien los códecs modernos | Archivos antiguos | | WEBM | Abierto, optimizado para web | Solo determinados códecs | Vídeo dentro del navegador |
MP4 y MOV comparten en realidad la misma estructura básica (formato de archivo multimedia basado en ISO). Por eso la conversión de MOV a MP4 se puede hacer casi siempre por remultiplexado, es decir, sin ninguna recodificación.
MKV es el contenedor más flexible: transporta casi cualquier códec, un número ilimitado de pistas y formatos ricos de subtítulos. El precio es que tiene menos soporte en los reproductores por hardware.
AVI es una estructura de los años noventa y no funciona bien con los códecs modernos: su soporte de fotogramas B (fotogramas de predicción bidireccional) es problemático y sufre problemas de sincronía con audio de bitrate variable.
Cómo funcionan los códecs de vídeo
Un segundo de vídeo 1080p sin comprimir ocupa unos 150 MB. Un minuto serían 9 GB. Sin compresión, el vídeo es prácticamente imposible.
Los códecs de vídeo aprovechan dos tipos de redundancia:
Redundancia espacial (dentro de un fotograma): en una imagen, los píxeles vecinos suelen parecerse. Miles de píxeles de la zona del cielo tienen casi el mismo valor. Eso se reduce con una técnica parecida a la compresión fotográfica (división en bloques, transformada de frecuencia, cuantización).
Redundancia temporal (entre fotogramas): los fotogramas consecutivos se parecen mucho entre sí. Con una cámara fija, el fondo no cambia nada; solo son distintos los objetos en movimiento. En lugar de guardar cada fotograma desde cero, el códec guarda la diferencia respecto al fotograma anterior.
Ese segundo mecanismo es la verdadera potencia de la compresión de vídeo y da origen a los tipos de fotograma.
Tipos de fotograma y estructura GOP
Fotograma I (Intra, fotograma clave): es una imagen completa por sí misma. Se puede decodificar sin mirar los demás fotogramas. Piensa en una fotografía. Es el tipo de fotograma que más ocupa.
Fotograma P (Predicted): guarda la diferencia mirando los fotogramas anteriores. Dice "este bloque es igual que el que estaba aquí en el fotograma anterior, solo se ha desplazado 3 píxeles a la derecha". Ocupa mucho menos que un fotograma I.
Fotograma B (Bidireccional): mira tanto los fotogramas anteriores como los posteriores. Es el tipo más eficiente, pero al decodificar exige procesar los fotogramas fuera de orden.
Estos fotogramas se organizan en grupos llamados GOP (Group of Pictures). Un GOP típico puede ser así:
I B B P B B P B B P B B I ...
La longitud del GOP (la distancia entre dos fotogramas I) es un ajuste importante:
- GOP corto (fotogramas clave frecuentes): archivo más grande, pero avance preciso, edición fácil y recuperación rápida de errores.
- GOP largo (fotogramas clave escasos): archivo más pequeño, pero avance tosco y edición difícil.
Eso explica por qué, al avanzar en un vídeo, no puedes ir exactamente al segundo que quieres: el reproductor salta al fotograma I más cercano, porque no puede empezar en medio.
El mismo motivo aparece al cortar y unir vídeo. Si el punto de corte cae en un fotograma I, no hace falta recodificar; si no cae, hay que recodificar ese GOP.
La diferencia de eficiencia entre códecs
| Códec | Año | Eficiencia relativa | Soporte por hardware | |---|---|---|---| | MPEG-4 Part 2 (DivX/Xvid) | 1999 | Referencia | Dispositivos antiguos | | H.264 (AVC) | 2003 | ~50 % mejor | Casi universal | | VP9 | 2013 | ~30 % mejor que H.264 | Bueno en web, medio en hardware | | H.265 (HEVC) | 2013 | ~40 % mejor que H.264 | En dispositivos nuevos | | AV1 | 2018 | ~20 % mejor que H.265 | Limitado pero creciendo |
¿De dónde viene el aumento de eficiencia? De una división en bloques más flexible (mientras H.264 usa macrobloques fijos de 16×16, H.265 usa tamaños variables de hasta 64×64), más modos de predicción, mejor estimación de movimiento y una codificación entrópica más avanzada.
El precio es la carga de cálculo. La codificación en H.265 es bastante más lenta que en H.264; la de AV1, todavía más. En el lado de la decodificación, los dispositivos sin soporte por hardware sufren consumo de batería y tirones.
¿Por qué el H.264 sigue siendo el estándar? Porque prácticamente cualquier dispositivo fabricado tiene decodificador por hardware. Tu móvil, tu televisor, tu navegador y la pantalla de tu coche decodifican H.264 con eficiencia. Esa universalidad vale más que la ventaja de un 40 % de tamaño en la mayoría de los escenarios.
Modos de bitrate
CBR (bitrate constante): los mismos datos cada segundo. Se usa en radiodifusión y streaming en directo, donde la previsibilidad importa.
VBR (bitrate variable): los datos se reparten según la complejidad de la escena. Una escena estática de diálogo recibe pocos bits y una de acción rápida, muchos. Al mismo bitrate medio da un resultado claramente mejor que el CBR.
CRF (factor de calidad constante): en lugar de un bitrate fijas un objetivo de calidad (normalmente entre 0 y 51; valores más bajos, mejor calidad). El codificador ajusta por su cuenta el bitrate necesario para alcanzar esa calidad. El tamaño del archivo no se conoce de antemano, pero la calidad es consistente.
Para archivo y uso general, el CRF suele ser el mejor enfoque: cada escena recibe los datos que necesita. Para H.264 se usa habitualmente el rango CRF 18-23; 18 se considera visualmente casi sin pérdidas y 23 un buen equilibrio.
Velocidad de fotogramas y el problema de la VFR
La velocidad de fotogramas (frame rate) es cuántos fotogramas se muestran por segundo. El cine usa 24 fps, la televisión 25 o 30 fps y, para un movimiento fluido, se usan 60 fps.
Velocidad de fotogramas constante (CFR): los fotogramas llegan a intervalos iguales. Es lo tradicional y lo predecible.
Velocidad de fotogramas variable (VFR): los fotogramas no llegan a intervalos iguales. Los programas de grabación de pantalla y algunas cámaras de móvil ahorran espacio saltándose fotogramas cuando no hay movimiento.
La VFR es una fuente práctica de problemas: muchas herramientas de edición y conversión dan por supuesta una velocidad constante y, al procesar una fuente VFR, interpretan mal las marcas de tiempo. El resultado es un desfase entre audio e imagen que aumenta a medida que avanza el vídeo.
Si tienes un problema de sincronía en una conversión, esto es lo primero de lo que hay que sospechar. La solución es forzar una velocidad de fotogramas constante durante la conversión.
Por qué algunos vídeos no se abren
Para diagnosticarlo, mira por este orden:
1. No hay soporte del códec. La causa más frecuente. El dispositivo puede no poder decodificar H.265 o AV1. Solución: recodificar a H.264.
2. No hay soporte del contenedor. Más raro. Algunos dispositivos antiguos no leen MKV. Solución: remultiplexar a MP4 (si los códecs son compatibles).
3. El códec de audio no está admitido. La imagen llega pero el sonido no. Códecs como AC3 o DTS no funcionan en algunos dispositivos. Solución: convertir el audio a AAC.
4. El perfil o el nivel son demasiado altos. El H.264 tiene perfiles internos (Baseline, Main, High) y algunos dispositivos antiguos solo admiten los bajos. Una resolución y un bitrate altos también pueden superar los límites.
5. El archivo está corrupto o incompleto. La descarga puede haberse quedado a medias.
En resumen
Un archivo de vídeo tiene dos capas: el contenedor mantiene juntas las pistas y el códec las comprime. La mayoría de los problemas de compatibilidad no vienen del contenedor sino del códec, así que el consejo de "conviértelo a MP4" es incompleto por sí solo: hay que determinar también el códec de dentro. Los códecs aprovechan la redundancia entre fotogramas, y eso da origen a la estructura de fotogramas I/P/B y al concepto de GOP; la precisión del avance rápido y la facilidad de corte dependen directamente de eso. H.265 y AV1 son más eficientes, pero el soporte universal por hardware del H.264 vale más en la mayoría de escenarios. Y la velocidad de fotogramas variable es la causa oculta más frecuente del desfase entre audio e imagen en las conversiones.
Preguntas frecuentes
¿Por qué dos vídeos con la misma extensión se comportan de forma distinta?
Porque la extensión solo indica el contenedor, no el códec que lleva dentro. De dos archivos MP4, uno puede llevar vídeo H.264 y funcionar en todas partes, mientras que el otro lleva H.265 y no se abre en un dispositivo antiguo. Del mismo modo, si dentro de un MKV hay AV1, la mayoría de los reproductores por hardware sufren. Para diagnosticar hay que preguntar no 'qué formato' sino 'qué códec'.
¿Qué es un fotograma clave (keyframe) y por qué importa?
Un fotograma clave (I-frame) es un fotograma que contiene una imagen completa por sí mismo; se puede decodificar sin mirar los demás. Los fotogramas intermedios solo guardan el cambio. Por eso, al avanzar rápido en un vídeo, el reproductor salta al fotograma clave más cercano: si los fotogramas clave son escasos, el avance se nota tosco. Además, si los cortes se hacen en los límites de fotograma clave, no hace falta recodificar.
Si el H.265 es mucho mejor que el H.264, ¿por qué no lo usa todo el mundo?
Por tres motivos: los dispositivos antiguos no tienen decodificador por hardware y decodificarlo por software consume batería o provoca tirones, algunos navegadores no lo admiten y la estructura de licencias de patentes es complicada. El H.264, en cambio, tiene soporte por hardware en prácticamente cualquier dispositivo fabricado. Por eso el H.264 sigue siendo la elección más segura y el H.265 se usa sobre todo cuando el ahorro de almacenamiento es crítico.
¿Por qué la velocidad de fotogramas variable (VFR) provoca problemas de sincronía?
En VFR los fotogramas no llegan a intervalos iguales; los programas de grabación de pantalla y algunas cámaras de móvil ahorran espacio saltándose fotogramas cuando no hay movimiento. Muchas herramientas de edición y conversión dan por supuesta una velocidad constante y pueden interpretar mal las marcas de tiempo al procesar una fuente VFR. El resultado es un desfase entre audio e imagen que aumenta a medida que avanza el vídeo.
Pruébalo ahora mismo con Video Format Dönüştür.
Probar Video Format Dönüştür