Comment extraire le son d'une vidéo ? Choisir entre MP3, WAV et AAC
8 min de lecture
Vous devez récupérer le son d'un enregistrement de conférence, extraire la chanson d'un clip musical, convertir un entretien en fichier audio pour le transcrire ou produire un MP3 d'un cours pour l'écouter sur votre téléphone. Extraire le son d'une vidéo est techniquement une opération simple, mais elle comporte deux décisions déterminantes à prendre correctement.
Ce que fait réellement l'opération
Un fichier vidéo est un conteneur qui réunit une piste vidéo et une piste audio. L'extraction audio isole la piste audio de ce conteneur et l'enregistre comme fichier indépendant.
Il y a ici deux voies, et la différence entre elles influe directement sur la qualité.
La copie (stream copy) : les données audio sont transportées dans le nouveau fichier sans être touchées. Aucun réencodage, aucune perte de qualité. L'opération prend quelques secondes.
Le réencodage (transcode) : le son est décodé et réencodé de zéro dans le format cible. Lors d'un passage entre formats avec perte, une seconde dégradation s'ajoute.
C'est votre format cible qui détermine la voie employée.
Étape 1 : identifiez la piste audio de la vidéo
Cette étape vous permet de décider correctement.
Dans la plupart des vidéos, la piste audio est l'une des suivantes :
| Source vidéo | Codec audio typique | |---|---| | MP4 (téléphone, caméra) | AAC | | MP4 (téléchargé sur internet) | AAC | | MKV (film) | AC3, DTS, AAC ou FLAC | | WEBM | Opus ou Vorbis | | AVI (ancien) | MP3 ou AC3 | | MOV (Apple) | AAC ou PCM |
Pour voir cette information, consultez la fenêtre d'informations sur le fichier de votre lecteur vidéo (dans VLC : Outils > Informations sur les médias).
Pourquoi c'est important : si votre codec source et votre format cible coïncident, vous pouvez opérer par copie et ne perdre aucune qualité.
Étape 2 : choisissez le format cible
Selon votre objectif :
AAC / M4A — si votre source est déjà en AAC (ce qui est généralement le cas des vidéos MP4), c'est le meilleur choix, car une copie est possible et la qualité est rigoureusement préservée. Tous les appareils modernes le lisent.
MP3 — s'il faut de la compatibilité. Les vieux autoradios, les baladeurs MP3 et certains logiciels ne reconnaissent que le MP3. Mais si votre source est en AAC, un réencodage est nécessaire et une certaine dégradation s'ajoute.
WAV — si vous allez monter le son. Il offre un espace de travail sans perte ; aucune dégradation supplémentaire n'a lieu lors des coupes, du débruitage ou des réglages de niveau. Le fichier est très volumineux (~10 Mo par minute) mais, le montage terminé, vous encodez une seule fois vers le format cible.
FLAC — pour archiver, si le son source est sans perte (certains MKV contiennent du FLAC ou du PCM). Si la source est avec perte, la conversion en FLAC n'a aucun sens ; elle n'apporte pas de qualité, elle ne fait qu'alourdir le fichier.
Étape 3 : acceptez le plafond de qualité
C'est le point le plus souvent mal compris.
Le fichier audio obtenu est, au mieux, une copie exacte de la piste audio de la vidéo. Mieux n'est pas possible.
Exemple concret : si la piste audio de votre vidéo est de l'AAC à 128 kbit/s :
- En la copiant en M4A : vous obtenez de l'AAC à 128 kbit/s. Parfait — aucune perte.
- En produisant un MP3 à 192 kbit/s : un fichier de qualité AAC 128 kbit/s, à la taille d'un 192 kbit/s. Il y a perte (transcodage) et la taille est excessive.
- En produisant un MP3 à 320 kbit/s : toujours une qualité de 128 kbit/s, dans un fichier bien plus lourd. La perte diminue un peu mais le plafond est identique.
- En produisant un FLAC : une qualité de 128 kbit/s dans un fichier énorme. Aucun gain.
Règle : porter le débit cible au-dessus de celui de la source n'apporte aucune qualité. Monter d'un cran n'a de sens que pour limiter la perte de transcodage lors d'un passage d'un format avec perte à un autre.
Étape 4 : fixez le débit
Si vous réencodez :
| Son source | Cible MP3 recommandée | |---|---| | AAC 96-128 kbit/s | 160-192 kbit/s | | AAC 160-192 kbit/s | 192-256 kbit/s | | AAC 256 kbit/s et plus | 320 kbit/s | | AC3 / DTS (son de film) | 192-256 kbit/s | | PCM / sans perte | 256-320 kbit/s |
La logique du cran supplémentaire : l'AAC est plus efficace que le MP3 à débit égal. Convertir de l'AAC à 128 kbit/s en MP3 à 128 kbit/s produit un adoucissement perceptible.
Le type de contenu compte aussi :
- Parole, cours, podcast : 96 à 128 kbit/s suffisent largement. Envisagez aussi le mono — dans un enregistrement à une seule voix, la stéréo est superflue et le mono divise le fichier par deux.
- Musique : 192 kbit/s et plus.
- Son de film (multicanal) : il est ramené en stéréo ; 192 à 256 kbit/s suffisent.
Étape 5 : extrayez
Ouvrez l'outil d'extraction audio depuis une vidéo, téléversez votre vidéo et choisissez le format cible. Le traitement s'exécute dans votre navigateur ; votre vidéo ne part pas vers un serveur.
Sur les vidéos longues (un enregistrement de conférence d'une heure, par exemple), l'opération peut prendre du temps. Elle est très rapide si une copie est effectuée ; le réencodage est plus long.
Étape 6 : contrôlez le résultat
La durée est-elle correcte ? La durée du fichier obtenu doit être identique à celle de la vidéo. Sinon, il y a un problème.
Le son est-il présent du début à la fin ? Sur les longs enregistrements en particulier, écoutez à plusieurs endroits au milieu et vers la fin.
La configuration des canaux est-elle correcte ? Dans le son des films, le 5.1 est mixé en stéréo. Cela se passe généralement sans problème, mais dans certains mixages les dialogues peuvent rester en arrière-plan — cela arrive quand le canal central est mal mixé.
Le niveau est-il normal ? S'il est très faible ou très fort, il peut y avoir un problème à la source.
Les métadonnées. Les informations comme le titre du morceau ou l'artiste ne viennent pas de la vidéo ; il faut les ajouter à la main.
Les pistes audio multiples
Les films en MKV et certains enregistrements professionnels transportent plusieurs pistes audio : langue d'origine, doublage, commentaire du réalisateur, audiodescription.
Les outils d'extraction prennent généralement la première piste, qui est le plus souvent la langue d'origine. Si vous voulez une piste précise :
- Vérifiez si l'outil propose une sélection de piste.
- Si ce n'est pas le cas, il faudra peut-être d'abord ramener la vidéo à une seule piste.
- Certains lecteurs (comme VLC) offrent une fonction d'enregistrement séparé des pistes.
Problèmes de synchronisation et de durée
Si le son extrait est plus court ou décalé par rapport à celui de la vidéo, les causes probables sont :
La fréquence d'images variable (VFR). Les captures d'écran et certaines vidéos de téléphone utilisent la VFR, ce qui fausse les calculs d'horodatage. Solution : convertir d'abord la vidéo en fréquence d'images constante.
Des horodatages de départ différents. Sur certains enregistrements, la piste audio commence quelques centaines de millisecondes avant ou après la vidéo. Le conteneur compense cela par une valeur de décalage, mais celle-ci peut se perdre à l'extraction.
Un fichier corrompu ou incomplet. Si le téléchargement s'est interrompu, la dernière partie n'arrive pas.
Cas d'usage fréquents
Écouter un enregistrement de conférence ou de cours. Si vous n'avez pas besoin de regarder la vidéo, n'en récupérer que le son divise le fichier par dix. 96 à 128 kbit/s en mono suffisent largement et soulagent le stockage de votre téléphone.
Préparer un fichier audio pour une transcription. Les outils de conversion en texte réclament un fichier audio. Le WAV ou un MP3 à haut débit offrent une meilleure précision de reconnaissance.
Récupérer une chanson depuis un clip. Le plafond de qualité est la piste audio de la vidéo ; généralement de l'AAC à 128-192 kbit/s. La version de la chanson sur un service de musique est le plus souvent de meilleure qualité.
Archiver un entretien. Conserver le son en FLAC ou en MP3 à haut débit occupe bien moins de place que de garder la vidéo.
Produire un podcast. Extrayez en WAV pour récupérer et monter la piste audio d'un enregistrement vidéo, puis encodez en MP3 après le montage.
En résumé
L'extraction audio consiste à isoler la piste audio du conteneur et peut se faire de deux façons : par copie (sans perte, rapide, mais exigeant que le format cible soit compatible avec la source) ou par réencodage (compatible avec tous les formats mais ajoutant une dégradation). Si votre source est en AAC et que vous voulez du M4A, la copie est la meilleure option. C'est la piste audio de la vidéo qui fixe le plafond de qualité — quel que soit le débit auquel vous montez, ce plafond n'est pas dépassé. Pour du contenu parlé, 96 à 128 kbit/s en mono suffisent ; pour la musique, 192 kbit/s et plus conviennent. Après extraction, n'oubliez pas de contrôler la durée, la présence du son et la configuration des canaux.
Questions fréquentes
Le son que j'extrais peut-il être meilleur que celui de la vidéo ?
Non. Le son obtenu est, au mieux, une copie exacte de la piste audio de la vidéo. Si le son de la vidéo est de l'AAC à 128 kbit/s, même en l'extrayant en MP3 à 320 kbit/s vous obtiendrez un gros fichier de qualité 128 kbit/s. C'est la piste audio de la vidéo qui fixe le plafond de qualité, et ce plafond ne peut pas être dépassé.
Puis-je extraire la piste audio sans la réencoder ?
Oui, cela s'appelle la copie de flux (stream copy) et cela n'entraîne aucune perte de qualité. Si le son de la vidéo est en AAC, il peut être récupéré directement en .m4a ; s'il est en MP3, en .mp3. Mais si votre format cible diffère de la source (du son AAC alors que vous voulez du MP3), un réencodage est obligatoire et une seconde dégradation s'ajoute.
Quelle piste est extraite si la vidéo en comporte plusieurs ?
L'outil prend généralement la première piste audio — qui est le plus souvent la langue d'origine. Les films en MKV peuvent transporter plusieurs pistes de langues et de commentaires. Si vous voulez une piste précise, il faut vérifier si l'outil propose une sélection de piste, ou ramener au préalable la vidéo à une seule piste.
Le son extrait est plus court ou décalé par rapport à la vidéo, pourquoi ?
Cela vient généralement du fait que la vidéo source utilise une fréquence d'images variable, ou que la piste audio commence à un horodatage différent de celui de la vidéo. Sur certains enregistrements, la piste audio commence quelques centaines de millisecondes avant ou après la vidéo. Si le problème persiste, essayez de convertir d'abord la vidéo en fréquence d'images constante puis d'extraire le son.
Essayez dès maintenant avec Videodan Ses Çıkar.
Essayer Videodan Ses Çıkar