PDFMove
كيف يُخزَّن المسار الصوتي في ملف الفيديو؟ منطق فصل المسارات والنسخ المباشر
دليل

كيف يُخزَّن المسار الصوتي في ملف الفيديو؟ منطق فصل المسارات والنسخ المباشر

7 دقيقة للقراءة

ماذا يحدث داخل الملف عندما تستخرج الصوت من فيديو؟ الصوت لا "يُفصل" — لأنه موجود أصلًا كمسار منفصل، لكنه مُحزَّم بشكل متشابك مع بيانات الفيديو فحسب. في هذا المقال نشرح البنية الداخلية للحاويات، وكيف تُخزَّن المسارات، والفرق التقني بين النسخ المباشر وإعادة الترميز.

كيف تستقر المسارات داخل الحاوي

لو فتحت ملف فيديو ونظرت بداخله، فلن ترى بنية منظّمة من نوع "الفيديو كله أولًا ثم الصوت كله". بل ستجد تدفقًا تتشابك فيه حزم صغيرة:

[video packet 0.00s][audio packet 0.00s][video packet 0.04s]
[audio packet 0.02s][video packet 0.08s][audio packet 0.04s]...

ويُسمى هذا التجميع المتعدد (multiplexing). وسببه كفاءة التشغيل: فعند مشاهدة فيديو تحتاج إلى صورة لحظة معينة وصوتها في الوقت نفسه. ولو خُزِّنا في طرفين مختلفين من الملف لاضطر المشغّل إلى القراءة ذهابًا وإيابًا باستمرار. وعند البث عبر الشبكة ستكون هذه بنية غير قابلة للاستخدام إطلاقًا.

وdemux (demultiplexing) هو عملية تفكيك هذا التدفق المختلط وجمع كل مسار بمفرده. وهذه أولى خطوات استخراج الصوت.

النقطة الحاسمة: لا يتضمن demux أي عملية فكّ ترميز. فهو يقرأ الحزم، وينظر إلى أي مسار تنتمي، ويفصلها. ولا ينظر إطلاقًا داخل بيانات الصوت.

بنية المسارات والبيانات الوصفية

يوجد في كل حاوٍ بنية تحفظ معلومات عن المسارات. في MP4 هي بنى trak داخل ذرة moov؛ وفي MKV هي عنصر Tracks.

المعلومات المحفوظة لكل مسار:

| المعلومة | معناها | |---|---| | نوع المسار | فيديو، صوت، ترجمة، بيانات وصفية | | معرّف الترميز | AAC, H.264, AC3, Opus... | | المقياس الزمني | وحدة الطوابع الزمنية | | المدة | طول المسار | | اللغة | العربية، الإنجليزية... | | عدد القنوات | أحادي، استيريو، 5.1 | | معدل أخذ العيّنات | 44100, 48000 Hz | | معدل البت | متوسط سرعة البيانات | | البيانات الخاصة بالترميز | معاملات البدء التي يحتاجها مفكّك الترميز |

السطر الأخير مهم: فكثير من الترميزات تحتاج إلى كتلة تهيئة قبل بدء فكّ الترميز. وفي AAC تُسمى هذه AudioSpecificConfig وتحمل بيانات مثل معدل أخذ العيّنات وتوزيع القنوات ومعلومات الملف الشخصي. وتُخزَّن هذه الكتلة في البيانات الوصفية للمسار لا داخل حزم الصوت.

وأثناء استخراج الصوت يجب نقل كتلة التهيئة هذه أيضًا إلى الملف الجديد بشكل صحيح — وإلا فلن يُشغَّل الملف الناتج أو سيُشغَّل بسرعة خاطئة.

النسخ المباشر: الطريق بلا فقدان

في عملية stream copy (نسخ التدفق) يحدث ما يلي:

  1. يُفكَّك الحاوي (demux) وتُفصل حزم الصوت.
  2. لا يُنظر إطلاقًا داخل الحزم. فالبيانات المرمَّزة تبقى كما هي.
  3. يُنشأ حاوٍ جديد (أو ملف خام).
  4. تُكتب الحزم مع طوابعها الزمنية في الحاوي الجديد.
  5. تُنقل البيانات الوصفية للمسار وتهيئة الترميز.

النتيجة: بيانات الصوت متطابقة بتًا ببت. ولا يوجد أي فقدان في الجودة. وتعمل العملية بسرعة نسخ الملفات لأنه لا تُجرى أي حسابات.

الشرط: يجب أن تكون صيغة الملف الهدف قادرة على استيعاب ذلك الترميز.

| ترميز الصوت المصدر | الأهداف القابلة للنسخ المباشر | |---|---| | AAC | .m4a, .aac, .mp4, .mkv | | MP3 | .mp3, .mkv, .mp4 | | Opus | .opus, .ogg, .mkv, .webm | | Vorbis | .ogg, .mkv, .webm | | FLAC | .flac, .mkv | | PCM | .wav, .mkv, .mov | | AC3 / DTS | .ac3, .dts, .mkv |

والنتيجة العملية المستخلصة من هذا الجدول: إن اخترت M4A هدفًا عند استخراج الصوت من مقاطع MP4 فسيجري نسخ مباشر ولن تفقد أي جودة. أما إن أردت المحتوى نفسه بصيغة MP3 فإعادة الترميز تصبح إلزامية.

إعادة الترميز: الطريق ذو الفقدان

إن كانت الصيغة الهدف غير متوافقة مع المصدر، فالعملية تتم على خطوتين:

1. فكّ الترميز. تُفكّ حزم الصوت المرمَّزة إلى PCM (سلسلة عيّنات خام).

2. إعادة الترميز. تُضغط بيانات PCM هذه من الصفر بالترميز الهدف.

والمشكلة عند الانتقال من مصدر ذي فقدان إلى هدف ذي فقدان هي: أن المعلومات التي تخلّص منها المرمّز الأول قد اختفت أصلًا، ثم يتخلص المرمّز الثاني من معلومات مجددًا وفق نموذجه النفسي-السمعي. فيتراكب "التخلّصان" المختلفان ويتراكم الفقدان.

كما أن ضجيج التكميم الذي خلّفه الترميز الأول يبدو للمرمّز الثاني وكأنه "صوت حقيقي"، فينفق ميزانية البتات في محاولة الحفاظ عليه.

لهذا ينبغي إبقاء معدل البت الهدف درجة واحدة فوق المصدر — وهذا لا يُلغي الفقدان لكنه يحدّ منه.

استثناء: إن كان المصدر بلا فقدان (PCM أو FLAC) فإعادة الترميز تضيف فقدانًا مرة واحدة فقط وهذه عملية ترميز طبيعية. وفي هذه الحالة تعتمد الجودة كليًا على معدل البت الذي تختاره.

الطوابع الزمنية والتزامن

كل حزمة تحمل طابعًا زمنيًا. بل اثنين في الحقيقة:

PTS (Presentation Timestamp): متى تُعرض هذه الحزمة أو تُشغَّل.

DTS (Decoding Timestamp): متى ينبغي فكّ ترميز هذه الحزمة.

وهما متطابقان عادةً بالنسبة للصوت. وقد يختلفان بالنسبة للفيديو — لأن الإطارات B تتنبأ بالنظر إلى الأمام، فيختلف ترتيب فكّ الترميز عن ترتيب العرض.

والطوابع الزمنية مهمة في استخراج الصوت لسببين:

إزاحة البداية. في بعض التسجيلات يبدأ المسار الصوتي في وقت مختلف عن الفيديو. ويُعوَّض ذلك في الحاوي عبر edit list أو قيمة إزاحة. وإن لم تُنقل هذه المعلومة أثناء الاستخراج، فسيكون الصوت الناتج منزاحًا بضع مئات من الأجزاء من الألف من الثانية عمّا هو عليه في الفيديو.

الفجوات. في بعض التسجيلات (خصوصًا التدفقات المستقبَلة عبر الشبكة) قد توجد فجوات في حزم الصوت. والنسخ المباشر ينقل هذه الفجوات؛ وبعض الأدوات تملؤها، وبعضها يتجاهلها فتقصر المدة.

مشكلة معدل الإطارات المتغير

تستخدم برامج تسجيل الشاشة وبعض كاميرات الهواتف معدل إطارات متغيرًا (VFR): فتوفّر مساحة بإسقاط الإطارات عند غياب الحركة.

أما الصوت فيتدفق دائمًا بسرعة ثابتة — 48000 عيّنة/ثانية، بلا استثناء.

وهذا التباين يُصعّب الحسابات الزمنية في مقاطع VFR. فبعض الأدوات تحسب متوسط معدل إطارات الفيديو وتفترضه ثابتًا وتفسّر طوابع الصوت الزمنية بناءً عليه. والنتيجة انزياح يزداد كلما تقدّم الفيديو.

فالصوت الذي تستخرجه من تسجيل شاشة مدته ساعة قد يكون منزاحًا بضع ثوانٍ قرب النهاية. والحل هو تحويل الفيديو أولًا إلى معدل إطارات ثابت.

مسارات الصوت المتعددة

يمكن لحاوي MKV أن يحمل عددًا غير محدود من مسارات الصوت. وفي ملف فيلم نموذجي:

  • المسار 1: اللغة الأصلية، 5.1 بترميز AC3
  • المسار 2: دبلجة، 2.0 بترميز AAC
  • المسار 3: تعليق المخرج، 2.0 بترميز AAC
  • المسار 4: الوصف السمعي

وكل مسار يحمل وسم لغته وتوزيع قنواته وترميزه الخاص.

وأدوات الاستخراج تأخذ عادةً المسار الافتراضي أو المسار الأول. وإن أردت مسارًا بعينه فيجب أن توفر الأداة إمكانية اختيار المسار.

وحاوي MP4 يدعم مسارات صوتية متعددة أيضًا لكنه أقل استخدامًا عمليًا وبعض المشغّلات ترى المسار الأول فقط.

مزج القنوات

أصوات الأفلام تكون عادةً بـ 5.1 أو 7.1 قناة. وعند استخراجها إلى ملف استيريو يجري downmix (المزج التنازلي): تُخفَّض ست قنوات إلى قناتين.

والصيغة المعيارية تقريبًا كالتالي:

  • اليسار = الأمامي الأيسر + 0.707 × المركز + 0.707 × الخلفي الأيسر
  • اليمين = الأمامي الأيمن + 0.707 × المركز + 0.707 × الخلفي الأيمن
  • قناة LFE (الترددات المنخفضة) تُهمَل عادةً أو تُضاف بوزن منخفض

وهذا المزج يسبب مشكلة أحيانًا: ففي أصوات الأفلام يكون الحوار في القناة المركزية والمؤثرات في القنوات الجانبية. وإن لم تكن نسب المزج مناسبة فقد يبقى الحوار في الخلفية — ولهذا لا تُسمع الحوارات جيدًا عندما تستخرج الصوت من فيلم.

وبعض الأدوات توفر خيارات "موجّهة للحوار" تمزج القناة المركزية بقوة أكبر.

PCM: المصدر بلا فقدان

في بعض مقاطع الفيديو يُخزَّن الصوت دون أي ضغط، بصيغة PCM. ويوجد في الكاميرات الاحترافية وبعض برامج تسجيل الشاشة وأقراص Blu-ray.

وPCM هو نفس البيانات الموجودة داخل ملفات WAV. وفي هذه الحالة:

  • الاستخراج إلى WAV: نسخ مباشر، بلا أي فقدان.
  • الاستخراج إلى FLAC: ضغط بلا فقدان، تُحفظ البيانات كما هي تمامًا ويصغر الملف.
  • الاستخراج إلى MP3/AAC: أول ترميز ذي فقدان؛ والجودة تعتمد كليًا على معدل البت الذي تختاره، والنتيجة ممتازة عند معدل بت جيد.

والاستخراجات ذات المصدر PCM هي أفضل نقطة انطلاق للتحرير.

باختصار

الصوت في ملف الفيديو موجود كمسار منفصل مُحزَّم بشكل متشابك مع بيانات الفيديو؛ وأولى خطوات الاستخراج هي فصل هذه الحزم (demux) ولا تتضمن هذه الخطوة أي فكّ ترميز. وإن كانت الصيغة الهدف متوافقة مع ترميز المصدر تُنقل الحزم كما هي — نسخ مباشر، بلا فقدان، وعملية تستغرق ثوانٍ. وإن لم تكن متوافقة فيلزم فكّ الترميز وإعادة الترميز ويُضاف فقدان ثانٍ في المصادر ذات الفقدان. والطوابع الزمنية هي ما يحدد التزامن، وهي السبب الرئيسي لمشكلة الانزياح في المصادر ذات معدل الإطارات المتغير. وفي أصوات الأفلام متعددة القنوات قد يؤدي المزج إلى استيريو إلى إضعاف الحوارات — وهذه نتيجة طبيعية لنسب المزج.

الأسئلة الشائعة

ما معنى demux بالضبط؟

هو اختصار لكلمة demultiplexing. داخل الحاوي تُخزَّن بيانات الفيديو والصوت والترجمة على شكل حزم متشابكة — لأنها كلها مطلوبة في آن واحد أثناء التشغيل. وdemux هو تفكيك هذا التدفق المختلط والحصول على كل مسار بمفرده. وهذه أولى خطوات استخراج الصوت ولا تتطلب أي فكّ ترميز.

لماذا تُخزَّن بيانات الصوت والفيديو متشابكة؟

من أجل كفاءة التشغيل. فعند مشاهدة فيديو تحتاج إلى صورة لحظة معينة وصوتها في الوقت نفسه. ولو كانا في طرفين مختلفين من الملف لاضطر المشغّل إلى القراءة ذهابًا وإيابًا باستمرار — وهذا سيكون كارثيًا خصوصًا عند البث عبر الشبكة. والتخزين المتشابك يتيح لك الحصول على الاثنين معًا بقراءة متسلسلة.

لماذا لا أستطيع أحيانًا اختيار الصيغة عند النسخ المباشر؟

لأن النسخ المباشر ينقل البيانات كما هي، ويجب أن يكون الملف الهدف قادرًا على استيعاب تلك البيانات. فيمكنك وضع بيانات صوت AAC في ملف .m4a لكن لا يمكنك وضعها في ملف .mp3 — إذ تتوقع صيغة ملف MP3 بيانات MP3. وإن أردت صيغة هدف مختلفة فإعادة الترميز تصبح إلزامية.

ما هو صوت PCM وفي أي مقاطع فيديو يوجد؟

PCM هو بيانات صوتية خام غير مضغوطة إطلاقًا — وهي نفسها الموجودة داخل ملفات WAV. ويوجد في الكاميرات الاحترافية وبعض برامج تسجيل الشاشة وأقراص Blu-ray. وبما أنه بلا فقدان فيمكن الانتقال منه إلى WAV أو FLAC أثناء الاستخراج دون أي فقدان. حجم الملف كبير لكنه مصدر مثالي للتحرير.

جرّب ذلك الآن باستخدام Videodan Ses Çıkar.

جرّب Videodan Ses Çıkar