PDFMove
النسخ المباشر وإعادة الترميز في دمج الفيديو: الفرق التقني
دليل

النسخ المباشر وإعادة الترميز في دمج الفيديو: الفرق التقني

7 دقيقة للقراءة

يبدو دمج فيديوين أمرًا بسيطًا: أضف أحدهما خلف الآخر. لكن في الواقع تدخل في الخلفية تهيئات المرمّزات وحدود الإطارات المفتاحية وحسابات الطوابع الزمنية — وهي التي تحدد ما إذا كانت العملية ستستغرق ثوانٍ أم دقائق، وما إذا كانت الجودة ستُحفظ أم لا.

المقاربتان الأساسيتان

النسخ المباشر (stream copy / concat demuxer): تُنقل بيانات الفيديو والصوت إلى الملف الجديد دون أي فكّ ترميز. تُعاد كتابة الحاوي فحسب وتُصحَّح الطوابع الزمنية.

  • فقدان الجودة: صفر
  • المدة: بسرعة نسخ الملفات
  • الشرط: توافق صارم في المعاملات

إعادة الترميز (transcode / concat filter): تُفكّ ترميز جميع الأجزاء، وتُحوَّل إلى صيغة مشتركة، ثم يُعاد ترميزها كتدفق واحد.

  • فقدان الجودة: موجود
  • المدة: دقائق أو ساعات
  • الشرط: لا يوجد، ممكن دائمًا

لماذا يفرض النسخ المباشر شروطًا بهذه الصرامة

يتلقى مفكّك ترميز الفيديو معلومات تهيئة قبل أن يبدأ فكّ التدفق. في H.264 تُسمى هذه SPS (Sequence Parameter Set) وPPS (Picture Parameter Set) وتتضمن ما يلي:

  • الدقة (العرض والارتفاع)
  • الملف الشخصي والمستوى (Baseline/Main/High)
  • صيغة الكروما (4:2:0, 4:2:2, 4:4:4)
  • عمق البت
  • معلومات إعادة ترتيب الإطارات

تُعطى هذه المعلومات في بداية التدفق فيهيّئ المفكّك نفسه بناءً عليها — يحجز الذاكرة ويحدد أحجام المخازن المؤقتة.

تخيّل الآن أنك تدمج فيديو بدقة 1080p مع فيديو بدقة 720p عبر النسخ المباشر. تتغير الدقة في منتصف التدفق فيلزم إعادة تشغيل المفكّك. بعض المشغّلات تستطيع ذلك، ومعظمها لا يستطيع — والنتيجة صورة مشوّهة أو تجمّد أو انهيار المشغّل.

لهذا فإن قائمة التوافق المطلوبة للنسخ المباشر هي:

| المعامل | هل التوافق مطلوب | |---|---| | ترميز الفيديو | نعم، قطعًا | | الدقة | نعم، قطعًا | | الملف الشخصي / المستوى | نعم | | صيغة الكروما | نعم | | معدل الإطارات | نعم (من أجل التوقيت) | | ترميز الصوت | نعم | | معدل أخذ عيّنات الصوت | نعم | | عدد قنوات الصوت | نعم | | معدل البت | لا (يمكن أن يتغيّر) |

السطر الأخير مهم: معدل البت متغيّر أصلًا داخل التدفق، ولذلك لا يتطلب توافقًا.

مرونة MKV

يتوقع حاوي MP4 تهيئة واحدة على مستوى المسار. وتغيّر الدقة أو الملف الشخصي في منتصف التدفق أمر خارج المعيار.

أما MKV فأكثر مرونة: يمتلك بنية تتيح حمل أقسام ذات معاملات مختلفة داخل الملف نفسه، وكثير من مشغّلات MKV تتكيّف مع التغيّرات في منتصف التدفق.

النتيجة العملية: قد يكون دمج مصادر مختلطة في MKV ممكنًا أحيانًا دون إعادة ترميز، بينما لا يكون كذلك في MP4. لكن هذا سلوك يعتمد على المشغّل وليس مضمونًا. وإن كنت ستوزّع الملف على جمهور واسع، فالطريق الموثوق هو إعادة الترميز.

إعادة كتابة الطوابع الزمنية

حتى عند النسخ المباشر هناك شيء يتغيّر حتمًا: الطوابع الزمنية.

كل ملف فيديو يبدأ طوابعه الزمنية من الصفر. فالفيديو الأول مطبوع من 0 إلى 120 ثانية، والفيديو الثاني مطبوع أيضًا من 0 إلى 90 ثانية.

وإن أضفتهما ببساطة واحدًا تلو الآخر، فسيرى المشغّل طوابع الفيديو الثاني ويظنها "عودة إلى البداية". والنتيجة: ينتهي الفيديو عند الثانية 120 أو يرتبك المشغّل.

لذا تضيف أداة الدمج مدة الفيديو الأول إلى جميع الطوابع الزمنية للفيديو الثاني:

Video 1: PTS 0, 40, 80, ... 119960 (ms)
Video 2 (original): PTS 0, 40, 80, ... 89960
Video 2 (shifted): PTS 120000, 120040, ... 209960

وهذا يُنشئ محورًا زمنيًا متصلًا فيرى المشغّل الفيديو كتدفق واحد.

وتُجرى العملية نفسها على المسار الصوتي، وإزاحة الصوت والفيديو بالمقدار نفسه أمر حاسم للحفاظ على التزامن.

حدّ الإطار المفتاحي

تخزّن مرمّزات الفيديو الإطارات على ثلاثة أنواع:

  • الإطار I (الإطار المفتاحي): صورة كاملة بحد ذاتها. يمكن فكّ ترميزه بشكل مستقل.
  • الإطار P: يعتمد على الإطارات السابقة.
  • الإطار B: يعتمد على الإطارات السابقة واللاحقة معًا.

وتُرتَّب هذه في مجموعات تُسمى GOP (Group of Pictures)، وتبدأ كل مجموعة بإطار I.

وأثر ذلك على الدمج: عند النسخ المباشر يجب أن تتوافق نقطة القص مع إطار I. لا يمكنك البدء من إطار P لأن ذلك الإطار يحتاج إلى الإطارات التي تسبقه، وهي غير موجودة في الملف الجديد.

النتيجة: إن كنت تقصّ الفيديو وتدمجه وتستخدم النسخ المباشر، فالأداة تقرّب نقطة القص إلى أقرب إطار مفتاحي. وقد يحدث القص قبل الثانية التي تريدها أو بعدها ببضع ثوانٍ.

وإن أردت قصًا بدقة الإطار الواحد فيجب إعادة ترميز ذلك المقطع. وتستخدم بعض الأدوات مقاربة ذكية: فتعيد ترميز مجموعات الصور (GOP) عند نقاط القص فقط، وتنسخ ما تبقى مباشرة. ويُعرف هذا باسم "smart rendering" ويجمع بين السرعة والدقة.

وإن كنت تدمج ملفات كاملة (بلا قص) فلن تواجه هذه المشكلة — إذ يبدأ كل ملف بإطار I أصلًا.

مشكلة معدل الإطارات المتغير

معدل الإطارات الثابت (CFR): تأتي الإطارات على فترات متساوية. والطوابع الزمنية متتالية حسابية منتظمة.

معدل الإطارات المتغير (VFR): لا تأتي الإطارات على فترات متساوية. كاميرات الهواتف تُسقط الإطارات بحسب الإضاءة، وبرامج تسجيل الشاشة تُسقطها بحسب غياب الحركة.

ويسبب VFR مشكلتين في الدمج:

1. حساب المدة يصبح خاطئًا. إن افترضت الأداة معدل إطارات متوسطًا وحسبت المدة على أنها عدد الإطارات / fps، فستحصل على قيمة تختلف عن المدة الحقيقية. وعندها يُحسب مقدار إزاحة الفيديو الثاني بشكل خاطئ.

2. الانزياح يتراكم. إن وُجد خطأ صغير في كل جزء، فهذه الأخطاء تتجمع. وعند دمج خمسة أجزاء تظهر مشكلة ملحوظة في تزامن الشفاه قرب النهاية.

والعلامة مميزة: التزامن جيد في بداية الفيديو ويفسد قرب نهايته.

الحل: تحويل الأجزاء إلى معدل إطارات ثابت قبل الدمج. وهذه خطوة إعادة ترميز إضافية لكنها تحل المشكلة من جذرها.

وإن كنت تعمل بانتظام مع مقاطع مصوّرة بالهاتف، فإدراج هذه الخطوة في سير عملك عادة جيدة.

التوافق من جهة الصوت

تنطبق شروط مشابهة على الصوت:

توافق الترميز: إن كان أحدهما AAC والآخر MP3 فالنسخ المباشر غير ممكن.

معدل أخذ العيّنات: خليط 44.1 kHz و48 kHz يؤدي إلى تشغيل أحد الأجزاء بسرعة خاطئة إن لم يُحوَّل بشكل سليم.

عدد القنوات: خليط الأحادي والاستيريو يستلزم تحويلًا.

كما أن مرمّزات الصوت ذات الفقدان تعمل على أساس الكتل، ولذلك يوجد في بداية كل ملف ونهايته تأخير المرمّز وعيّنات حشو. وعند الدمج بالنسخ المباشر تُحفظ هذه الفجوات فيظهر صمت قصير عند كل انتقال.

ولا توجد هذه المشكلة في جانب الفيديو (فإطارات الفيديو لا تحتاج إلى حشو كتلي)، وبالتالي قد ينشأ فرق توقيت صغير بين الصوت والفيديو. وفي عمليات الدمج الطويلة قد يتراكم هذا الفرق.

وإن أردت صوتًا بلا انقطاع فيجب إعادة ترميز الصوت.

اختيار الهدف عند إعادة الترميز

إن كانت إعادة الترميز حتمية فعليك اختيار المعاملات الهدف:

الدقة. استهدف القيمة الأكثر استخدامًا. إن كان في الخليط أربعة ملفات بدقة 1080p وواحد بدقة 720p فاختر 1080p — عندها يُكبَّر جزء واحد فقط.

معدل الإطارات. اختيار الأعلى يعطي نتيجة أكثر سلاسة. رفع فيديو بمعدل 30 fps إلى 60 fps يكرر الإطارات (ولا يضيف معلومات جديدة) لكن الأجزاء بمعدل 60 fps تحافظ على سلاستها.

نسبة العرض إلى الارتفاع. إن وُجدت نسب مختلفة فإضافة أشرطة سوداء (letterbox/pillarbox) تحفظ المحتوى؛ أما الاقتصاص فيملأ الشاشة لكنه يُفقد المحتوى.

معدل البت / الجودة. استخدام هدف جودة قائم على CRF يعطي عادةً نتيجة أفضل من معدل البت الثابت، لأن كل مشهد يأخذ من البيانات بقدر حاجته.

الترميز. H.264 هو الخيار الأكثر أمانًا؛ فهو يعمل في كل مكان.

باختصار

النسخ المباشر في دمج الفيديو هو الطريق المثالي الذي ينتهي خلال ثوانٍ ودون أي فقدان في الجودة — لكن له شروطًا صارمة: يجب أن يتطابق الترميز والدقة والملف الشخصي وصيغة الكروما ومعدل الإطارات وجميع معاملات الصوت. وحتى مع تحقق هذا الشرط يجب إعادة كتابة الطوابع الزمنية؛ وإزاحة الصوت والفيديو بالمقدار نفسه هي ما يحدد التزامن. وإن كنت تقصّ، فالنسخ المباشر يصطدم بحدود الإطارات المفتاحية وتُقرَّب نقطة القص. والمصادر ذات معدل الإطارات المتغير هي السبب الأكثر شيوعًا لانزياح التزامن التراكمي ويجب تحويلها مسبقًا إلى معدل إطارات ثابت. وإن تعذّر التوافق فإعادة الترميز مطلوبة، وينبغي اتخاذ قرارات الدقة الهدف ومعدل الإطارات ونسبة العرض إلى الارتفاع بوعي.

الأسئلة الشائعة

لماذا لا يكفي الترميز نفسه، بل يجب أن تتطابق المعاملات أيضًا؟

لأن مفكّك الترميز يتلقى معلومات تهيئة قبل أن يبدأ فكّ ترميز الفيديو: الدقة، والملف الشخصي، والمستوى، وصيغة الكروما. وإن تغيّرت هذه القيم في منتصف التدفق فيجب إعادة تشغيل المفكّك، وكثير من المشغّلات لا تفعل ذلك بشكل سليم. لهذا يتطلب النسخ المباشر تطابق جميع معاملات التدفق، لا الترميز وحده.

هل يمكنني قصّ الفيديو من الثانية التي أريدها بالضبط ثم دمجه؟

إن كنت تستخدم النسخ المباشر فلا — يجب أن تتوافق نقطة القص مع إطار مفتاحي (I-frame)، لأن الإطارات البينية تعتمد على الإطارات السابقة ولا يمكن فكّ ترميزها بمفردها. تقوم الأداة بالتقريب إلى أقرب إطار مفتاحي. وإن أردت قصًا بدقة الإطار الواحد فيجب إعادة ترميز ذلك المقطع.

لماذا يجب إعادة كتابة الطوابع الزمنية؟

لأن كل ملف فيديو يبدأ طوابعه الزمنية من الصفر. وعند إضافة فيديوين واحدًا تلو الآخر تبدأ طوابع الفيديو الثاني من الصفر أيضًا، فيفسّر المشغّل ذلك على أنه 'عودة إلى البداية'. لذا تضيف أداة الدمج مدة الفيديو الأول إلى جميع الطوابع الزمنية للفيديو الثاني فتُنشئ محورًا زمنيًا متصلًا.

لماذا يُعدّ حاوي MKV أكثر مرونة في الدمج؟

يمتلك MKV بنية تتيح حمل أقسام ذات معاملات مختلفة داخل الملف نفسه، وكثير من مشغّلات MKV تتكيّف مع التغيّرات في منتصف التدفق. أما MP4 فأكثر صرامة؛ إذ يتوقع تهيئة واحدة على مستوى المسار. لهذا قد يكون دمج مصادر مختلطة في MKV ممكنًا أحيانًا دون إعادة ترميز، بينما لا يكون كذلك في MP4.

جرّب ذلك الآن باستخدام Video Birleştir.

جرّب Video Birleştir