PDFMove
ما البيانات الوصفية في PDF؟ الفرق بين XMP وقاموس معلومات المستند
دليل

ما البيانات الوصفية في PDF؟ الفرق بين XMP وقاموس معلومات المستند

6 دقيقة للقراءة

داخل ملف PDF طبقة معلومات لا تظهر في الصفحات إطلاقاً: من أنشأه، وبأي برنامج، ومتى، وفي أي موضوع. وهذه الطبقة مؤلفة في الحقيقة من نظامين مختلفين لا نظام واحد، وقد يتعارضان. نشرح في هذا المقال بنية البيانات الوصفية في PDF، ولماذا يعيش النظامان جنباً إلى جنب، وماذا يعني ذلك من زاوية الخصوصية.

الطبقة الأولى: قاموس معلومات المستند

هي البنية البسيطة الموجودة منذ الإصدارات الأولى لـ PDF. وهي قاموس يُشار إليه بالمفتاح /Info في قسم trailer من الملف، وفيه أزواج مفتاح-قيمة:

<< /Title (Annual Activity Report)
   /Author (Aisha Demir)
   /Subject (Fiscal year 2025)
   /Keywords (report, financial, 2025)
   /Creator (Microsoft Word)
   /Producer (Adobe PDF Library 17.0)
   /CreationDate (D:20250312143022+03'00')
   /ModDate (D:20250315091544+03'00')
>>

معاني الحقول:

| المفتاح | معناه | |---|---| | /Title | عنوان المستند | | /Author | المؤلف | | /Subject | الموضوع | | /Keywords | الكلمات المفتاحية | | /Creator | التطبيق المصدر الذي أنشأ المستند (Word، وInDesign) | | /Producer | المكتبة التي حوّلته إلى PDF | | /CreationDate | زمن الإنشاء | | /ModDate | زمن آخر تعديل |

ويُخلَط كثيراً بين /Creator و/Producer لكن التمييز منطقي: فقد كتبت المستند في Word (Creator)، وحوّله محرك PDF في Word أو إضافة ما إلى PDF (Producer). فيعطي كل منهما معلومة مختلفة، وكلاهما يحمل أثراً عنك.

وصيغة التاريخ لافتة أيضاً: فالتعبير D:20250312143022+03'00' يعني 12 مارس 2025، الساعة 14:30:22، في المنطقة الزمنية UTC+3. ومعلومة المنطقة الزمنية قرينة على الجغرافيا التي أعددت المستند فيها.

وحدّ هذا النظام واضح: فلديه قائمة حقول ثابتة، ولا يستطيع حمل بيانات مهيكلة، ولا يحفظ معلومات اللغة، ولا يدعم القيم المتعددة.

الطبقة الثانية: حزمة XMP

طُوّر XMP‏ (Extensible Metadata Platform) في أوائل الألفينيات للحاجة إلى بيانات وصفية غنية وقابلة للتوسيع في ملفات الوسائط المتعددة (الصور، والفيديو، والمستندات). ثم أُضيف إلى PDF لاحقاً.

وXMP بنية قائمة على XML وتقيم في الملف كتدفق مضمّن:

<x:xmpmeta xmlns:x="adobe:ns:meta/">
 <rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#">
  <rdf:Description rdf:about=""
    xmlns:dc="http://purl.org/dc/elements/1.1/">
   <dc:title>
    <rdf:Alt>
     <rdf:li xml:lang="ar">Annual Activity Report</rdf:li>
     <rdf:li xml:lang="en">Annual Report</rdf:li>
    </rdf:Alt>
   </dc:title>
   <dc:creator>
    <rdf:Seq><rdf:li>Aisha Demir</rdf:li></rdf:Seq>
   </dc:creator>
  </rdf:Description>
 </rdf:RDF>
</x:xmpmeta>

ما يجلبه XMP:

  • قيم متعددة اللغات. فيمكن حفظ العنوان بالعربية والإنجليزية معاً.
  • مؤلفون متعددون. فيمكن حفظ أكثر من مؤلف كقائمة مرتبة.
  • قابلية التوسيع. فتستطيع أي مؤسسة إضافة حقولها الخاصة بفضاءات أسماء (namespace) مختلفة.
  • مخططات قياسية. إذ تُستخدم مخططات راسخة مثل Dublin Core‏ (dc:)، وIPTC للتصوير، وXMP Rights لإدارة الحقوق.

ويُضمَّن XMP في الملف عادةً كـنص صِرف غير مضغوط. وهذا اختيار مقصود: لتستطيع أنظمة البحث والفهرسة العثور على حزمة XMP وقراءتها دون تحليل الملف تحليلاً كاملاً. والنتيجة العملية أنك تستطيع قراءة محتوى XMP حين تفتح ملف PDF في محرر نصوص.

حين يتعارض النظامان

كثير من ملفات PDF يحمل الطبقتين وقد لا تتطابق القيم:

  • فبرنامج يحدّث معلومات المستند ولا يمسّ XMP.
  • وبرنامج آخر يحدّث XMP ويترك القديم.
  • ومنظّف بيانات وصفية يحذف أحدهما فقط.

ويوصي المعيار بأولوية XMP عند التعارض. لكن التطبيقات غير متسقة: فبعض العارضات يعرض معلومات المستند، وبعضها يقرأ XMP، وبعضها يأخذ الممتلئ منهما.

والنتيجة جدية من زاوية الخصوصية. فإن حذفت اسم المؤلف من معلومات المستند وتركته في XMP، بدا الملف نظيفاً في نافذة خصائص المستند لكن اسمك يظهر عند قراءته بأداة أخرى. وهذا أشيع أسباب حكايات «ظننت أنني نظّفت البيانات الوصفية».

وينبغي أن يعالج التنظيف الموثوق الاثنين. وطريقة خشنة لكنها فعالة للتحقق: افتح الملف المنظَّف في محرر نصوص (دون حفظ) وابحث عن تعابير مثل xmpmeta وdc:creator وdc:title.

ما تكشفه البيانات الوصفية

قرائن ملموسة:

الهوية. فحقلا /Author وdc:creator يُملآن تلقائياً في أغلب الأحيان من اسم المستخدم لديك في نظام التشغيل. وهذا كشف مباشر للهوية في مستند يُرسَل بلا هوية.

بقايا القوالب. فإن نسخت عرض سعر من ملف أعددته لعميل سابق، فقد يكون اسم ذلك العميل ما زال مكتوباً في العنوان.

الخط الزمني. فـCreationDate وModDate يبيّنان مسار إعداد المستند الفعلي. كما أن معلومة المنطقة الزمنية قرينة جغرافية.

ملف البرمجيات. فحقل /Producer يقول أي مكتبة وأي إصدار استخدمت. وهذا يعطي معلومات عن سير عملك المؤسسي.

الحقول المؤسسية. فبعض منتِجي PDF المؤسسيين يضيف بفضاءات أسماء XMP خاصة حقولاً مثل رمز القسم ومستوى التصنيف ورقم المرجع الداخلي.

PDF/A وإلزامية البيانات الوصفية

تفرض صيغة PDF/A المصممة للأرشفة طويلة الأمد قواعد صارمة في مسألة البيانات الوصفية:

  • XMP إلزامي. فينبغي أن يحمل المستند حزمة XMP.
  • يلزم معرّف التوافق. فينبغي بيان مستوى PDF/A الملتزَم به بالحقلين pdfaid:part وpdfaid:conformance داخل XMP.
  • يُتوقَّع الاتساق. فينبغي أن تتطابق القيم في معلومات المستند مع مقابلاتها في XMP.
  • ينبغي تعريف المخططات الخاصة. فإن استُخدمت حقول XMP غير قياسية وجب شرح مخططها داخل الملف.

والنتيجة العملية لذلك: أن تنظيف البيانات الوصفية لمستند PDF/A بلا انتباه يُفسد التوافق. فلا يجتاز الملف الذي ترسله إلى نظام الأرشفة اختبارَ التحقق. وينبغي صون حقول التوافق عند تحرير البيانات الوصفية في مستندات PDF/A.

المواضع التي لا تصل إليها البيانات الوصفية

من المهم توضيح حدود تنظيف البيانات الوصفية، لأن الإحساس الزائف بالأمان خطر:

محتوى الصفحة. فالبيانات الوصفية معلومات عن المستند؛ ولا تؤثر في أي شيء مكتوب في الصفحة. فإن كان اسمك في الصفحة الثالثة بقي هناك.

المحتوى المخفي. فالنص المغطى بمربع أسود جزء من محتوى الصفحة ولا يُزال بتنظيف البيانات الوصفية. ويلزم التنقيح.

الملفات المضمّنة. فقد تحمل ملفات PDF ملفات مرفقة (جدول Excel مصدري، ومرفقات). وهذه كائنات منفصلة.

بيانات حقول النماذج. فقيم حقول نموذج معبّأ تقيم في بنية AcroForm. ويلزم التسطيح.

تاريخ الإصدارات. ففي ملف PDF يستخدم التحديث التزايدي قد تبقى الإصدارات السابقة في الملف. وتلزم عملية تعيد كتابة الملف كاملاً.

الخطوط المضمّنة. ففي حالات نادرة تحمل بعض الخطوط المضمّنة اسم صاحب الترخيص في بياناتها الوصفية الخاصة.

الجانب النافع من البيانات الوصفية

تحدثنا حتى هنا عن المخاطر دائماً، لكن للبيانات الوصفية فوائد حقيقية أيضاً:

إدارة المستندات المؤسسية. فالأنظمة التي تدير آلاف المستندات تفهرس وتصنّف وتبحث وفق البيانات الوصفية. والحقول المملوءة بصورة صحيحة تحدد جودة الأرشيف.

الظهور على الويب. فحقل العنوان يظهر في لسان المتصفح وفي بعض نتائج البحث. وإن تُرك فارغاً عُرض اسم الملف (مثل "report_final_v3_LAST.pdf") وهذا لا يبدو احترافياً.

إدارة الحقوق. فيمكن بمخطط XMP Rights تضمين معلومات حقوق النشر وشروط الاستخدام ومعلومات الاتصال في المستند.

الأرشفة طويلة الأمد. فإلزامية البيانات الوصفية في PDF/A لهذا بالضبط: ليستطيع من يجد الملف بعد خمسين عاماً معرفة ما هو المستند من الملف نفسه.

الخلاصة

البيانات الوصفية في PDF بنية ذات طبقتين: قاموس معلومات المستند القديم البسيط، وحزمة XMP الغنية القائمة على XML. وهما يعيشان جنباً إلى جنب وقد يتعارضان وتقرأ برامج مختلفة أحدهما دون الآخر — ولذلك يجب معالجة الاثنين في التنظيف لغرض الخصوصية. والبيانات الوصفية تحمل قرائن حقيقية عنك من اسم المؤلف إلى المنطقة الزمنية، ولأن معظمها يُملأ تلقائياً فهي تُشارَك دون انتباه. في المقابل، البيانات الوصفية المملوءة بصورة صحيحة أصل ثمين في المستندات المنشورة على الويب والمؤرشفة؛ وPDF/A يجعلها إلزامية. والحدّ الذي ينبغي ألا يُنسى: تنظيف البيانات الوصفية لا يمسّ محتوى الصفحة ولا الملفات المضمّنة ولا تاريخ الإصدارات.

الأسئلة الشائعة

لماذا يوجد نظاما بيانات وصفية مختلفان في PDF؟

لأسباب تاريخية. فقاموس معلومات المستند موجود منذ الإصدارات الأولى للصيغة ويتألف من أزواج مفتاح-قيمة بسيطة. أما XMP فطُوّر في أوائل الألفينيات استجابةً للحاجة إلى بيانات وصفية غنية وقابلة للتوسيع في ملفات الوسائط المتعددة، ثم أُضيف إلى PDF لاحقاً. وأُبقي على النظام القديم للتوافق الرجعي، ومن ثم يعيش النظامان جنباً إلى جنب.

إن اختلفت القيم في النظامين فأيهما يُعتدّ به؟

يوصي المعيار بأولوية XMP عند التعارض لكن التطبيقات غير متسقة في هذا. فبعض العارضات يعرض معلومات المستند، وبعضها يقرأ XMP، وبعضها يأخذ الممتلئ منهما. ولذلك ينبغي معالجة الاثنين عند تنظيف البيانات الوصفية — فحذف أحدهما وترك الآخر يعني بقاء المعلومة ظاهرة في برنامج ما.

كيف تقيم كتلة XMP في الملف، هل هي مضغوطة؟

تُضمَّن XMP في الملف عادةً كـ XML نصي صِرف غير مضغوط. والسبب إتاحة قراءة البيانات الوصفية لملف دون تحليله تحليلاً كاملاً — فتستطيع أنظمة البحث والفهرسة مسح الملف والعثور على حزمة XMP. والنتيجة العملية: أنك تستطيع قراءة محتوى XMP إن فتحت ملف PDF في محرر نصوص.

ماذا يشترط معيار الأرشفة PDF/A في مسألة البيانات الوصفية؟

يوجب PDF/A وجود بيانات XMP الوصفية ويشترط أن يكون فيها معرّف خاص يبيّن مستوى PDF/A الذي يلتزم به المستند. كما يُتوقَّع اتساق القيم في قاموس معلومات المستند مع مقابلاتها في XMP. ولذلك فإن تنظيف البيانات الوصفية لمستند PDF/A بلا انتباه قد يُفسد توافق الملف.

جرّب ذلك الآن باستخدام Metadata Düzenle/Temizle.

جرّب Metadata Düzenle/Temizle