PDF Metadata Nedir? XMP ve Belge Bilgisi Sözlüğü Farkı
6 dk okuma
Bir PDF dosyasının içinde, sayfalarda hiç görünmeyen bir bilgi katmanı bulunur: kim oluşturdu, hangi programla, ne zaman, hangi konuda. Bu katman aslında bir değil iki farklı sistemden oluşur ve ikisi çelişebilir. Bu yazıda PDF metadata'sının yapısını, iki sistemin neden yan yana yaşadığını ve bunun gizlilik açısından ne anlama geldiğini açıklıyoruz.
Birinci katman: Belge Bilgisi sözlüğü
PDF'in ilk sürümlerinden beri var olan basit yapıdır. Dosyanın trailer bölümünde /Info anahtarıyla işaret edilen bir sözlüktür ve içinde anahtar-değer çiftleri bulunur:
<< /Title (Yillik Faaliyet Raporu)
/Author (Ayse Demir)
/Subject (2025 mali yili)
/Keywords (rapor, mali, 2025)
/Creator (Microsoft Word)
/Producer (Adobe PDF Library 17.0)
/CreationDate (D:20250312143022+03'00')
/ModDate (D:20250315091544+03'00')
>>
Alanların anlamları:
| Anahtar | Anlamı |
|---|---|
| /Title | Belgenin başlığı |
| /Author | Yazar |
| /Subject | Konu |
| /Keywords | Anahtar kelimeler |
| /Creator | Belgeyi oluşturan kaynak uygulama (Word, InDesign) |
| /Producer | PDF'e dönüştüren kütüphane |
| /CreationDate | Oluşturma zamanı |
| /ModDate | Son değiştirme zamanı |
/Creator ile /Producer ayrımı sık karıştırılır ama mantıklıdır: belgeyi Word'de yazdınız (Creator), Word'ün PDF motoru veya bir eklenti onu PDF'e çevirdi (Producer). İkisi farklı bilgi verir ve ikisi de sizin hakkınızda iz taşır.
Tarih formatı da dikkat çekicidir: D:20250312143022+03'00' ifadesi 12 Mart 2025, 14:30:22, UTC+3 saat dilimi anlamına gelir. Saat dilimi bilgisi, belgeyi hangi coğrafyada hazırladığınıza dair bir ipucudur.
Bu sistemin sınırı belli: sabit bir alan listesi vardır, yapılandırılmış veri taşıyamaz, dil bilgisi tutamaz, çoklu değer desteklemez.
İkinci katman: XMP paketi
2000'lerin başında, çoklu ortam dosyalarında (fotoğraf, video, belge) zengin ve genişletilebilir meta veri ihtiyacı için XMP (Extensible Metadata Platform) geliştirildi. Sonradan PDF'e de eklendi.
XMP, XML tabanlı bir yapıdır ve dosyaya gömülü bir akış olarak durur:
<x:xmpmeta xmlns:x="adobe:ns:meta/">
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#">
<rdf:Description rdf:about=""
xmlns:dc="http://purl.org/dc/elements/1.1/">
<dc:title>
<rdf:Alt>
<rdf:li xml:lang="tr">Yillik Faaliyet Raporu</rdf:li>
<rdf:li xml:lang="en">Annual Report</rdf:li>
</rdf:Alt>
</dc:title>
<dc:creator>
<rdf:Seq><rdf:li>Ayse Demir</rdf:li></rdf:Seq>
</dc:creator>
</rdf:Description>
</rdf:RDF>
</x:xmpmeta>
XMP'nin getirdikleri:
- Çok dilli değerler. Başlık hem Türkçe hem İngilizce olarak saklanabilir.
- Çoklu yazar. Sıralı bir liste olarak birden fazla yazar tutulabilir.
- Genişletilebilirlik. Farklı ad alanları (namespace) ile herhangi bir kurum kendi alanlarını ekleyebilir.
- Standart sözlükler. Dublin Core (
dc:), fotoğrafçılık için IPTC, hak yönetimi için XMP Rights gibi yerleşik şemalar kullanılır.
XMP genellikle sıkıştırılmamış düz metin olarak dosyaya gömülür. Bu bilinçli bir tercihtir: arama ve indeksleme sistemleri dosyayı tam olarak ayrıştırmadan XMP paketini bulup okuyabilsin diye. Pratik sonucu, bir PDF'i metin editöründe açtığınızda XMP içeriğini okuyabilmenizdir.
İki sistem çeliştiğinde
Birçok PDF her iki katmanı da taşır ve değerler birbirini tutmayabilir:
- Bir program Belge Bilgisi'ni günceller, XMP'ye dokunmaz.
- Başka bir program XMP'yi günceller, eskisini bırakır.
- Bir metadata temizleyici sadece birini siler.
Standart, çakışma durumunda XMP'nin öncelikli olmasını önerir. Ama uygulamalar tutarsızdır: bazı görüntüleyiciler Belge Bilgisi'ni gösterir, bazıları XMP'yi okur, bazıları hangisi doluysa onu alır.
Gizlilik açısından sonucu ciddidir. Yazar adını Belge Bilgisi'nden silip XMP'de bıraktıysanız, belge özellikleri penceresinde temiz görünür ama başka bir araçla okunduğunda adınız ortaya çıkar. Bu, "metadata temizledim sanıyordum" hikayelerinin en yaygın sebebidir.
Güvenilir bir temizlik, ikisini de ele almalıdır. Doğrulama için kaba ama etkili bir yöntem: temizlenmiş dosyayı bir metin editöründe açıp (kaydetmeden) xmpmeta, dc:creator, dc:title gibi ifadeleri aratmak.
Metadata neyi ele veriyor
Somut ipuçları:
Kimlik. /Author ve dc:creator alanları çoğu zaman işletim sistemi kullanıcı adınızdan otomatik doldurulur. Anonim gönderilen bir belgede bu doğrudan kimlik ifşasıdır.
Şablon kalıntısı. Bir teklifi önceki bir müşteriye hazırladığınız dosyadan kopyaladıysanız, başlıkta hâlâ o müşterinin adı yazıyor olabilir.
Zaman çizelgesi. CreationDate ve ModDate belgenin gerçek hazırlanma sürecini gösterir. Ayrıca saat dilimi bilgisi coğrafi bir ipucudur.
Yazılım profili. /Producer alanı hangi kütüphaneyi ve sürümünü kullandığınızı söyler. Bu, kurumsal iş akışınız hakkında bilgi verir.
Kurumsal alanlar. Bazı kurumsal PDF üreticileri özel XMP ad alanlarıyla departman kodu, sınıflandırma seviyesi, dahili referans numarası gibi alanlar ekler.
PDF/A ve metadata zorunluluğu
Uzun süreli arşivleme için tasarlanmış PDF/A formatı metadata konusunda katı kurallar getirir:
- XMP zorunludur. Belgenin XMP paketi taşıması gerekir.
- Uyumluluk tanımlayıcısı gerekir. XMP içinde
pdfaid:partvepdfaid:conformancealanlarıyla hangi PDF/A seviyesine uyulduğu belirtilmelidir. - Tutarlılık beklenir. Belge Bilgisi'ndeki değerlerle XMP'deki karşılıkları uyuşmalıdır.
- Özel şemalar tanımlanmalıdır. Standart dışı XMP alanları kullanılıyorsa, dosya içinde bunların şeması açıklanmalıdır.
Bunun pratik sonucu: bir PDF/A belgesinin metadata'sını dikkatsizce temizlemek uyumluluğu bozar. Arşiv sistemine gönderdiğiniz dosya doğrulama testinden geçmez. PDF/A belgelerinde metadata düzenlemesi yaparken uyumluluk alanlarını korumak gerekir.
Metadata'nın ulaşamadığı yerler
Metadata temizlemenin sınırlarını netleştirmek önemli, çünkü yanlış bir güvenlik hissi tehlikeli:
Sayfa içeriği. Metadata belge hakkındaki bilgidir; sayfada yazan hiçbir şeyi etkilemez. 3. sayfada adınız yazıyorsa orada kalır.
Gizlenmiş içerik. Siyah kutuyla örtülmüş metin sayfa içeriğinin parçasıdır ve metadata temizlemeyle kaldırılmaz. Redaksiyon gerekir.
Gömülü dosyalar. PDF'ler ek dosyalar taşıyabilir (kaynak Excel tablosu, ekler). Bunlar ayrı nesnelerdir.
Form alanı verileri. Doldurulmuş bir formun alan değerleri AcroForm yapısında durur. Düzleştirme gerekir.
Sürüm geçmişi. Artımlı güncelleme kullanan bir PDF'te önceki sürümler dosyada durabilir. Dosyayı tam yeniden yazan bir işlem gerekir.
Gömülü yazı tipleri. Nadiren de olsa, bazı gömülü yazı tipleri kendi metadata'larında lisans sahibinin adını taşır.
Metadata'nın faydalı tarafı
Buraya kadar hep riskten bahsettik ama metadata'nın gerçek faydaları da var:
Kurumsal belge yönetimi. Binlerce belgeyi yöneten sistemler metadata'ya göre indeksler, sınıflandırır ve arar. Doğru doldurulmuş alanlar arşiv kalitesini belirler.
Web'de görünürlük. Başlık alanı tarayıcı sekmesinde ve bazı arama sonuçlarında görünür. Boş bırakılırsa dosya adı gösterilir ("rapor_final_v3_SON.pdf" gibi) ki bu profesyonel durmaz.
Hak yönetimi. XMP Rights şeması ile telif bilgisi, kullanım koşulları ve iletişim bilgisi belgeye gömülebilir.
Uzun süreli arşivleme. PDF/A'nın metadata zorunluluğu tam olarak bunun içindir: elli yıl sonra dosyayı bulan biri, belgenin ne olduğunu dosyanın kendisinden anlayabilsin.
Özetle
PDF metadata'sı iki katmanlı bir yapıdır: eski ve basit Belge Bilgisi sözlüğü ile XML tabanlı, zengin XMP paketi. İkisi yan yana yaşar, çelişebilir ve farklı programlar farklı olanı okur — bu yüzden gizlilik amaçlı temizlikte ikisinin de ele alınması şarttır. Metadata, yazar adından saat dilimine kadar sizinle ilgili gerçek ipuçları taşır ve çoğu otomatik doldurulduğu için farkında olmadan paylaşılır. Buna karşılık web'de yayınlanan ve arşivlenen belgelerde doğru doldurulmuş metadata değerli bir varlıktır; PDF/A ise onu zorunlu kılar. Ve unutulmaması gereken sınır: metadata temizlemek sayfa içeriğine, gömülü dosyalara veya sürüm geçmişine dokunmaz.
Sıkça Sorulan Sorular
Neden PDF'te iki farklı metadata sistemi var?
Tarihsel sebeplerle. Belge Bilgisi sözlüğü formatın ilk sürümlerinden beri var ve basit anahtar-değer çiftlerinden oluşuyor. XMP ise 2000'lerin başında, çoklu ortam dosyalarında zengin ve genişletilebilir meta veri ihtiyacına cevap olarak geliştirildi ve sonradan PDF'e eklendi. Eski sistem geriye dönük uyumluluk için korundu, dolayısıyla iki sistem yan yana yaşıyor.
İki sistemde farklı değerler varsa hangisi geçerli sayılır?
Standart, çakışma durumunda XMP'nin öncelikli olmasını önerir ancak uygulamalar bu konuda tutarsızdır. Bazı görüntüleyiciler Belge Bilgisi'ni gösterir, bazıları XMP'yi okur, bazıları hangisi doluysa onu alır. Bu yüzden metadata temizlerken ikisini de ele almak gerekir — birini silip diğerini bırakmak, bilginin bir programda görünmeye devam etmesi anlamına gelir.
XMP bloğu dosyada nasıl duruyor, sıkıştırılmış mı?
XMP genellikle sıkıştırılmamış, düz metin XML olarak dosyaya gömülür. Bunun sebebi, bir dosyayı tam olarak ayrıştırmadan metadata'sını okuyabilmektir — arama ve indeksleme sistemleri dosyayı tarayıp XMP paketini bulabilir. Pratik sonucu şudur: bir PDF'i metin editöründe açarsanız XMP içeriğini okuyabilirsiniz.
PDF/A arşiv formatı metadata konusunda ne gerektiriyor?
PDF/A, XMP metadata'sının bulunmasını zorunlu kılar ve içinde belgenin hangi PDF/A seviyesine uyduğunu belirten özel bir tanımlayıcı olmasını ister. Ayrıca Belge Bilgisi sözlüğündeki değerlerle XMP'deki karşılıklarının tutarlı olması beklenir. Bu yüzden bir PDF/A belgesinin metadata'sını dikkatsizce temizlemek, dosyanın uyumluluğunu bozabilir.
Bu konuyu Metadata Düzenle/Temizle aracıyla hemen deneyin.
Metadata Düzenle/Temizle aracını dene