¿Qué son los metadatos de un PDF? Diferencia entre XMP y el diccionario de Información del documento
8 min de lectura
Dentro de un archivo PDF hay una capa de información que no se ve en ninguna página: quién lo creó, con qué programa, cuándo y sobre qué tema. Esa capa no consiste en realidad en un sistema sino en dos, y ambos pueden contradecirse. En este artículo explicamos la estructura de los metadatos PDF, por qué conviven los dos sistemas y qué significa eso en términos de privacidad.
Primera capa: el diccionario de Información del documento
Es la estructura simple que existe desde las primeras versiones del PDF. Es un diccionario al que apunta la clave /Info en la sección trailer del archivo, y dentro hay pares clave-valor:
<< /Title (Memoria Anual de Actividades)
/Author (Ana Garcia)
/Subject (Ejercicio fiscal 2025)
/Keywords (memoria, fiscal, 2025)
/Creator (Microsoft Word)
/Producer (Adobe PDF Library 17.0)
/CreationDate (D:20250312143022+01'00')
/ModDate (D:20250315091544+01'00')
>>
El significado de los campos:
| Clave | Significado |
|---|---|
| /Title | El título del documento |
| /Author | El autor |
| /Subject | El asunto |
| /Keywords | Palabras clave |
| /Creator | La aplicación de origen que creó el documento (Word, InDesign) |
| /Producer | La biblioteca que lo convirtió a PDF |
| /CreationDate | Momento de creación |
| /ModDate | Momento de la última modificación |
La distinción entre /Creator y /Producer se confunde a menudo, pero es lógica: escribiste el documento en Word (Creator) y el motor de PDF de Word o un complemento lo pasó a PDF (Producer). Los dos dan información distinta y los dos llevan rastros sobre ti.
El formato de fecha también es llamativo: la expresión D:20250312143022+01'00' significa 12 de marzo de 2025, 14:30:22, huso horario UTC+1. La información de huso horario es una pista sobre la zona geográfica en la que preparaste el documento.
El límite de este sistema está claro: hay una lista fija de campos, no puede llevar datos estructurados, no maneja información de idioma y no admite valores múltiples.
Segunda capa: el paquete XMP
A principios de los 2000 se desarrolló XMP (Extensible Metadata Platform) para cubrir la necesidad de metadatos ricos y ampliables en los archivos multimedia (fotos, vídeos, documentos). Después se añadió también al PDF.
XMP es una estructura basada en XML y vive en el archivo como un flujo incrustado:
<x:xmpmeta xmlns:x="adobe:ns:meta/">
<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#">
<rdf:Description rdf:about=""
xmlns:dc="http://purl.org/dc/elements/1.1/">
<dc:title>
<rdf:Alt>
<rdf:li xml:lang="es">Memoria Anual de Actividades</rdf:li>
<rdf:li xml:lang="en">Annual Report</rdf:li>
</rdf:Alt>
</dc:title>
<dc:creator>
<rdf:Seq><rdf:li>Ana Garcia</rdf:li></rdf:Seq>
</dc:creator>
</rdf:Description>
</rdf:RDF>
</x:xmpmeta>
Lo que aporta XMP:
- Valores multilingües. El título se puede guardar en español y en inglés a la vez.
- Varios autores. Se pueden guardar varios autores como lista ordenada.
- Ampliabilidad. Con distintos espacios de nombres, cualquier organización puede añadir sus propios campos.
- Vocabularios estándar. Se usan esquemas establecidos como Dublin Core (
dc:), IPTC para fotografía o XMP Rights para gestión de derechos.
El XMP suele incrustarse en el archivo como texto plano sin comprimir. Es una decisión deliberada: para que los sistemas de búsqueda e indexación puedan encontrar y leer el paquete XMP sin analizar el archivo por completo. La consecuencia práctica es que puedes leer el contenido del XMP abriendo el PDF en un editor de texto.
Cuando los dos sistemas se contradicen
Muchos PDF llevan las dos capas y los valores pueden no coincidir:
- Un programa actualiza la Información del documento y no toca el XMP.
- Otro programa actualiza el XMP y deja el antiguo.
- Un limpiador de metadatos borra solo uno de los dos.
El estándar recomienda que en caso de conflicto tenga prioridad XMP. Pero las aplicaciones son inconsistentes: algunos visores muestran la Información del documento, otros leen el XMP y otros toman el que esté relleno.
La consecuencia en términos de privacidad es seria. Si has borrado el nombre del autor de la Información del documento y lo has dejado en el XMP, la ventana de propiedades del documento se verá limpia, pero al leerlo con otra herramienta aparecerá tu nombre. Esta es la causa más frecuente de las historias de "creía que había limpiado los metadatos".
Una limpieza fiable debe tratar los dos. Para verificarlo hay un método tosco pero eficaz: abrir el archivo limpiado en un editor de texto (sin guardarlo) y buscar expresiones como xmpmeta, dc:creator o dc:title.
Qué delatan los metadatos
Pistas concretas:
Identidad. Los campos /Author y dc:creator se rellenan muchas veces de forma automática con tu nombre de usuario del sistema operativo. En un documento enviado de forma anónima eso es una revelación directa de identidad.
Restos de plantilla. Si has copiado un presupuesto de un archivo que preparaste para un cliente anterior, en el título puede seguir apareciendo el nombre de ese cliente.
Cronología. CreationDate y ModDate muestran el proceso real de preparación del documento. Además, la información de huso horario es una pista geográfica.
Perfil de software. El campo /Producer dice qué biblioteca y qué versión usas. Eso da información sobre tu flujo de trabajo corporativo.
Campos corporativos. Algunos generadores de PDF corporativos añaden, con espacios de nombres XMP propios, campos como el código de departamento, el nivel de clasificación o el número de referencia interno.
PDF/A y la obligatoriedad de los metadatos
El formato PDF/A, diseñado para el archivado a largo plazo, impone reglas estrictas en materia de metadatos:
- El XMP es obligatorio. El documento tiene que llevar un paquete XMP.
- Hace falta un identificador de conformidad. Dentro del XMP hay que indicar con los campos
pdfaid:partypdfaid:conformancea qué nivel de PDF/A se ajusta. - Se espera coherencia. Los valores de la Información del documento y sus equivalentes en XMP deben coincidir.
- Los esquemas propios deben declararse. Si se usan campos XMP fuera del estándar, hay que describir su esquema dentro del archivo.
La consecuencia práctica: limpiar sin cuidado los metadatos de un documento PDF/A rompe su conformidad. El archivo que envíes al sistema de archivo no pasará la prueba de validación. Al editar los metadatos de documentos PDF/A hay que conservar los campos de conformidad.
Adonde no llegan los metadatos
Es importante dejar claros los límites de la limpieza de metadatos, porque una falsa sensación de seguridad es peligrosa:
El contenido de la página. Los metadatos son información sobre el documento; no afectan a nada de lo que aparece escrito en la página. Si tu nombre está en la página 3, ahí se queda.
El contenido oculto. El texto tapado con una caja negra forma parte del contenido de la página y no se elimina al limpiar los metadatos. Hace falta redacción.
Los archivos incrustados. Los PDF pueden llevar archivos adjuntos (la hoja de Excel de origen, anexos). Son objetos aparte.
Los datos de los campos de formulario. Los valores de un formulario relleno viven en la estructura AcroForm. Hace falta aplanado.
El historial de versiones. En un PDF que usa actualizaciones incrementales, las versiones anteriores pueden seguir dentro del archivo. Hace falta una operación que reescriba el archivo entero.
Las tipografías incrustadas. En casos raros, algunas tipografías incrustadas llevan en sus propios metadatos el nombre del titular de la licencia.
El lado útil de los metadatos
Hasta aquí solo hemos hablado de riesgos, pero los metadatos también tienen ventajas reales:
Gestión documental corporativa. Los sistemas que administran miles de documentos indexan, clasifican y buscan según los metadatos. Unos campos bien rellenados determinan la calidad del archivo.
Visibilidad en la web. El campo de título aparece en la pestaña del navegador y en algunos resultados de búsqueda. Si se deja vacío se muestra el nombre del archivo (algo como "informe_final_v3_DEF.pdf"), lo que no queda profesional.
Gestión de derechos. Con el esquema XMP Rights se puede incrustar en el documento la información de copyright, las condiciones de uso y los datos de contacto.
Archivado a largo plazo. La obligatoriedad de los metadatos en PDF/A existe exactamente para eso: que dentro de cincuenta años, quien encuentre el archivo pueda entender qué es a partir del propio archivo.
En resumen
Los metadatos de un PDF son una estructura de dos capas: el antiguo y simple diccionario de Información del documento y el rico paquete XMP basado en XML. Ambos conviven, pueden contradecirse y cada programa lee uno u otro, así que en una limpieza por privacidad es imprescindible tratar los dos. Los metadatos llevan pistas reales sobre ti, desde el nombre del autor hasta el huso horario, y como la mayoría se rellenan automáticamente se comparten sin darse cuenta. En cambio, en los documentos que se publican en la web y se archivan, unos metadatos bien rellenados son un activo valioso; y PDF/A los hace obligatorios. Y el límite que no hay que olvidar: limpiar los metadatos no toca el contenido de la página, los archivos incrustados ni el historial de versiones.
Preguntas frecuentes
¿Por qué hay dos sistemas de metadatos distintos en el PDF?
Por motivos históricos. El diccionario de Información del documento existe desde las primeras versiones del formato y consiste en simples pares clave-valor. XMP se desarrolló a principios de los 2000 como respuesta a la necesidad de metadatos ricos y ampliables en los archivos multimedia, y se añadió después al PDF. El sistema antiguo se conservó por compatibilidad, así que los dos conviven.
Si los dos sistemas tienen valores distintos, ¿cuál se considera válido?
El estándar recomienda que en caso de conflicto tenga prioridad XMP, pero las aplicaciones son inconsistentes en esto. Algunos visores muestran la Información del documento, otros leen el XMP y otros toman el que esté relleno. Por eso, al limpiar los metadatos hay que tratar los dos: borrar uno y dejar el otro significa que la información seguirá viéndose en algún programa.
¿Cómo está el bloque XMP dentro del archivo, comprimido?
El XMP suele incrustarse en el archivo como XML de texto plano sin comprimir. El motivo es poder leer los metadatos de un archivo sin analizarlo por completo: los sistemas de búsqueda e indexación pueden recorrer el archivo y encontrar el paquete XMP. La consecuencia práctica es que si abres un PDF en un editor de texto puedes leer el contenido del XMP.
¿Qué exige en cuanto a metadatos el formato de archivo PDF/A?
PDF/A obliga a que exista el paquete XMP y exige que dentro haya un identificador concreto que indique a qué nivel de PDF/A se ajusta el documento. Además, se espera que los valores del diccionario de Información del documento y sus equivalentes en XMP sean coherentes. Por eso, limpiar sin cuidado los metadatos de un documento PDF/A puede romper su conformidad.
Pruébalo ahora mismo con Metadata Düzenle/Temizle.
Probar Metadata Düzenle/Temizle