Cómo editar y limpiar los metadatos de un PDF
8 min de lectura
Cuando envías un PDF a alguien, no envías solo las páginas que ves. Dentro del archivo hay una capa de información que no aparece en las páginas: quién lo creó, con qué programa se generó, cuándo se modificó, con qué palabras clave se etiquetó. Esa información a veces es útil, a veces totalmente innecesaria y a veces del tipo que no querrías compartir.
Qué se guarda en un PDF
Los metadatos son información sobre el documento, no el contenido del documento. En un PDF típico hay esto:
| Campo | Contenido típico | De dónde viene | |---|---|---| | Título (Title) | El nombre del documento | Normalmente vacío o el nombre de archivo | | Autor (Author) | Nombre de persona u organización | Usuario de Word/del sistema operativo | | Asunto (Subject) | Descripción breve | Normalmente vacío | | Palabras clave | Etiquetas | Normalmente vacío | | Productor (Producer) | La biblioteca que generó el PDF | Automático | | Creador (Creator) | La aplicación de origen | Automático ("Microsoft Word") | | Fecha de creación | Momento de la primera generación | Automático | | Fecha de modificación | Momento del último guardado | Automático |
La mayoría se rellenan automáticamente y no te enteras. El campo de autor es el que más problemas causa: al crear el documento, Word escribe ahí tu nombre de usuario del sistema operativo. Puede ser tu nombre completo, tu usuario corporativo o el nombre de quien configuró tu ordenador.
Qué delatan los metadatos
Con ejemplos concretos:
Nombre de autor en un documento enviado de forma anónima. Si envías una denuncia, una valoración o una opinión anónima, el campo de autor puede revelar directamente tu identidad.
Uso de plantillas. Si has copiado un presupuesto del que preparaste para otro cliente, en el campo de título puede seguir apareciendo el nombre del cliente anterior.
Cronología. Las fechas de creación y modificación muestran cuándo se preparó el documento. Si dices "llevamos tres semanas preparando este informe" y la fecha de creación es de ayer, la situación se vuelve incómoda.
Software utilizado. El campo de productor muestra qué programa y qué versión usas. Desde el punto de vista de la seguridad, esa información puede usarse en ataques dirigidos.
Rastro corporativo. Algunos generadores de PDF corporativos añaden campos propios: código de departamento, clasificación del documento, número de referencia interno.
Paso 1: Mira los metadatos actuales
Antes de cambiar nada hay que saber qué hay.
En el visor de PDF: en la mayoría de visores puedes ver los campos básicos desde Archivo > Propiedades (o Propiedades del documento).
En Windows: haz clic derecho sobre el archivo y mira la pestaña Propiedades > Detalles. Pero los campos que se muestran ahí son limitados.
En la propia herramienta: al abrir la herramienta de edición de metadatos y subir tu archivo verás los valores actuales. Esta es la vista más completa.
Mientras miras, hazte estas tres preguntas: ¿Hay información personal en estos campos? ¿Hay información errónea o antigua? ¿Hay algo relleno que debería estar vacío?
Paso 2: Decide qué vas a hacer, ¿editar o borrar?
Son dos necesidades distintas y no hay que confundirlas.
Editar es rellenar los campos con la información correcta. Tiene sentido en un documento que vas a publicar en la web:
- El título aparece en la pestaña del navegador y en algunos resultados de búsqueda. Poner un título real en lugar del nombre de archivo queda profesional.
- El autor se puede poner como nombre de la organización, algo como "Ayuntamiento de Ejemplo" en lugar del nombre de una persona.
- El asunto es útil como descripción breve.
Borrar, en cambio, es por privacidad. Si envías el documento fuera y no quieres que quede ningún rastro, vacías todos los campos.
No mezcles ambas cosas: para un documento que se publica en la web lo correcto es rellenar los metadatos; para un documento delicado que se envía fuera, lo correcto es borrarlos.
Paso 3: Aplica el cambio
Abre la herramienta, sube tu archivo y edita o limpia los campos. El proceso se ejecuta en tu navegador: como la limpieza de metadatos suele hacerse por privacidad, que el archivo no vaya al servidor es precisamente el meollo del asunto.
Un punto técnico que conviene tener en cuenta: los PDF pueden guardar los metadatos en dos sitios distintos.
El diccionario de Información del documento (Document Info) es la estructura antigua y simple del formato. Contiene unas pocas claves como título, autor y asunto.
XMP (Extensible Metadata Platform) es un estándar basado en XML mucho más rico y vive en el archivo como un bloque de texto incrustado. Puede llevar la misma información y mucha más.
Muchos PDF contienen ambos y los valores pueden contradecirse: un nombre de autor borrado en la Información del documento puede seguir en el bloque XMP. Una limpieza fiable debe tratar los dos. Tras limpiar, abrir el archivo en un editor de texto (sin guardarlo) y buscar expresiones como <xmp o dc:creator es una forma tosca pero eficaz de verificar que el trabajo se ha hecho de verdad.
Paso 4: Verifica el resultado
Abre el archivo descargado y mira las Propiedades del documento. ¿Están los campos como esperabas?
Comprueba además esto:
Las fechas. La limpieza de metadatos suele poner la fecha de modificación en el momento actual, porque el archivo se acaba de reescribir. Si también quieres limpiar la fecha de creación, recuerda que es un campo aparte.
El campo de productor. Tras la limpieza puede aparecer ahí el nombre de la herramienta que has usado. Si buscas anonimato total, vacíalo también.
Campos propios. En los PDF corporativos puede haber claves personalizadas fuera del estándar. Si tu herramienta las muestra, revísalas.
El límite de la limpieza de metadatos
Esta es la parte más importante y corrige un malentendido frecuente.
Limpiar los metadatos no borra la información de la página. Si tu nombre aparece en la página 3 del documento, por mucho que limpies los metadatos ese nombre seguirá ahí.
Limpiar los metadatos no elimina el contenido oculto de la página. Si has tapado un dato con una caja negra, el texto de debajo sigue en el archivo. Eso es trabajo de la herramienta de redacción.
Limpiar los metadatos no elimina los archivos incrustados. Algunos PDF llevan archivos adjuntos incrustados (hojas de Excel, archivos de origen).
Limpiar los metadatos puede no eliminar el historial de versiones. En un PDF con historial de actualizaciones incrementales, las versiones anteriores pueden seguir dentro del archivo. Pasarlo por una operación que reescriba el archivo entero (como una compresión) suele limpiarlo.
Si envías fuera un documento realmente delicado, tu lista de comprobación debería ser esta:
- ¿Hay información que ocultar en el contenido de la página? → Redacción
- ¿Hay rastros en los metadatos? → Limpieza de metadatos
- ¿Hay archivos incrustados? → Compruébalo
- ¿Hay historial de versiones? → Compresión o regeneración
- ¿Quedan datos en los campos de formulario? → Aplanado
Para los PDF publicados en la web
Este es el caso en el que quieres rellenar los metadatos en lugar de borrarlos:
Rellena siempre el campo de título. Si lo dejas vacío, en la pestaña del navegador aparecerá el nombre del archivo (algo como "informe_final_v3.pdf"). Poner un título real queda profesional y se ve mejor en los resultados de búsqueda.
Pon el nombre de la organización como autor. Poner el nombre de tu organización en lugar del tuyo aporta privacidad y coherencia.
Usa el campo de asunto como descripción breve.
No inviertas demasiado en las palabras clave. Ese campo hace mucho que no tiene prácticamente ningún efecto en los motores de búsqueda. Lo que hace localizable un documento es su contenido de texto, el nombre del archivo y los enlaces que apuntan a él.
En resumen
Los metadatos de un PDF son una capa de información que no se ve en la página pero viaja con el archivo, y el campo de autor lleva muchas veces información personal sin que te des cuenta. En los documentos que vas a publicar en la web, rellenar esos campos (sobre todo el título) aporta profesionalidad; en los documentos delicados que vas a enviar fuera, hay que limpiarlos. Al limpiar, verifica que se han tratado tanto el antiguo diccionario de Información del documento como el bloque XMP. Y lo más importante: limpiar los metadatos no elimina la información del contenido de la página; para los datos ocultos hace falta redacción, para los datos de formulario aplanado y para el historial de versiones una reescritura.
Preguntas frecuentes
¿Qué información se guarda en un PDF? ¿Qué comparto sin darme cuenta?
Normalmente hay título, nombre del autor, asunto, palabras clave, el programa que generó el archivo y las fechas de creación y modificación. El campo de autor se rellena muchas veces de forma automática con tu nombre de usuario de Word o del sistema operativo, que puede ser tu nombre personal o tu usuario corporativo. La información del programa productor delata qué software y qué versión usas.
¿Limpiar los metadatos borra también la información del contenido del documento?
No. Los metadatos son información sobre el documento, no forman parte del contenido de la página. Los nombres, fechas y datos ocultos que aparecen en la página no se eliminan al limpiar los metadatos. Para quitar información del contenido de la página hace falta una herramienta de redacción; son dos trabajos completamente distintos y normalmente hay que hacer los dos.
¿Cuál es la diferencia entre la Información del documento y XMP?
El diccionario de Información del documento (Document Info) es la estructura de metadatos antigua y simple del PDF; contiene unas pocas claves como título y autor. XMP es un estándar basado en XML mucho más rico y ampliable, y vive en el archivo como un bloque de texto incrustado. Muchos PDF llevan ambos y los valores pueden contradecirse. Al limpiar hay que asegurarse de tratar los dos.
¿Editar los metadatos ayuda al SEO?
En los PDF publicados en la web, el campo de título puede afectar al título que se muestra en los resultados de búsqueda y aparece en la pestaña del navegador. En esa medida sí ayuda. El campo de palabras clave, en cambio, hace mucho que no tiene prácticamente ningún efecto en los motores de búsqueda. Lo que realmente determina el posicionamiento es el contenido de texto del documento, el nombre del archivo y los enlaces que apuntan a él.
Pruébalo ahora mismo con Metadata Düzenle/Temizle.
Probar Metadata Düzenle/Temizle