PDFMove
Comment modifier et nettoyer les métadonnées d'un PDF ?
Tutoriel

Comment modifier et nettoyer les métadonnées d'un PDF ?

8 min de lecture

Quand vous envoyez un PDF à quelqu'un, vous n'envoyez pas seulement les pages que vous voyez. Le fichier comporte une couche d'information invisible sur les pages : qui l'a créé, avec quel logiciel il a été produit, quand il a été modifié, avec quels mots-clés il a été étiqueté. Ces informations sont parfois utiles, parfois totalement superflues, parfois du genre que vous ne souhaitez pas partager.

Ce qui est stocké dans un PDF

Les métadonnées sont des informations sur le document — pas son contenu. Dans un PDF typique, on trouve :

| Champ | Contenu typique | D'où il vient | |---|---|---| | Titre (Title) | Le nom du document | Généralement vide ou le nom du fichier | | Auteur (Author) | Nom d'une personne ou d'une organisation | Nom d'utilisateur Word/système | | Sujet (Subject) | Brève description | Généralement vide | | Mots-clés | Étiquettes | Généralement vide | | Producteur (Producer) | La bibliothèque qui a produit le PDF | Automatique | | Créateur (Creator) | L'application source | Automatique (« Microsoft Word ») | | Date de création | Le moment de la première production | Automatique | | Date de modification | Le moment du dernier enregistrement | Automatique |

La plupart de ces champs sont remplis automatiquement sans que vous le remarquiez. Le champ auteur est celui qui pose le plus souvent problème : Word y inscrit votre nom d'utilisateur système lors de la création du document. Cela peut être votre nom complet, votre identifiant professionnel ou le nom de la personne qui a installé votre ordinateur.

Ce que les métadonnées révèlent

Avec des exemples concrets :

Un nom d'auteur dans un document envoyé anonymement. Si vous transmettez un signalement, une évaluation ou un retour anonyme, le champ auteur peut révéler directement votre identité.

L'usage d'un modèle. Si vous avez repris pour un devis celui préparé pour un autre client, le champ titre peut encore porter le nom du client précédent.

La chronologie. Les dates de création et de modification indiquent quand le document a été préparé. Dire « nous préparons ce rapport depuis trois semaines » devient gênant si la date de création est celle d'hier.

Le logiciel utilisé. Le champ producteur indique quel programme et quelle version vous employez. Du point de vue de la sécurité, cette information peut servir dans des attaques ciblées.

Une trace institutionnelle. Certains producteurs de PDF d'entreprise ajoutent des champs personnalisés : code de service, classification du document, numéro de référence interne.

Étape 1 : consultez les métadonnées existantes

Avant de modifier, il faut savoir ce qu'il y a.

Dans une visionneuse PDF : la plupart permettent de voir les champs de base via Fichier > Propriétés (ou Propriétés du document).

Sous Windows : faites un clic droit sur le fichier puis regardez l'onglet Propriétés > Détails. Les champs affichés y sont toutefois limités.

Dans l'outil lui-même : en ouvrant l'outil d'édition des métadonnées et en téléversant votre fichier, les valeurs existantes s'affichent. C'est la vue la plus complète.

En les examinant, posez-vous ces trois questions : ces champs contiennent-ils des informations personnelles ? Y a-t-il des informations erronées ou périmées ? Un champ qui devrait rester vide est-il rempli ?

Étape 2 : décidez de ce que vous allez faire — modifier ou supprimer ?

Ce sont deux besoins distincts qu'il ne faut pas confondre.

Modifier consiste à remplir les champs avec les bonnes informations. Cela a du sens pour un document que vous publiez sur le web :

  • Le titre s'affiche dans l'onglet du navigateur et dans certains résultats de recherche. Mettre un véritable titre à la place du nom de fichier fait plus professionnel.
  • L'auteur peut être réglé sur le nom de l'organisation — « Mairie d'Exemple » plutôt qu'un nom de personne.
  • Le sujet est utile comme brève description.

Supprimer relève en revanche de la confidentialité. Si vous envoyez le document à l'extérieur et ne voulez laisser aucune trace, videz tous les champs.

Ne confondez pas les deux : pour un document publié sur le web, remplir les métadonnées est la bonne démarche ; pour un document sensible envoyé à l'extérieur, c'est de les supprimer.

Étape 3 : appliquez la modification

Ouvrez l'outil, téléversez votre fichier et modifiez ou effacez les champs. Le traitement se fait dans votre navigateur — le nettoyage des métadonnées relevant généralement de la confidentialité, le fait que le fichier ne parte pas vers un serveur est précisément au cœur du sujet.

Un point technique à surveiller : les PDF peuvent stocker les métadonnées à deux endroits différents.

Le dictionnaire Document Info est la structure ancienne et simple du format. Il contient quelques clés comme titre, auteur, sujet.

XMP (Extensible Metadata Platform) est une norme fondée sur XML, bien plus riche, présente dans le fichier sous forme de bloc de texte intégré. Elle peut transporter les mêmes informations, et bien davantage.

Beaucoup de PDF contiennent les deux et les valeurs peuvent se contredire : un nom d'auteur effacé dans le Document Info peut encore figurer dans le bloc XMP. Un nettoyage fiable doit traiter les deux. Après nettoyage, ouvrir le fichier dans un éditeur de texte (sans l'enregistrer) et y chercher des expressions comme <xmp ou dc:creator est une façon grossière mais efficace de vérifier que le travail a bien été fait.

Étape 4 : vérifiez le résultat

Ouvrez le fichier téléchargé et consultez les Propriétés du document. Les champs sont-ils conformes à ce que vous attendiez ?

Contrôlez en outre les points suivants :

Les dates. Le nettoyage des métadonnées règle généralement la date de modification sur l'instant présent — puisque le fichier vient d'être réécrit. Si vous voulez aussi effacer la date de création, n'oubliez pas qu'il s'agit d'un champ distinct.

Le champ producteur. Après nettoyage, ce champ peut porter le nom de l'outil que vous avez utilisé. Si vous visez un anonymat complet, videz-le également.

Les champs personnalisés. Les PDF d'entreprise peuvent comporter des clés non standard. Si votre outil les affiche, vérifiez-les.

Les limites du nettoyage des métadonnées

C'est la partie la plus importante, et elle corrige une confusion répandue.

Nettoyer les métadonnées n'efface pas l'information présente sur la page. Si votre nom figure à la page 3 du document, il y restera quel que soit le nettoyage des métadonnées.

Nettoyer les métadonnées ne retire pas le contenu masqué des pages. Si vous avez recouvert une information d'un rectangle noir, le texte situé dessous reste dans le fichier. C'est le travail de l'outil de caviardage.

Nettoyer les métadonnées ne supprime pas les fichiers intégrés. Certains PDF transportent des pièces jointes (tableurs, fichiers sources).

Nettoyer les métadonnées peut ne pas supprimer l'historique des versions. Dans un PDF comportant un historique de mises à jour incrémentales, les versions antérieures peuvent subsister. Faire passer le fichier par une opération qui le réécrit intégralement (une compression, par exemple) nettoie généralement ce point.

Si vous envoyez à l'extérieur un document réellement sensible, votre liste de contrôle doit être la suivante :

  1. Y a-t-il de l'information à masquer dans le contenu des pages ? → Caviardage
  2. Y a-t-il des traces dans les métadonnées ? → Nettoyage des métadonnées
  3. Y a-t-il des fichiers intégrés ? → Vérifiez
  4. Y a-t-il un historique de versions ? → Compression ou reproduction
  5. Reste-t-il des données dans les champs de formulaire ? → Aplatissement

Pour les PDF publiés sur le web

C'est le cas où vous voudrez remplir les métadonnées plutôt que les effacer :

Remplissez impérativement le champ titre. S'il est laissé vide, c'est le nom du fichier qui apparaît dans l'onglet du navigateur (« rapport_final_v3.pdf »). Mettre un véritable titre fait plus professionnel et rend meilleure l'apparence dans les résultats de recherche.

Mettez le nom de l'organisation comme auteur. Remplacer votre nom personnel par celui de votre organisation apporte à la fois confidentialité et cohérence.

Utilisez le champ sujet comme brève description.

N'investissez pas trop dans les mots-clés. L'effet de ce champ sur les moteurs de recherche est quasi nul depuis longtemps. Ce qui rend un document trouvable, c'est son contenu textuel, son nom de fichier et les liens qui pointent vers lui.

En résumé

Les métadonnées d'un PDF constituent une couche d'information invisible sur les pages mais qui accompagne le fichier, et le champ auteur transporte le plus souvent une information personnelle à votre insu. Pour les documents que vous publiez sur le web, remplir ces champs (le titre en particulier) apporte du professionnalisme ; pour les documents sensibles envoyés à l'extérieur, il faut au contraire les nettoyer. En nettoyant, assurez-vous que l'ancien dictionnaire Document Info et le bloc XMP sont tous deux traités. Et le plus important : le nettoyage des métadonnées ne retire pas l'information contenue dans les pages — il faut un caviardage pour les données confidentielles, un aplatissement pour les données de formulaire, et une réécriture pour l'historique des versions.

Questions fréquentes

Quelles informations sont stockées dans un PDF, que partage-t-on sans le savoir ?

On y trouve typiquement le titre, le nom de l'auteur, le sujet, les mots-clés, le logiciel qui a produit le fichier, ainsi que les dates de création et de modification. Le champ auteur est le plus souvent rempli automatiquement à partir de votre nom d'utilisateur Word ou système ; il peut s'agir de votre nom personnel ou de votre identifiant professionnel. L'information sur le logiciel producteur révèle quant à elle quel programme et quelle version vous utilisez.

Nettoyer les métadonnées supprime-t-il aussi l'information contenue dans le document ?

Non. Les métadonnées sont des informations sur le document — elles ne font pas partie du contenu des pages. Les noms, dates et données sensibles qui apparaissent sur la page ne sont pas retirés par le nettoyage des métadonnées. Pour extraire de l'information du contenu des pages, il faut un outil de caviardage ; ce sont deux opérations totalement distinctes et il faut généralement faire les deux.

Quelle est la différence entre Document Info et XMP ?

Le dictionnaire Document Info est l'ancienne structure de métadonnées du PDF, simple, avec quelques clés comme le titre ou l'auteur. XMP est en revanche une norme fondée sur XML, bien plus riche et extensible, présente dans le fichier sous forme de bloc de texte intégré. Beaucoup de PDF transportent les deux et les valeurs peuvent se contredire. Lors d'un nettoyage, il faut s'assurer que les deux sont traités.

Modifier les métadonnées aide-t-il au référencement ?

Pour les PDF publiés sur le web, le champ titre peut influencer le titre affiché dans les résultats de recherche et s'affiche dans l'onglet du navigateur. Dans cette mesure, c'est utile. L'effet du champ mots-clés sur les moteurs de recherche est en revanche quasi nul depuis longtemps. Ce qui est réellement déterminant, c'est le contenu textuel du document, son nom de fichier et les liens qui pointent vers lui.

Essayez dès maintenant avec Metadata Düzenle/Temizle.

Essayer Metadata Düzenle/Temizle