PDFMove
Comment extraire les images intégrées d'un PDF à l'état brut ?
Tutoriel

Comment extraire les images intégrées d'un PDF à l'état brut ?

8 min de lecture

Vous devez récupérer les photos d'un catalogue produit, sauver les graphiques d'une présentation ou réutiliser les figures d'un rapport. La capture d'écran fait perdre en qualité ; enregistrer la page en image ramène aussi le texte. L'extraction brute vous permet de récupérer les objets image intégrés au PDF dans leur état d'origine.

Ce que fait l'extraction brute

Quand vous voyez une photo sur une page PDF, cette photo existe dans le fichier comme un objet image (XObject Image) distinct. Le flux de contenu de la page y fait référence et dit « dessine-la à telle position, à telle taille ».

L'extraction brute trouve ces objets et les exporte sous forme de fichiers. Ses caractéristiques déterminantes :

  • Elle restitue la résolution d'origine. Une photo qui paraît petite sur la page peut faire 4000 pixels de large dans le fichier. L'extraction brute vous donne ces 4000 pixels.
  • Il n'y a aucun réencodage. Si l'image est intégrée en JPEG, elle ressort en JPEG, sans perte de compression supplémentaire.
  • Le reste du contenu de la page ne vient pas. Texte, traits et arrière-plan ne sont pas repris.

Ce dernier point est la différence fondamentale entre l'extraction brute et l'enregistrement de la page en image.

Étape 1 : déterminez ce dont vous avez besoin

Deux besoins distincts sont souvent confondus :

| Besoin | Bonne opération | |---|---| | Photos produit d'un catalogue | Extraction brute | | Graphiques et figures d'un rapport | Extraction brute (ne fonctionne pas si c'est du vectoriel) | | Image de la page entière | Conversion PDF vers image | | Images de page d'un document scanné | Extraction brute (une image par page) | | Vignette de page pour une présentation | Conversion PDF vers image | | Récupérer un logo en vectoriel | Conversion PDF vers SVG |

La dernière ligne est importante : l'extraction brute ne récupère que les images matricielles (en pixels). Les logos, schémas et graphiques d'un PDF sont généralement vectoriels — définis par des instructions de trait et de remplissage, ce ne sont pas des images intégrées. L'extraction brute ne les trouvera pas ; une conversion en SVG est nécessaire.

Méthode de vérification : zoomez fortement sur l'élément dans le PDF. S'il se pixellise, c'est du matriciel (l'extraction brute fonctionne) ; s'il reste net, c'est du vectoriel (elle ne fonctionne pas).

Étape 2 : effectuez l'extraction

Ouvrez l'outil d'extraction d'images d'un PDF et téléversez votre fichier. Le traitement s'exécute dans votre navigateur ; votre document ne part pas vers un serveur.

L'outil parcourt le PDF, trouve les objets image intégrés et vous permet de les télécharger dans une archive ZIP. Le nombre d'images peut être supérieur ou inférieur à ce que vous attendiez — nous y venons.

Étape 3 : comprenez les fichiers obtenus

Préparez-vous à ce que vous découvrirez en ouvrant le ZIP. L'extraction brute est « brute » ; elle restitue ce qui se trouve dans le PDF, et cela ne ressemble pas toujours à ce que vous attendiez.

Plus de fichiers que prévu. Vous avez vu une photo sur la page mais le ZIP contient dix fichiers. Les raisons :

  • Images fragmentées. Certains producteurs de PDF, notamment les logiciels de numérisation, découpent les grandes images en bandes horizontales. Elles paraissent unies sur la page mais constituent des objets distincts dans le fichier.
  • Masques. L'information de transparence d'une image transparente est stockée sous forme d'image de masque en noir et blanc distincte. Ce masque ressort lui aussi dans un fichier séparé.
  • Images invisibles. Les images situées hors de la page, recouvertes ou laissées hors de la boîte de rognage subsistent dans le fichier et sont extraites.

Moins de fichiers que prévu. Ce que vous preniez pour une image peut en réalité être un dessin vectoriel. Ou bien, si la même image est utilisée sur plusieurs pages, elle n'est stockée qu'une fois dans le fichier et ne ressort qu'en un seul fichier.

Des fichiers d'aspect étrange. Si une image sert de masque de transparence, elle apparaît seule comme une silhouette en noir et blanc. Ce n'est pas un fichier corrompu, c'est le masque lui-même.

Étape 4 : contrôles de qualité et de taille

Examinez les points suivants sur les fichiers obtenus :

La résolution. Ouvrez le fichier et regardez ses dimensions en pixels. Une photo qui paraissait petite sur la page peut être très grande à l'origine — c'est une bonne nouvelle, vous avez obtenu une image de qualité réutilisable.

L'inverse est possible : si l'image a été compressée et ramenée à une basse résolution lors de la production du PDF, l'extraction brute restituera cette basse résolution. Les pixels perdus ne reviennent pas.

L'espace colorimétrique. Les PDF peuvent transporter des images CMJN. Si le fichier obtenu est en CMJN, certains programmes en afficheront les couleurs différemment ; pour un usage web, il faudra le convertir en RVB.

La transparence. Une image qui paraissait transparente dans le PDF peut ressortir opaque — car l'information de transparence réside dans un objet masque distinct. Pour la retrouver, il faut combiner l'image et son masque dans un éditeur.

L'orientation. L'image peut avoir été placée pivotée sur la page. L'extraction brute restitue l'orientation d'origine, pas son aspect sur la page.

Étape 5 : effectuez les corrections nécessaires

Les fichiers obtenus ne sont pas forcément directement utilisables. Corrections courantes :

Réunir les morceaux. Une image découpée en bandes doit être réassemblée dans un éditeur (GIMP, Photoshop, ou même un outil en ligne). Vous pouvez deviner l'ordre des morceaux d'après les numéros dans les noms de fichiers, mais sans garantie ; l'appariement visuel est plus fiable.

Appliquer le masque. Si la transparence est souhaitée, il faut ouvrir l'image principale et le fichier de masque dans un éditeur et appliquer le masque comme canal alpha.

Rogner. Si seule une partie de l'image est visible dans le PDF (un chemin de rognage a été appliqué), l'extraction brute restitue l'ensemble. Vous devrez rogner la partie voulue.

Conversion de couleur. Le passage du CMJN au RVB est nécessaire pour un usage web.

Quand préférer la conversion de page à l'extraction brute

Les situations où l'extraction brute ne convient pas :

Les graphiques vectoriels. Logos, schémas, graphiques sont généralement vectoriels. Une conversion en SVG est nécessaire.

Les cas où l'on veut le texte et l'image ensemble. Si vous voulez une infographie complète — l'image et les légendes qui la surmontent — l'extraction brute ne vous donnera que la partie image. Convertir la page en PNG est la bonne approche.

Les compositions complexes. Si plusieurs images, transparences et effets se superposent sur une page, récupérer les morceaux un à un ne vous donnera pas le résultat visible. Il faut effectuer un rendu de la page.

Si vous voulez seulement l'aspect visible. Si vous voulez exactement la composition que vous voyez sur la page, l'extraction brute n'est pas le bon outil.

Cas particulier des documents scannés

Dans un PDF scanné, chaque page se compose d'une seule grande image. L'extraction brute est alors très efficace : vous obtenez un fichier image par page, correspondant aux données de numérisation d'origine.

C'est utile lorsque vous voulez réorganiser un document scanné en archive d'images ou faire passer les pages dans une chaîne de traitement d'images.

Attention : si le scan a été enregistré en JPEG, le fichier obtenu sera un JPEG et portera la perte de compression du moment de la numérisation. L'extraction brute ne corrige pas cela, elle restitue simplement le fichier tel quel.

Avertissement sur le droit d'auteur

Pouvoir extraire techniquement une image ne signifie pas avoir le droit de l'utiliser.

Récupérer vos propres images depuis vos propres documents ne pose pas de problème. Mais les photos et illustrations tirées du catalogue, du livre, du rapport ou de la présentation de quelqu'un d'autre peuvent être protégées par le droit d'auteur. Les photos de banques d'images ont généralement été achetées avec des licences d'usage précises qui ne vous couvrent pas.

Si vous les utilisez dans un cadre commercial, vérifiez la source et la situation des licences.

En résumé

L'extraction brute d'images récupère les images matricielles intégrées au PDF à leur résolution d'origine et sans réencodage. C'est là sa différence fondamentale avec l'enregistrement de la page en image : vous obtenez la photo seule, pas la photo de la page. Les graphiques vectoriels ne peuvent pas être extraits ainsi — pour eux, il faut une conversion en SVG. Parmi les fichiers obtenus, vous pouvez trouver des images fragmentées, des fichiers de masque séparés et des contenus invisibles sur la page ; ce ne sont pas des défauts mais les conséquences naturelles de la structure interne du PDF. Après extraction, contrôler la résolution, l'espace colorimétrique et la transparence, puis réunir les morceaux si nécessaire, achève le travail.

Questions fréquentes

Quelle est la différence entre l'extraction brute et l'enregistrement de la page en image ?

L'extraction brute récupère telles quelles les images intégrées au PDF — sans perte de qualité, à leur résolution d'origine. Enregistrer la page en image effectue au contraire un rendu de la page entière (texte, traits et arrière-plan compris) dans une nouvelle image. Dans le premier cas vous obtenez la photo seule, dans le second la photo de la page. Si vous voulez les photos produit d'un catalogue, l'extraction brute est le bon outil.

Pourquoi l'image extraite paraît-elle différente de ce que je voyais dans le PDF ?

Plusieurs raisons possibles. L'image peut avoir été mise à l'échelle, pivotée ou rognée dans le PDF — l'extraction brute restitue son état d'origine, pas son aspect sur la page. Par ailleurs, un masque de transparence a pu lui être appliqué ; comme le masque est un objet distinct, la transparence est perdue dans le fichier extrait et le fond apparaît noir ou blanc.

Pourquoi une photo est-elle ressortie découpée en plusieurs morceaux ?

Certains producteurs de PDF, en particulier les logiciels de numérisation et certains programmes bureautiques, découpent les grandes images en bandes horizontales, par souci d'efficacité mémoire. Elles paraissent unies sur la page mais constituent des objets distincts dans le fichier, et l'extraction brute restitue chacune dans un fichier séparé. Pour les réunir, il faut les assembler dans un éditeur d'images.

Ai-je le droit d'utiliser les images que j'ai extraites ?

Pouvoir les extraire techniquement ne signifie pas avoir le droit de les utiliser. Les photos, figures et illustrations contenues dans un PDF peuvent être protégées par le droit d'auteur. Récupérer vos propres images depuis vos propres documents ne pose pas de problème ; avant d'utiliser des images tirées du catalogue, du livre ou du rapport de quelqu'un d'autre, vous devez vérifier l'autorisation ou la licence.

Essayez dès maintenant avec PDF'ten Görsel Çıkar (Ham).

Essayer PDF'ten Görsel Çıkar (Ham)