PDFMove
Comment appliquer l'OCR à un PDF numérisé ? Guide étape par étape
Tutoriel

Comment appliquer l'OCR à un PDF numérisé ? Guide étape par étape

7 min de lecture

Vous avez un PDF issu d'un scanner ou de l'appareil photo d'un téléphone, vous essayez de copier le texte qu'il contient, mais rien ne se sélectionne. Lorsque vous effectuez une recherche avec Ctrl+F, le résultat est nul. C'est l'un des problèmes de PDF les plus fréquemment rencontrés, car un document numérisé n'est en réalité pas du texte, mais une image. Même si chaque lettre de la page est lisible à vos yeux, pour l'ordinateur, ce ne sont que des pixels.

L'OCR (Optical Character Recognition — reconnaissance optique de caractères) est le traitement qui « ranime » le document en ajoutant sur ces images une couche de texte invisible mais sélectionnable. Dans ce guide, j'explique étape par étape comment rendre un PDF numérisé consultable et copiable, les points à surveiller pour les textes en français, et les erreurs les plus fréquentes.

Que gagne un PDF numérisé grâce à l'OCR ?

Clarifions d'abord ce que vous obtenez, car savoir ce que l'OCR fait et ne fait pas permet de bien calibrer vos attentes :

  • Capacité de recherche : vous pouvez rechercher des mots dans le document avec Ctrl+F.
  • Copier-coller : vous pouvez sélectionner le texte et le transférer vers un autre fichier.
  • Compatibilité avec les lecteurs d'écran : l'accessibilité s'améliore pour les utilisateurs malvoyants.
  • La taille du fichier reste généralement presque identique : seule une couche de texte invisible est ajoutée, l'image reste inchangée.

L'OCR ne modifie pas l'apparence du document. La page continue de ressembler à une numérisation ; seules des données textuelles sont placées derrière. Autrement dit, ne vous attendez pas à un « PDF propre, réécrit » — vous verrez visuellement exactement la même chose que la numérisation originale, la différence se ressent uniquement dans le fait que vous pouvez désormais sélectionner le texte.

Étape par étape : ajouter une couche de texte à un PDF numérisé

1. Étape : préparez votre fichier

Avant de commencer l'OCR, examinez la qualité de votre numérisation. Si votre fichier est en très basse résolution (par exemple inférieure à 100 DPI) ou numérisé de travers/flou, le texte résultant sera tout aussi erroné. Si possible :

  • Numérisez les pages à plat et sans ombre.
  • Numérisez dans une plage de 200 à 300 DPI (c'est déjà la plage par défaut de la plupart des scanners de bureau).
  • Si vous avez pris une photo avec votre téléphone, assurez-vous que les quatre bords du document sont bien visibles.

2. Étape : téléversez le fichier dans l'outil OCR

Faites glisser votre fichier PDF ou téléversez-le via le sélecteur de fichiers. Le téléversement s'effectue entièrement dans le navigateur ; votre fichier reste sur votre appareil pendant le traitement, sans être envoyé à un serveur. C'est un détail important, en particulier pour les documents sensibles comme les contrats, les factures ou les pièces d'identité.

3. Étape : vérifiez la sélection de langue

Le moteur OCR doit savoir dans quelle langue rechercher les caractères. Si votre document est en français, assurez-vous que l'option de langue est bien réglée sur le français. Si vous sautez cette étape, des caractères propres au français comme é, è, à, ç, œ peuvent être mal reconnus, voire pas du tout — par exemple, le mot « déjà » peut ressortir comme « deja » ou comme une suite de caractères dénuée de sens. Si votre document contient plusieurs langues (par exemple un rapport mêlant français et anglais), l'indiquer améliore nettement le résultat.

4. Étape : lancez le traitement et patientez

Selon le nombre de pages et la qualité de la numérisation, le traitement peut prendre de quelques secondes à quelques minutes. Soyez patient avec les gros fichiers comportant de nombreuses pages ; chaque page est analysée individuellement, et la couche de texte est placée spécifiquement pour cette page.

5. Étape : téléchargez le résultat et testez-le

Une fois le traitement terminé, téléchargez votre fichier et effectuez immédiatement une vérification : dans votre visionneuse PDF, recherchez avec Ctrl+F un mot dont vous savez qu'il figure dans le document. S'il est trouvé, l'OCR a réussi. Ensuite, essayez de sélectionner et de copier quelques phrases pour vérifier que le texte ressort correctement.

Conseils pratiques pour obtenir un bon résultat

  • Les pages numérisées de travers posent problème. Si le document est resté incliné de quelques degrés pendant la numérisation, le moteur OCR a du mal à suivre les lignes. Si possible, corrigez la numérisation et réessayez.
  • Les documents à faible contraste sont difficiles. Les anciens documents écrits à l'encre pâle ou les photocopies grisâtres génèrent plus d'erreurs de reconnaissance que des numérisations nettes en noir et blanc.
  • L'écriture manuscrite est aux limites de l'OCR. La technologie OCR est avant tout conçue pour le texte imprimé ; obtenir un résultat cohérent sur de l'écriture manuscrite peut être difficile.
  • Pour les documents multilingues, soyez attentif au choix de la langue. Si un contrat en français contient des titres de clauses en anglais, sélectionner uniquement le français peut entraîner une mauvaise reconnaissance de ces sections.
  • Dans les tableaux et les pages à plusieurs colonnes, l'ordre du texte peut se mélanger. L'OCR essaie d'interpréter la mise en page de la page, mais dans des colonnes complexes de type journal, l'ordre des mots peut différer de ce que vous attendiez ; dans ce cas, vous devrez peut-être modifier manuellement le texte copié.

Erreurs fréquentes

Erreur 1 : laisser la sélection de langue par défaut. C'est le problème le plus fréquemment rencontré. Lancer le traitement sur un document en français sans vérifier le réglage de langue entraîne des résultats erronés, en particulier sur les lettres propres au français.

Erreur 2 : appliquer à nouveau l'OCR à un PDF déjà consultable. Certains PDF ont beau ressembler visuellement à une numérisation, ils disposent en réalité déjà d'une couche de texte. Les soumettre à l'OCR sans vérifier au préalable avec Ctrl+F est une étape inutile — cela ne cause pas de dommage, mais fait perdre du temps.

Erreur 3 : traiter une numérisation de mauvaise qualité sans l'améliorer au préalable. Attendre un résultat parfait d'une page numérisée floue ou avec une police très petite n'est pas réaliste. Améliorer la source influence directement le résultat de l'OCR.

Erreur 4 : commencer à utiliser le résultat sans le vérifier. Les résultats de l'OCR ne sont pas fiables à 100 % ; de petites erreurs peuvent survenir, en particulier sur les noms propres, les chiffres et les mots étrangers. Si vous allez utiliser le document dans une procédure officielle (par exemple pour l'archivage ou une référence juridique), relisez au moins les sections critiques.

Quand l'OCR est-il nécessaire, et quand ne l'est-il pas ?

Si votre PDF a été créé directement depuis un traitement de texte (Word, Google Docs, etc.) via « enregistrer sous PDF », il dispose très probablement déjà d'une couche de texte et n'a pas besoin d'OCR. Les situations où vous avez réellement besoin de l'OCR sont les suivantes :

  • Documents papier passés par un scanner de bureau
  • Pages photographiées avec l'appareil photo d'un téléphone et converties en PDF
  • Versions numérisées d'anciens documents d'archives
  • Fichiers reçus par fax et convertis en PDF

Le point commun de ces documents est que leur contenu est intégré dans le PDF comme un fichier image. Vous pouvez gagner du temps en effectuant rapidement un test Ctrl+F avant d'appliquer l'OCR.

Conclusion

Rendre consultable un PDF numérisé est une opération plus simple qu'il n'y paraît : choisir le bon réglage de langue et disposer d'une source de qualité raisonnable déterminent la majeure partie du résultat. Après avoir terminé le traitement, prenez l'habitude de toujours effectuer un test de recherche pour vérifier que le texte a bien été reconnu correctement. Vous pourrez ainsi retrouver facilement les documents de vos archives et transférer leur contenu vers d'autres documents.

Questions fréquentes

L'apparence du PDF change-t-elle après application de l'OCR ?

Non. L'OCR ne modifie pas l'apparence visuelle de la page ; l'image numérisée reste telle quelle. Le traitement ajoute simplement une couche de texte invisible derrière l'image, ce qui vous permet de rechercher et de copier le texte.

Les caractères français (é, è, à, ç, œ, ù) posent-ils problème pendant l'OCR ?

Si la sélection de langue n'est pas réglée sur le français, oui, cela peut poser problème. Lorsque la bonne langue est sélectionnée, ces caractères sont en grande majorité correctement reconnus ; néanmoins, sur des numérisations de faible qualité, de petites erreurs peuvent apparaître, il est donc utile de vérifier le résultat.

Puis-je rendre consultable, via l'OCR, un formulaire rempli à la main ?

La technologie OCR est avant tout optimisée pour le texte imprimé. Pour l'écriture manuscrite, en particulier irrégulière ou liée, la précision de reconnaissance diminue nettement, et il peut être difficile d'obtenir un résultat cohérent.

Essayez dès maintenant avec OCR (Taranmış PDF).

Essayer OCR (Taranmış PDF)