Rendre un PDF numérisé consultable : OCR, retranscription manuelle ou logiciel de bureau ?
7 min de lecture
Vous avez un contrat numérisé, une ancienne facture ou un article photographié à la bibliothèque. Le fichier est un PDF, mais vous ne pouvez sélectionner aucun mot à l'intérieur, vous ne trouvez rien lorsque vous tapez dans la barre de recherche, et vous ne pouvez pas faire de copier-coller. C'est parce que ce PDF n'est en réalité pas un fichier texte, mais une photographie. Le scanner ou l'appareil photo du téléphone a enregistré la page comme une image et a placé cette image dans une enveloppe PDF ; du point de vue de l'ordinateur, il n'y a là ni « lettres », seulement des pixels.
Il existe plusieurs façons de résoudre ce problème. Celle qui a du sens pour vous dépend de la longueur du document, de la fréquence à laquelle vous devrez effectuer cette tâche, et du niveau de précision requis pour le résultat.
Pourquoi un PDF numérisé est-il un fichier « mort » ?
Si un PDF contient du texte, l'ordinateur sait de quelles lettres ce texte est composé. Sur une page numérisée, en revanche, il n'existe aucune information de ce type ; il n'y a qu'une série de points colorés ou en noir et blanc. C'est pourquoi :
- Vous ne pouvez pas effectuer de recherche avec Ctrl+F
- Vous ne pouvez pas sélectionner ni copier le texte
- Les lecteurs d'écran (pour les utilisateurs malvoyants) ne peuvent pas lire la page
- Si vous tentez d'exporter le document vers Word pour le modifier, vous n'obtenez qu'une simple image
L'OCR (reconnaissance optique de caractères) analyse les formes de cette image et, en identifiant « ceci est un A, ceci est un K », place derrière l'image une couche de texte invisible mais sélectionnable. L'apparence de la page ne change absolument pas, elle devient simplement désormais consultable et copiable.
Option 1 : retranscription manuelle
C'est la méthode la plus ancienne : regarder le document et retaper son contenu dans Word ou un programme similaire. Pour un document d'une seule page ou de quelques paragraphes, cela peut être raisonnable ; c'est même parfois la seule option réaliste dans des cas où l'OCR peine, comme l'écriture manuscrite.
Mais en pratique, cette méthode a des limites sérieuses. Retaper à la main un contrat de dix pages prend des heures, le risque de fautes de frappe est élevé, et préserver la mise en page originale (tableaux, numéros de clauses, indentation) est presque impossible. De plus, cette méthode ne vous donne qu'un texte brut ; elle ne rend pas le PDF numérisé lui-même consultable, vous produisez un fichier séparé. La retranscription manuelle ne devrait être privilégiée que pour des documents très courts et peu nombreux, dans les cas où l'OCR ne fonctionne absolument pas (comme une écriture manuscrite très dégradée).
Option 2 : logiciels OCR installés sur ordinateur
Les logiciels OCR installés sur ordinateur restent une option privilégiée, en particulier dans les environnements d'entreprise et pour les numérisations à très gros volume. Leurs points forts : ne nécessitent pas de connexion Internet, les documents sensibles ne quittent jamais votre ordinateur, et ils offrent des fonctionnalités de traitement par lot (mise en file d'attente automatique de milliers de pages).
Mais il y a aussi un coût : ils nécessitent généralement une licence payante, demandent une gestion de l'installation et des mises à jour, ne fonctionnent que sur l'ordinateur où ils sont installés (vous ne pouvez pas y accéder depuis un téléphone ou un autre appareil), et il faut souvent apprendre à utiliser l'intégralité du programme même pour un seul document. Pour des besoins occasionnels, portant sur quelques documents, cet investissement peut être disproportionné.
Option 3 : outils PDF en ligne
Les outils OCR fonctionnant dans le navigateur vous permettent, sans aucune installation, de téléverser votre fichier et de télécharger en quelques minutes un PDF consultable. Que ce soit Windows, Mac, Linux ou un Chromebook, peu importe ; ils sont utilisables depuis n'importe quel appareil disposant d'un navigateur. Pas d'installation, pas de gestion de licence, pas de mises à jour à suivre.
Le point clé le plus important de cette approche est la prise en charge de la langue. Pour qu'un document en français reconnaisse correctement des lettres comme é, è, à, ç ou œ dans des mots comme « étudiant », « modification » ou « où », le moteur OCR doit prendre en charge le jeu de caractères français. Si vous numérisez un contrat en français avec un moteur optimisé uniquement pour l'anglais, le mot « modification » peut se transformer en « modificati0n » ou en une suite de caractères dénuée de sens — ce qui compromet d'emblée la fiabilité de la recherche et du texte.
Les outils en ligne ont aussi leurs limites : pour de très gros fichiers (plusieurs centaines de pages), vous dépendez de la connexion Internet, et pour des documents extrêmement confidentiels (par exemple en raison de politiques de sécurité internes à l'entreprise), il peut être indésirable que le fichier transite par un quelconque serveur. Dans ce cas, une solution de bureau d'entreprise ou une option locale/hors ligne est plus appropriée.
Quelle option a du sens dans quelle situation
- Document numérisé occasionnel, de quelques pages (facture, requête, ancien article) : un outil OCR en ligne est la solution la plus rapide et la moins contraignante. Téléversez, attendez, téléchargez.
- Une organisation traitant régulièrement des centaines/milliers de pages : l'investissement dans un logiciel OCR de bureau s'amortit avec le temps, le traitement par lot et l'automatisation offrant ici un avantage.
- Documents très confidentiels, qui ne doivent pas sortir : une solution locale/hors ligne ou l'infrastructure propre de l'organisation doit être privilégiée.
- Un seul court paragraphe ou une écriture manuscrite illisible : parfois, retaper à la main peut être plus rapide que de gérer les corrections d'erreurs de l'OCR.
Facteurs influençant la précision après l'OCR
Quelle que soit la méthode choisie, la qualité du résultat dépend en grande partie de la qualité de la source :
- Résolution de numérisation : à partir de 200 dpi, le résultat est net ; une résolution plus faible augmente le taux d'erreur.
- Angle de la page : sur des pages numérisées de travers, la reconnaissance des caractères devient plus difficile.
- Contraste : une encre pâle, des photocopies avec des ombres ou du vieux papier jauni compliquent la tâche de l'OCR.
- Police et écriture manuscrite : les polices d'impression standards sont reconnues avec une grande précision ; les polices ornées ou l'écriture manuscrite réduisent la précision.
Une fois le traitement terminé, en particulier pour les documents importants (contrats, documents officiels), parcourir rapidement et vérifier le texte issu de l'OCR est une bonne habitude. L'OCR n'est pas fiable à cent pour cent, mais sur une numérisation de bonne qualité, le taux de précision est généralement très élevé, et l'objectif n'est de toute façon pas une transcription parfaite, mais de rendre le document consultable et copiable.
En résumé
Il n'existe pas une seule bonne façon de rendre un PDF numérisé consultable ; cela dépend du volume du document, du besoin de confidentialité et de la fréquence à laquelle vous devrez effectuer cette tâche. Pour la plupart des utilisateurs, pour les documents numérisés rencontrés occasionnellement, un outil OCR en ligne — en particulier un outil reconnaissant correctement les caractères français — s'avère l'option la plus pratique grâce à sa rapidité et à l'absence d'installation requise. Pour les besoins à volume élevé et répétitifs, les solutions de bureau conservent leur place, tout comme la correction manuelle pour les textes très courts et sensibles.
Questions fréquentes
L'image originale est-elle altérée dans un PDF auquel une couche de texte a été ajoutée par OCR ?
Non. Le traitement OCR préserve l'image de la page numérisée telle quelle ; il ajoute simplement une couche de texte invisible derrière l'image. Autrement dit, le PDF apparaît toujours de la même façon, mais vous pouvez désormais y effectuer une recherche et sélectionner puis copier le texte. La qualité visuelle ou la mise en page ne change pas.
Si le document que j'ai numérisé contient des caractères français accentués (é, è, à, ç, œ), l'OCR fonctionne-t-il correctement ?
Lorsqu'un outil OCR prenant en charge le français est utilisé, ces caractères sont correctement reconnus. Avec des moteurs génériques entraînés uniquement pour l'anglais, en revanche, des lettres comme é, è ou ç se transforment souvent en caractères erronés. C'est pourquoi, pour les documents en français, s'assurer que l'outil prend en charge le pack de langue français est, à lui seul, le facteur le plus déterminant pour la précision.
Quelle est la fiabilité du résultat de l'OCR sur des numérisations de plusieurs pages et en basse résolution ?
Le nombre de pages n'affecte pas la précision de l'OCR, car chaque page est traitée séparément ; le facteur déterminant est la qualité de la numérisation. À partir de 200 dpi, sur des pages numérisées nettes et droites, le résultat est très précis. Sur des numérisations de travers, avec des ombres ou en très basse résolution, certains mots peuvent être mal reconnus ; dans ce cas, si vous disposez du document original, le renumériser dans une meilleure qualité est la solution la plus fiable.
Essayez dès maintenant avec OCR (Taranmış PDF).
Essayer OCR (Taranmış PDF)