Le problème de la double page dans les livres scannés : origine et solutions
8 min de lecture
Si vous ouvrez un PDF de livre scanné et que vous voyez deux pages par feuillet, ce n'est pas un défaut — c'est la conséquence naturelle du fait que le scanner enregistre tel quel ce qu'il voit. Dans cet article, nous expliquons pourquoi cette situation se produit, comment le PDF définit la taille de ses pages et ce que la découpe modifie exactement à l'intérieur du fichier.
Le scanner enregistre ce qu'il voit
Lorsque vous ouvrez un livre et le posez sur la vitre d'un scanner à plat, la tête de lecture parcourt toute la surface vitrée en un seul passage. Le livre étant ouvert sur deux pages, ces deux pages ne forment qu'une seule image. Le logiciel du scanner ne déduit pas qu'« il y a ici deux pages logiques » ; il enregistre pixel par pixel la zone rectangulaire qui se trouve devant lui.
Lorsque cette image est placée dans un PDF, la structure obtenue est la suivante :
- Nombre de pages = nombre de numérisations = la moitié des pages physiques du livre.
- Taille de page = la taille de la zone de numérisation, généralement un A4 paysage ou plus large.
- Contenu = un unique grand objet image, positionné pour couvrir exactement la page.
Le même résultat s'observe avec les photocopieurs, les applications mobiles de numérisation de livres et les anciennes archives de magazines. Certaines archives numériques le font même volontairement : elles présentent deux pages côte à côte pour imiter l'expérience du feuilletage.
Comment le PDF définit la taille d'une page
Pour comprendre ce que fait la découpe, il faut connaître la géométrie de page du PDF. Chaque objet page contient plusieurs définitions de rectangles :
| Boîte | Signification | |---|---| | MediaBox | La taille du support physique de la page — le format du papier d'impression | | CropBox | La zone que la visionneuse affichera à l'écran | | BleedBox | La limite de fond perdu à l'impression | | TrimBox | La taille finale de la page après massicotage | | ArtBox | La zone de contenu significatif |
Dans l'usage courant, les deux premières comptent. La MediaBox est obligatoire sur chaque page et donne la taille complète de celle-ci. La CropBox est facultative ; si elle est définie, la visionneuse affiche la page comme rognée à ce rectangle, sinon elle utilise la MediaBox.
Point déterminant : la CropBox n'efface pas le contenu. Les données d'image situées hors de la boîte restent présentes dans le fichier, simplement invisibles. Croire que l'on cache une information confidentielle en rognant un PDF est donc une erreur dangereuse — quiconque élargit la boîte de rognage revoit le contenu masqué.
Ce que fait la découpe à l'intérieur du fichier
Il existe deux façons d'implémenter la coupe d'un feuillet en deux, et le choix retenu influe sur le résultat.
Méthode 1 : la découpe par boîte de rognage. L'outil crée deux nouveaux objets page qui référencent deux fois le même contenu de page. La CropBox de la première page est réglée sur la moitié gauche de la zone d'origine, celle de la seconde sur la moitié droite. Les données d'image ne sont pas touchées.
- Avantage : extrêmement rapide, perte de qualité rigoureusement nulle.
- Inconvénient : la taille du fichier ne diminue pas, elle augmente même légèrement. Les deux pages référençant l'image complète, les données d'image sont stockées une fois mais utilisées deux fois.
Méthode 2 : la coupe physique de l'image. L'outil décode l'image de la page, la coupe en deux par le milieu, produit deux nouvelles images et place chacune sur sa propre page.
- Avantage : chaque page ne transporte que ses propres données, aucun contenu caché ne subsiste.
- Inconvénient : l'image peut devoir être réencodée. Si la source est un JPEG et qu'elle est réenregistrée en JPEG, un second encodage avec perte s'ajoute.
En pratique, la plupart des outils utilisent la première méthode, car elle est rapide et sans perte. Si vous voulez réduire la taille du fichier, le faire passer par un outil de compression après la découpe est une meilleure stratégie.
Pourquoi le centre n'est pas toujours le bon endroit
L'outil de découpe coupe la page géométriquement en son milieu exact : il divise la largeur de la CropBox par deux et place la ligne de coupe à cet endroit. Il ne regarde ni où se trouve le contenu, ni à quel pixel apparaît le dos du livre.
Cela fonctionne parfaitement si la numérisation est symétrique. Dans la vraie vie, voici ce qui se produit :
- Le livre est posé sans être parfaitement centré sur la vitre ; le dos se décale de quelques centimètres par rapport au vrai milieu.
- Sur les livres à reliure épaisse, les pages ne reposent pas complètement à plat et les largeurs gauche et droite ne sont pas égales.
- Si la zone de numérisation est plus large que le livre, une bande blanche subsiste sur un bord et le centre se décale.
- La page est légèrement inclinée ; la ligne du dos n'est pas verticale mais un peu oblique.
La solution consiste à rogner avant la découpe : retirez les bords excédentaires pour ramener le dos au vrai centre, puis découpez. Pour les scans inclinés, la solution logicielle est limitée ; en cas d'inclinaison marquée, refaire la numérisation reste la voie la plus propre.
La question du sens de lecture
L'outil de découpe ordonne les pages découpées de gauche à droite : la moitié gauche du feuillet 1 devient la nouvelle page 1, sa moitié droite la nouvelle page 2. C'est correct pour les langues à alphabet latin.
Pour les documents qui se lisent de droite à gauche — documents d'archives en arabe ou en persan, mangas japonais — c'est la moitié droite qui doit venir en premier. L'outil ne peut pas le deviner à partir du contenu ; il vous faudra donc corriger l'ordre après la découpe avec un outil d'organisation des pages. En alternative, certaines liseuses prennent en charge un mode de lecture de droite à gauche et vous permettent de lire le fichier sans le corriger.
Pourquoi l'ombre de reliure subsiste
À l'endroit où les deux pages du livre se rejoignent, le papier ne touche pas complètement la vitre et une bande sombre s'y forme. Ce sont de véritables données de pixels dans le scan — la découpe ne les supprime pas, elle les coupe simplement en deux. Il reste donc une bande d'ombre sur le bord droit de la page de gauche et sur le bord gauche de la page de droite.
Pour la nettoyer, il faut rogner après la découpe, mais il y a un problème d'asymétrie : l'ombre est sur un bord pour les pages impaires et sur l'autre pour les pages paires. Comme le rognage s'applique identiquement à toutes les pages, un nettoyage complet suppose de traiter séparément les pages paires et impaires puis de les réassembler. Sur la plupart des documents, cela n'en vaut pas la peine ; un rognage symétrique de quelques millimètres retire l'essentiel de l'ombre.
Le lien avec l'OCR
Si vous voulez pouvoir faire des recherches de texte dans un document scanné, vous devez appliquer une OCR. L'ordre compte : découpez d'abord, faites l'OCR ensuite.
La raison : les moteurs d'OCR détectent les blocs de texte de la page et les rangent dans l'ordre de lecture. Sur un feuillet en double page, il y a deux colonnes de blocs, et le moteur les prend parfois pour une unique mise en page à deux colonnes, parfois il lit les lignes horizontalement de gauche à droite et entremêle le texte des deux pages. Le texte obtenu devient un mélange incohérent du type « Il était une fois dans un pays le roi, le lendemain à la réunion ».
Sur des pages simples découpées, cette ambiguïté disparaît ; chaque page est une page normale à part entière.
En résumé
Le problème de la double page vient du fait que le scanner enregistre la zone qu'il voit comme une seule image. Dans un PDF, la taille de page est définie par les rectangles MediaBox et CropBox, et la découpe fonctionne généralement en jouant sur ces boîtes — c'est pourquoi elle est rapide et sans perte de qualité, mais ne réduit pas le fichier. Comme la découpe utilise le centre géométrique, un rognage préalable s'impose sur les scans asymétriques ; l'ombre de reliure ne disparaît pas avec la découpe ; et sur les documents qui se lisent de droite à gauche, l'ordre doit être corrigé à la main. Enfin, si vous prévoyez une OCR, la découpe doit impérativement la précéder.
Questions fréquentes
La découpe coupe-t-elle réellement l'image ou se contente-t-elle de la masquer ?
Cela dépend de l'implémentation. La méthode la plus légère consiste à référencer deux fois la même image et à régler la boîte de rognage de chaque page sur une moitié différente — dans ce cas, l'intégralité des données d'image reste dans le fichier, simplement invisible. La méthode plus complète consiste à couper physiquement l'image en deux et à produire deux images distinctes. La première est rapide et n'entraîne aucune perte de qualité, mais ne réduit pas le fichier ; la seconde réduit le fichier mais peut imposer un réencodage.
Que sont MediaBox et CropBox, et laquelle définit la taille de la page ?
La MediaBox est la taille du support physique de la page — voyez-la comme le format du papier sur lequel elle sera imprimée. La CropBox est la zone que la visionneuse affichera à l'écran ; elle est définie comme un rectangle à l'intérieur de la MediaBox. Si la CropBox est définie, la visionneuse l'utilise ; sinon, elle se rabat sur la MediaBox. Les opérations de découpe et de rognage travaillent généralement sur la CropBox.
Pourquoi la ligne de coupe n'est-elle pas au centre sur certains scans ?
Parce que le livre n'a pas été posé parfaitement centré sur la vitre pendant la numérisation, ou parce que ses pages de gauche et de droite ont été scannées avec des largeurs différentes. L'outil coupe la page géométriquement en son milieu exact ; il ne regarde pas où se trouve le contenu. En cas de décalage marqué, il faut retirer le bord excédentaire avec l'outil de rognage avant la découpe, pour ramener le dos au centre.
Faut-il découper avant ou après l'OCR ?
Découpez avant. Les moteurs d'OCR ordonnent les blocs de texte d'une page selon leur position, et sur un feuillet en double page ils peuvent entremêler horizontalement les lignes des deux pages. Sur des pages simples découpées, l'ordonnancement des blocs est bien plus fiable et le texte obtenu ressort dans un ordre lisible.
Essayez dès maintenant avec Sayfa İkiye Böl.
Essayer Sayfa İkiye Böl