El problema de la doble página al escanear libros: por qué ocurre y qué hacer
7 min de lectura
Si al abrir el PDF escaneado de un libro ves dos páginas en cada hoja, no es un error: es la consecuencia natural de que el escáner guarde tal cual lo que ve. En este artículo explicamos por qué se produce esta situación, cómo define el PDF los tamaños de página y qué cambia exactamente dentro del archivo la operación de división.
El escáner guarda lo que ve
Cuando abres el libro y lo apoyas sobre el cristal de un escáner plano, el cabezal lee toda la superficie del cristal en una sola pasada. Como el libro está abierto por dos páginas, esas dos páginas se convierten en una sola imagen. El software del escáner no deduce que "aquí hay dos páginas lógicas"; guarda píxel a píxel el área rectangular que tiene delante.
Cuando esa imagen se coloca en un PDF, aparece esta estructura:
- Número de páginas = número de escaneos = la mitad de las páginas físicas del libro.
- Tamaño de página = el tamaño del área escaneada, normalmente A4 horizontal o más ancho.
- Contenido = un único objeto de imagen grande, colocado para encajar exactamente en la página.
El mismo resultado se ve en las fotocopiadoras, en las apps de móvil para escanear libros y en los archivos de revistas antiguas. Algunos archivos digitales lo hacen a propósito: presentan las dos páginas una al lado de la otra para imitar la experiencia de pasar hoja.
Cómo define el PDF el tamaño de página
Para entender qué hace la división hay que conocer la geometría de página del PDF. Cada objeto de página contiene varias definiciones de rectángulo:
| Caja | Significado | |---|---| | MediaBox | Tamaño físico del soporte de la página: la medida del papel en el que se imprimirá | | CropBox | El área que el visor mostrará en pantalla | | BleedBox | Límite del margen de sangrado en imprenta | | TrimBox | Tamaño final de la página tras el guillotinado | | ArtBox | Área de contenido significativo |
En el uso cotidiano importan las dos primeras. El MediaBox es obligatorio en cada página y da el tamaño completo. El CropBox es opcional; si está definido, el visor muestra la página como si estuviera recortada a ese rectángulo, y si no lo está, usa el MediaBox.
El punto crítico: el CropBox no borra el contenido. Los datos de imagen que quedan fuera de la caja siguen en el archivo, solo que invisibles. Por eso es un error peligroso creer que recortando un PDF has ocultado información confidencial: cualquiera que amplíe la caja de recorte vuelve a ver el contenido oculto.
Qué hace la división por dentro
Hay dos formas de implementar la división de una hoja en dos, y cuál se use afecta al resultado.
Método 1: dividir con la caja de recorte. La herramienta crea dos objetos de página nuevos que referencian dos veces el mismo contenido. El CropBox de la primera página se ajusta a la mitad izquierda del área original y el de la segunda a la mitad derecha. Los datos de imagen no se tocan.
- Ventaja: es extremadamente rápido y la pérdida de calidad es rigurosamente cero.
- Desventaja: el archivo no se reduce, incluso crece un poco. Como ambas páginas referencian la imagen completa, los datos de imagen se guardan una vez pero se usan dos.
Método 2: cortar físicamente la imagen. La herramienta decodifica la imagen de la página, la corta por la mitad, produce dos imágenes nuevas y coloca cada una en su propia página.
- Ventaja: cada página lleva solo sus propios datos y no queda contenido oculto.
- Desventaja: puede ser necesario recodificar la imagen. Si la fuente es JPEG y se vuelve a guardar como JPEG, se añade una segunda codificación con pérdidas.
En la práctica, la mayoría de herramientas usan el primer método porque es rápido y sin pérdidas. Si quieres reducir el tamaño del archivo, una mejor estrategia es pasarlo por una herramienta de compresión después de dividir.
Por qué el centro no siempre es el correcto
La herramienta de división corta la página por su centro geométrico exacto: divide en dos el ancho del CropBox y pone ahí la línea de corte. No mira dónde está el contenido ni en qué píxel aparece el lomo del libro.
Si el escaneo es simétrico, funciona a la perfección. En la vida real ocurre esto:
- El libro se coloca sin centrar bien sobre el cristal y el lomo se desplaza varios centímetros respecto al centro real.
- En los libros de tapa dura las páginas no se apoyan del todo en el cristal y los anchos izquierdo y derecho no salen iguales.
- Si el área de escaneo es más ancha que el libro, queda una franja blanca en un lado y el centro se desplaza.
- La página queda ligeramente torcida y la línea del lomo no es vertical, sino algo inclinada.
La solución es recortar antes de dividir: quita los márgenes sobrantes para llevar el lomo al centro real y luego divide. Para los escaneos torcidos, la solución por software es limitada; si la inclinación es evidente, repetir el escaneo es la vía más limpia.
La cuestión del sentido de lectura
La herramienta de división ordena las páginas resultantes de izquierda a derecha: la mitad izquierda de la hoja 1 pasa a ser la nueva página 1 y la mitad derecha la nueva página 2. Eso es correcto para las lenguas que usan el alfabeto latino.
En los documentos que se leen de derecha a izquierda —documentos de archivo en árabe o persa, manga japonés— la mitad derecha debe ir primero. La herramienta no puede deducirlo del contenido, así que tendrás que corregir el orden con una herramienta de organización de páginas después de dividir. Como alternativa, algunos lectores de libros electrónicos admiten un modo de lectura de derecha a izquierda y te permiten leer el archivo sin corregirlo.
Por qué queda la sombra del lomo
En el punto donde se unen las dos páginas del libro, el papel no llega a tocar el cristal y se forma una franja oscura. Eso son datos de píxel reales del escaneo: la división no los elimina, solo los parte en dos. El resultado es que queda una franja de sombra en el borde derecho de la página izquierda y en el borde izquierdo de la derecha.
Para limpiarla hace falta recortar después de dividir, pero hay un problema de asimetría: la sombra está en un borde en las páginas impares y en el otro en las pares. Como el recorte se aplica igual a todas las páginas, una limpieza total solo se consigue procesando por separado las impares y las pares y combinándolas luego. En la mayoría de documentos no compensa; un recorte simétrico de unos milímetros se lleva la mayor parte de la sombra.
Su relación con el OCR
Si quieres poder buscar texto en un documento escaneado, tendrás que aplicar OCR. El orden importa: divide primero y haz el OCR después.
La razón: los motores de OCR detectan los bloques de texto de la página y los ordenan según el sentido de lectura. En una hoja con doble página hay dos columnas de bloques, y el motor a veces las toma por una única maquetación a dos columnas y otras veces lee las líneas en horizontal de izquierda a derecha y entrelaza el texto de ambas páginas. El texto resultante es una mezcla sin sentido.
En páginas sueltas ya divididas no existe esa ambigüedad; cada página es por sí misma una página normal.
En resumen
El problema de la doble página nace de que el escáner guarda como una sola imagen todo el área que ve. En el PDF, el tamaño de página se define con los rectángulos MediaBox y CropBox, y la división suele funcionar manipulando esas cajas, por eso es rápida y no provoca pérdida de calidad, pero no reduce el archivo. Como la división usa el centro geométrico, en los escaneos asimétricos hay que recortar antes; la sombra del lomo no desaparece al dividir; y en los documentos que se leen de derecha a izquierda hay que corregir el orden a mano. Y si tienes previsto hacer OCR, la división debe ir siempre antes del OCR.
Preguntas frecuentes
¿La división corta realmente la imagen o solo la oculta?
Depende de la implementación. El método más ligero consiste en referenciar dos veces la misma imagen y ajustar la caja de recorte de cada página a una mitad distinta; en ese caso, todos los datos de imagen siguen en el archivo, solo que invisibles. El método más completo consiste en cortar físicamente la imagen en dos y producir dos imágenes distintas. El primero es rápido y no provoca pérdida de calidad, pero el archivo no se reduce; el segundo reduce el archivo pero puede requerir recodificación.
¿Qué son MediaBox y CropBox, y cuál determina el tamaño de la página?
MediaBox es el tamaño físico del soporte de la página; piensa en él como la medida del papel en el que se va a imprimir. CropBox es el área que el visor mostrará en pantalla y se define como un rectángulo dentro del MediaBox. Si hay CropBox definido, el visor lo usa; si no, recurre al MediaBox. Las operaciones de división y recorte suelen trabajar sobre el CropBox.
¿Por qué en algunos escaneos la línea de corte no queda en el centro?
Porque al escanear el libro no se colocó perfectamente centrado sobre el cristal, o porque las páginas izquierda y derecha se escanearon con anchos distintos. La herramienta divide la página por su centro geométrico exacto; no mira dónde está el contenido. Si hay un desplazamiento evidente, antes de dividir hay que quitar el margen sobrante con la herramienta de recorte y llevar el lomo al centro.
¿Debo dividir antes o después de aplicar el OCR?
Divide antes. Los motores de OCR ordenan los bloques de texto de la página según su posición y, en una hoja con doble página, pueden mezclar horizontalmente las líneas de las dos páginas. En páginas sueltas ya divididas, el orden de los bloques es mucho más fiable y el texto resultante sale en un orden legible.
Pruébalo ahora mismo con Sayfa İkiye Böl.
Probar Sayfa İkiye Böl