PDFMove
¿Cómo Funciona el Escaneo de Documentos en Segundo Plano? Detección de Bordes, Corrección de Perspectiva y Limpieza de Sombras
Guía

¿Cómo Funciona el Escaneo de Documentos en Segundo Plano? Detección de Bordes, Corrección de Perspectiva y Limpieza de Sombras

11 min de lectura

Entre la foto de documento que tomas con tu teléfono y la imagen que sale de un escáner de oficina hay una diferencia visible a simple vista. En la foto el papel está torcido, un borde parece más ancho que el otro, tu propia sombra cae encima y la superficie de apoyo entra en el encuadre. En la salida del escáner, en cambio, la página está completamente recta, sus bordes son paralelos y la iluminación es uniforme.

Lo interesante es esto: la mayor parte de esa diferencia no es óptica sino matemática. Es decir, aplicando los pasos correctos de procesamiento de imagen es posible acercar bastante una foto de teléfono corriente a la salida de un escáner. En este artículo abordamos de forma técnica pero legible los tres pasos fundamentales que la herramienta Escáner de documentos aplica en segundo plano: detección de bordes, corrección de perspectiva y limpieza de sombras.

El Origen del Problema: una Cámara No Es un Escáner

Un escáner plano mira el documento desde una distancia fija, en ángulo perfectamente perpendicular y con una luz controlada. La cámara del teléfono no garantiza nada de eso:

  • El ángulo no es fijo. Mirar el papel perfectamente en perpendicular es casi imposible en la práctica; incluso una inclinación de unos pocos grados convierte el rectángulo en un trapecio.
  • La distancia no es la misma en todos los puntos. El borde de la página más cercano a ti parece más grande, el borde lejano más pequeño.
  • La iluminación no es uniforme. La luz que entra por la ventana ilumina un lado mientras el otro queda en sombra; además, tú y tu teléfono proyectáis vuestra propia sombra.
  • En el encuadre hay algo más que el papel. La mesa, un libro, parte de tu mano.

Cada uno de los pasos de procesamiento de imagen apunta a uno de estos problemas.

Paso 1: Detección de Bordes — ¿Dónde Empieza el Papel?

La primera pregunta es esta: ¿qué zona de esta foto es el documento y cuál es el fondo? El ojo humano lo hace al instante, pero un algoritmo tiene que deducirlo a partir de los valores de los píxeles.

El enfoque utilizado es la detección de contornos. Se calculan las diferencias de intensidad entre píxeles vecinos de la imagen; si los valores de píxel cambian rápidamente en una zona, es que ahí hay un límite. Esos puntos de límite se unen para obtener curvas cerradas (contornos).

En la foto de un documento hay decenas de contornos: el borde del papel, las líneas de texto, la veta de madera de la mesa, el límite de la sombra. Pero solo se busca uno de ellos: el contorno de cuatro esquinas que forma el límite exterior del papel y ocupa gran parte de la imagen.

El éxito de esta detección depende directamente del contraste. Si el papel blanco está sobre una mesa oscura, la diferencia de intensidad en el límite es grande y el contorno sale nítido; si está sobre una mesa de color claro, la diferencia es pequeña y el contorno sale entrecortado o no se forma en absoluto. Si una de las esquinas está fuera del encuadre, ya no puede formarse un cuadrilátero cerrado.

¿Qué Pasa Si No Se Encuentra?

Aquí entra en juego una decisión de diseño deliberada de la herramienta: si no se encuentra el borde, la foto se usa tal cual y el proceso no falla.

A primera vista puede parecer un comportamiento "perezoso", pero en realidad es el correcto. Piensa en la alternativa: que el algoritmo haga una estimación sin estar seguro y recorte según esa estimación. Unas esquinas mal estimadas significan que se corta la mitad del documento. Que se corte y se descarte la línea de firma de un contrato o el importe de una factura es un resultado mucho peor que no recortar nada.

Es decir, el sistema opta por no intervenir ante la incertidumbre. El precio de esa decisión es que te quedas con una foto sin recortar, pero eso es reversible: vuelves a tomar la foto sobre una superficie más contrastada. Un documento cortado, en cambio, no es reversible.

Paso 2: Corrección de Perspectiva — Convertir el Trapecio en Rectángulo

Tras encontrar las cuatro esquinas comienza el segundo paso: la transformación de perspectiva de cuatro puntos.

El problema se formula así. En el mundo real una hoja A4 es un rectángulo; sus cuatro ángulos son de 90 grados. Pero en una foto tomada torcida ese rectángulo aparece como un trapecio: borde cercano largo, borde lejano corto, ángulos distintos de 90 grados. El objetivo es volver a convertir el trapecio de la foto en un rectángulo.

Matemáticamente esto es hacer corresponder un plano de una vista a otra. Tienes cuatro puntos de origen (las esquinas del trapecio en la foto) y cuatro puntos de destino (las esquinas del rectángulo de salida). Esos cuatro pares de puntos determinan de forma única la transformación entre los dos planos. Una vez calculada la transformación, para cada píxel de la imagen de salida se encuentra la posición correspondiente en la imagen de origen y se toma de ahí el valor de color.

El resultado práctico es que obtienes una imagen como si miraras la página completamente de frente: los bordes quedan paralelos, las líneas de texto quedan horizontales.

La Suposición y el Límite de la Transformación

Este cálculo tiene una suposición crítica: la superficie transformada es un plano. Si el papel está extendido plano sobre la mesa, la suposición es correcta y el resultado es muy bueno.

Pero si el papel está curvado, arrugado, o es una página cercana al lomo de un libro, la superficie ya no es un plano. La transformación se aplica igualmente —los bordes se enderezan— pero la curvatura de la superficie permanece. Donde más claramente lo ves es en las páginas de libro: los bordes se enderezan pero los textos de la zona cercana al lomo siguen ligeramente curvados y comprimidos. La conclusión práctica es simple: extiende el documento sobre una superficie lo más plana posible.

Paso 3: Limpieza de Sombras — Igualar una Luz Desigual

El tercer paso y quizá el que más cambia el resultado. Una página con la perspectiva corregida puede seguir pareciendo "una foto", porque la iluminación no es uniforme: lado izquierdo brillante, lado derecho gris, sombra en una esquina.

El método que se aplica aquí se basa en esta lógica: cuando desenfocas una imagen de forma extrema, solo queda la distribución de la luz.

Consta de dos pasos:

  1. Una copia de la imagen se desenfoca intensamente. Este proceso borra por completo los detalles finos —el texto, las líneas, la textura—; queda una distribución de intensidad suave que indica qué zona de la página está iluminada y en qué medida. Podemos llamarla el mapa de fondo.
  2. La imagen original se divide entre ese mapa. La operación de división normaliza cada píxel según el brillo medio de su propia zona.

El resultado es este: un píxel de una zona iluminada se divide entre un valor de fondo alto y se tira hacia abajo, un píxel de una zona sombreada se divide entre un valor bajo y se tira hacia arriba. Así, toda la página llega al mismo nivel de brillo.

El punto crítico es este: el texto no se ve afectado por esta operación. Porque el texto, al haberse borrado durante el desenfoque, no figura en el mapa de fondo, y lo que no está en el mapa tampoco puede neutralizarse en la división. El fondo se iguala y el texto conserva su contraste; incluso su contraste relativo aumenta, ya que el fondo se blanquea.

El método funciona muy bien en transiciones suaves, como la luz unilateral que entra por una ventana o la diferencia gradual de brillo que crea una lámpara de escritorio. Donde tiene dificultades es con las sombras muy oscuras de bordes nítidos: la sombra dura que tu mano proyecta sobre el papel permanece, incluso tras el desenfoque, como un límite nítido en el mapa y no puede neutralizarse del todo.

Paso 4: Filtros y Normalización a A4

Después de los tres pasos fundamentales llega una última capa de procesamiento: la elección del filtro. Cuatro modos aplican distintos procesos finales a la misma imagen corregida.

El modo documento (predeterminado) combina la limpieza de sombras con el aumento de contraste y el enfoque. Está diseñado para la mayoría de páginas con predominio de texto: fondo blanco, texto oscuro y nítido.

La escala de grises elimina la información de color; la limpieza de sombras también se aplica aquí, pero el contraste se mantiene más suave que en el modo documento. Su función no es endurecer el texto sino preservar los tonos, y por eso resulta más segura que el blanco y negro en páginas con fotos o gráficos sombreados.

El blanco y negro aplica umbralización: cada píxel por encima de un valor umbral queda blanco, por debajo negro, sin tonos intermedios. De los cuatro modos, este produce el archivo más pequeño, pero causa una pérdida de información importante en páginas con contenido en tonos grises.

En el modo original no se toca la imagen en color; solo se aplican la detección de bordes y la corrección de perspectiva. Hay un detalle que conviene señalar: la limpieza de sombras se aplica en los otros tres modos, y el original es el único que se salta ese paso. Por eso es la opción correcta cuando la propia información de color tiene significado —firma azul, sello en color, tablas con código de color— y cuando una foto o un gráfico en tonos grises de la página debe quedar completamente intacto.

Por último, cada página se ajusta al tamaño A4. La orientación se elige imagen por imagen: una toma vertical produce una página A4 vertical (595x842 puntos) y una toma horizontal, una página A4 horizontal (842x595 puntos). El valor de este paso aparece en documentos de varias páginas: aunque hayas tomado cada foto a distinta distancia, el resultado se ve consistente. En una sesión con orientaciones mezcladas, como es lógico, los tamaños de página no coincidirán todos.

El Último Paso, Opcional: la Capa de Texto

En el fondo, el escáner de documentos es una herramienta de procesamiento de imagen, pero también puede reconocer el texto al final del proceso si se lo pides. Elige turco, inglés o turco + inglés en el desplegable Reconocimiento de texto (OCR) de la página de la herramienta y se colocará una capa de texto invisible sobre el PDF terminado, con lo que el documento pasa a ser consultable. La opción predeterminada es "No añadir": el reconocimiento de texto alarga notablemente el tiempo de procesamiento, así que está ahí para quien la necesite.

Si dejas el desplegable como está, cada página del resultado sigue siendo una imagen corregida y limpiada: legible para el ojo, pero todavía una imagen desde el punto de vista del ordenador.

Que el reconocimiento vaya al final, sobre el PDF terminado y no sobre las fotos una a una, tampoco es casual. Su precisión depende directamente de la calidad de la imagen de entrada: las líneas torcidas, el fondo sombreado y el bajo contraste son los tres factores fundamentales que dificultan el reconocimiento de caracteres, y son exactamente los tres problemas que resuelven los pasos anteriores. Si ya tienes un PDF bien escaneado y lo único que te falta es la capa de texto, existe una herramienta de OCR aparte para eso.

¿Qué Significa Esto en Términos de Privacidad?

Estas operaciones —análisis de contornos, transformación de perspectiva, desenfoque y división— se ejecutan del lado del servidor. A diferencia de algunas herramientas PDF que funcionan dentro del navegador, aquí el archivo se transfiere al servidor, se procesa y el resultado vuelve a ti. Los archivos se eliminan una vez completado el proceso. Como las fotos de documentos suelen contener material sensible —identificación, contrato, factura, informe médico—, conviene usar la herramienta siendo consciente de este punto.

Conclusión

Lo que convierte una foto de teléfono en un documento escaneado no es una única operación mágica; son tres cálculos que se complementan. La detección de contornos encuentra dónde está el papel, la transformación de perspectiva de cuatro puntos corrige el ángulo, la división entre el mapa de fondo iguala la iluminación. Cada paso tiene su propia suposición: la detección de bordes requiere contraste, la corrección de perspectiva supone un plano, la limpieza de sombras da su mejor resultado con diferencias graduales de luz.

Conocer estos límites te permite usar mejor la herramienta, porque las tres decisiones sencillas que tomas al hacer la foto (superficie oscura, papel plano, luz uniforme) ayudan en realidad de forma directa a cada uno de esos tres algoritmos.

Preguntas frecuentes

¿Por qué la limpieza de sombras empieza desenfocando la imagen?

Porque el desenfoque borra los detalles finos de la imagen (texto, líneas, textura) y deja únicamente la distribución de luz y sombra a gran escala. Esa distribución es en realidad el mapa de cómo incide la luz sobre la página. Cuando la imagen original se divide entre ese mapa, cada píxel se normaliza según el brillo medio de su propia zona; así, una página iluminada por un lado y sombreada por el otro se ve con un brillo uniforme.

¿Por qué a veces la detección de bordes no encuentra el papel?

La detección de contornos se basa en la diferencia de intensidad entre zonas vecinas. Si un papel blanco está sobre una mesa de color claro, no se produce suficiente diferencia en el límite y el contorno del papel no puede percibirse como un cuadrilátero cerrado. El mismo problema ocurre cuando una esquina del papel queda fuera del encuadre o cuando cae sobre él una sombra nítida. En esos casos la herramienta no recorta y usa la foto tal cual.

¿La corrección de perspectiva corrige también los pliegues del papel?

No. La transformación de perspectiva de cuatro puntos es una transformación lineal que convierte la vista de una superficie plana tomada desde otro ángulo en una vista frontal; la suposición fundamental del cálculo es que la superficie es un plano. La curvatura del lomo en una página fotografiada de un libro o la ondulación de un papel arrugado rompen esa suposición y permanecen después de la transformación. Para el mejor resultado hay que extender el papel sobre una superficie plana.

Pruébalo ahora mismo con Belge Tarayıcı.

Probar Belge Tarayıcı
¿Cómo Funciona el Escaneo de Documentos en Segundo Plano? Detección de Bordes, Corrección de Perspectiva y Limpieza de Sombras | PDF Move