PDFMove
¿Por qué es difícil extraer las tablas de un PDF? La lógica detrás de la conversión a Excel
Guía

¿Por qué es difícil extraer las tablas de un PDF? La lógica detrás de la conversión a Excel

7 min de lectura

La tabla que ve tu ojo no está en el archivo

Cuando abres un PDF y miras la tabla que contiene, ¿qué ves? Filas, columnas, celdas, quizá bordes y una fila de encabezado sombreada. La estructura es clarísima; de un vistazo entiendes qué valor pertenece a qué columna.

Ahora miremos dentro de ese mismo archivo. Dentro del archivo PDF hay instrucciones de este tipo: dibuja estos caracteres en este punto, traza una línea de aquí a allí, rellena este rectángulo de gris claro. Eso es todo. En ninguna parte del archivo pone "aquí hay una tabla de tres columnas". No existe el concepto de celda. No existe el concepto de fila.

Lo que tú ves como una tabla es la impresión que crean en tu ojo unos textos bien alineados y las líneas trazadas a su alrededor. El cerebro humano interpreta ese patrón como una tabla al instante; un algoritmo, en cambio, se ve obligado a adivinarlo desde cero.

En este artículo explicamos cómo funciona ese proceso de suposición, por qué algunas tablas se extraen a la perfección y por qué otras se descuadran.

¿Cómo encuentra la tabla el conversor?

Un algoritmo de extracción de tablas resuelve en realidad dos problemas distintos. Primero localiza en la página las zonas que podrían ser una tabla y después deduce la cuadrícula de celdas de esa zona. Para el segundo paso hay dos estrategias básicas, y cuál de ellas se pueda usar determina en gran medida la calidad de la conversión.

Enfoque basado en líneas

Si la tabla tiene bordes reales, el trabajo es bastante fácil. El algoritmo reúne las líneas horizontales y verticales de la página, encuentra sus puntos de intersección y acepta la cuadrícula resultante como estructura de celdas. Después asigna a cada celda los fragmentos de texto que caen dentro de sus límites.

Este enfoque es fiable porque el margen de suposición es pequeño; las líneas están escritas de forma explícita en el archivo. Por eso las tablas con bordes completos y bien trazadas se importan casi a la perfección.

Enfoque basado en espacios

Si la tabla no tiene bordes, algo muy común en el diseño de documentos moderno, el algoritmo no dispone de líneas. En ese caso la única pista es la alineación. El algoritmo hace lo siguiente: mira las posiciones horizontales de inicio de los fragmentos de texto de distintas filas y acepta como pertenecientes a la misma columna los que están alineados entre sí. De forma parecida, mirando las posiciones verticales agrupa las celdas de una misma fila.

Este enfoque funciona, pero es frágil. Si una celda está vacía, el patrón de alineación se interrumpe. Si en una celda el texto está alineado a la derecha y en las demás a la izquierda, el algoritmo puede tomarlas por columnas distintas. Si en una celda el texto se desborda a dos líneas, la segunda línea puede interpretarse como una fila de tabla independiente.

Los casos que más se estropean y sus causas

Entender por qué algunas tablas se descuadran también te muestra qué esperar en cada tipo de documento.

Celdas combinadas. Un encabezado que se extiende por dos columnas rompe la lógica de la cuadrícula. El algoritmo se ve obligado a decidir a qué columna pertenece ese texto y normalmente lo asigna a la primera, lo que crea un desajuste con los datos de debajo.

Texto de varias líneas dentro de una celda. Si una descripción larga se ha envuelto en tres líneas dentro de la celda, el enfoque basado en espacios puede tomarlas por tres filas de tabla distintas y desalinearlas respecto a los valores de una sola línea de las demás columnas.

Celdas vacías. Una celda vacía significa que en esa posición no se ha dibujado ningún texto. El algoritmo puede no darse cuenta de que ahí hay una columna y los valores de la derecha se colocan desplazados una columna a la izquierda. Es el tipo de error más peligroso, porque produce datos erróneos en silencio.

Tablas que ocupan varias páginas. En el PDF cada página es independiente. Si la tabla continúa en la página siguiente, el algoritmo la trata como una tabla aparte. Los títulos de página, los números de página y los encabezados de columna repetidos que se intercalan se mezclan con los datos.

Encabezados anidados. Las estructuras de dos niveles, con un encabezado de categoría ancho arriba y subencabezados debajo, no se pueden traducir directamente al modelo de tabla plana de Excel y normalmente se aplanan.

¿Por qué no llegan las fórmulas?

Es lo que más sorprende a los usuarios, pero el motivo es extremadamente simple: las fórmulas no están en absoluto en el archivo PDF.

¿Qué ocurre cuando guardas un archivo de Excel como PDF? Excel primero calcula todas las fórmulas, obtiene los resultados y dibuja esos resultados en la página. Lo que se escribe en el archivo PDF es el número 1.250; no la fórmula de suma que produjo ese número. La fórmula se ha perdido de forma permanente en el momento de guardar.

Por tanto, ningún conversor puede extraer fórmulas de un PDF, porque no hay ninguna fórmula que extraer. Tras la conversión tendrás los números correctos, pero serán valores fijos; tendrás que reconstruir la lógica de cálculo. La misma lógica vale para el formato de celda, las reglas de formato condicional y los ajustes de validación de datos; todo eso se pierde al escribir en el PDF.

Esto no es una carencia de la conversión, es la naturaleza del formato. Si necesitas las fórmulas, el único camino es pedirle el archivo original a quien generó el documento.

Tablas escaneadas: una capa de error añadida

En un documento escaneado, la página es en realidad una fotografía y dentro no hay ninguna instrucción de texto que leer. En esos archivos primero tiene que actuar el OCR, es decir, el reconocimiento óptico de caracteres.

En las tablas, el OCR tiene un riesgo particular: la confusión de caracteres en los datos numéricos. Parejas como el cero y la letra O mayúscula, la cifra uno y la ele minúscula, el seis y el ocho o el tres y el ocho se reconocen mal con facilidad en escaneos de baja resolución. En un documento de texto un error así se detecta de inmediato a simple vista, porque la palabra deja de tener sentido. En una tabla, en cambio, que ponga 63 en lugar de 68 no llama la atención en absoluto y entra en silencio, como un dato erróneo, en todos tus cálculos.

Por eso, en las tablas escaneadas revisar la salida no es un paso opcional. Si el original tiene una fila de totales, calcular esa misma suma en Excel y compararla es el método de verificación más rápido y eficaz.

¿Qué tablas se importan sin problemas?

Traduzcamos toda esta información a un mapa práctico de expectativas. Las tablas con estas características se importan casi sin fallos: con bordes completos, con una sola línea de texto en cada celda, sin celdas combinadas, que caben en una sola página y basadas en texto. Los extractos bancarios, las listas de precios sencillas y los volcados de datos planos suelen entrar en esta categoría.

Estas otras características, en cambio, exigen corrección: tablas sin bordes y alineadas solo con espacios, celdas de varias líneas, encabezados anidados, tablas largas que ocupan varias páginas y documentos escaneados. En ese tipo de archivos, ver la conversión como un punto de partida sigue siendo mucho más rápido que la introducción manual; pero no conviene usar el resultado sin verificarlo. Para ver qué sale con el archivo que tienes, puedes probar la herramienta de PDF a Excel.

En resumen

En los archivos PDF la estructura de tabla la mayoría de las veces no se guarda en absoluto; solo hay coordenadas de texto y líneas. Los conversores deducen la cuadrícula de celdas leyéndola de las líneas o adivinándola a partir de los patrones de alineación. En tablas con líneas y regulares el resultado es fiable; en tablas sin bordes, con celdas combinadas o que ocupan varias páginas, el margen de suposición crece y hace falta corregir. Las fórmulas no llegan bajo ninguna circunstancia, porque nunca se escribieron en el PDF. En las tablas escaneadas, el OCR añade una capa de error aparte y la verificación numérica se vuelve obligatoria.

Preguntas frecuentes

¿De verdad no existe nada parecido a una estructura de tabla en el PDF?

En la gran mayoría de los archivos PDF estándar realmente no existe. Dentro del archivo solo está escrito qué carácter se dibuja en qué coordenada de la página y qué línea se traza desde dónde hasta dónde. Lo que tu ojo ve como una tabla es una impresión visual que nace de la combinación de textos bien alineados y de las líneas trazadas a su alrededor. Hay una excepción: en los PDF etiquetados, generados conforme a las reglas de accesibilidad, la estructura de tabla se marca de forma explícita y en esos archivos la extracción es mucho más precisa, aunque en la práctica la mayoría de los archivos con los que te encuentras no están etiquetados.

¿Cómo adivina el conversor los límites de las celdas?

Se usan dos pistas fundamentales. La primera son las líneas: si hay líneas horizontales y verticales dibujadas en la página, sus intersecciones dan directamente la cuadrícula de celdas y el resultado es bastante fiable. La segunda es la alineación: si no hay líneas, el algoritmo mira si los fragmentos de texto de distintas filas empiezan en posiciones horizontales similares e interpreta como columnas los conjuntos de texto alineados verticalmente. El segundo método es por naturaleza una suposición y puede fallar sobre todo en tablas con celdas vacías o cuyo contenido está alineado de forma distinta.

¿Por qué no hay fórmulas en la tabla que importé a Excel?

Porque las fórmulas no están nunca en el archivo PDF. Cuando guardas un archivo de Excel como PDF, los resultados de los cálculos se dibujan en la página, pero las fórmulas que produjeron esos resultados no se escriben en el archivo. El PDF guarda solo la imagen, no la lógica de cálculo. Por tanto, tras la conversión tendrás los números correctos, pero serán valores fijos. La única forma de recuperar las fórmulas es pedirle el archivo Excel original a quien generó el documento; la conversión no puede regenerar esa información porque no existe en el origen.

¿Por qué distintas herramientas extraen la misma tabla de forma diferente?

Porque los valores umbral que se usan para deducir los límites de las celdas son distintos en cada herramienta. Decisiones como cuán ancho debe ser el espacio entre dos fragmentos de texto para considerarlos celdas separadas, o qué desviación de alineación sigue aceptándose como la misma columna, son opciones de diseño. Esas diferencias no se notan en absoluto en tablas con líneas y regulares, porque ahí no hace falta suponer nada. En tablas sin bordes y con espaciado irregular, en cambio, el mismo archivo puede dar resultados visiblemente distintos en herramientas diferentes.

Pruébalo ahora mismo con PDF → Excel Dönüştür.

Probar PDF → Excel Dönüştür