Cómo extraer en bruto las imágenes incrustadas de un PDF
8 min de lectura
Necesitas sacar las fotos de un catálogo de producto, rescatar los gráficos de una presentación o reutilizar las figuras de un informe. Hacer una captura de pantalla pierde calidad; guardar la página como imagen arrastra también el texto. La extracción en bruto te permite obtener los objetos de imagen incrustados en el PDF en su estado original.
Qué hace la extracción en bruto
Cuando ves una fotografía en una página de PDF, esa fotografía está en el archivo como un objeto de imagen (XObject Image) aparte. El flujo de contenido de la página lo referencia y dice "dibújalo en esta posición y con este tamaño".
La extracción en bruto encuentra esos objetos y los exporta como archivos. Sus características clave:
- Sale a resolución original. Una fotografía que en la página se ve pequeña puede tener 4000 píxeles de ancho en el archivo. La extracción en bruto te da esos 4000 píxeles.
- No hay recodificación. Si la imagen está incrustada como JPEG, sale como JPEG, sin añadir ninguna pérdida de compresión.
- No viene el resto del contenido de la página. No se toman el texto, las líneas ni el fondo.
Este último punto es la diferencia fundamental entre la extracción en bruto y "guardar la página como imagen".
Paso 1: Determina qué necesitas
Dos necesidades distintas se confunden a menudo:
| Necesidad | Operación correcta | |---|---| | Fotos de producto de un catálogo | Extracción en bruto | | Gráficos y figuras de un informe | Extracción en bruto (no funciona si son vectoriales) | | Imagen de la página completa | Conversión de PDF a imagen | | Imágenes de página de un documento escaneado | Extracción en bruto (cada página es una imagen) | | Miniatura de página para una presentación | Conversión de PDF a imagen | | Obtener un logotipo como vector | Conversión de PDF a SVG |
La última fila es importante: la extracción en bruto solo toma imágenes ráster (de píxeles). Los logotipos, esquemas y gráficos de un PDF suelen ser vectoriales: están definidos con instrucciones de línea y relleno, no son imágenes incrustadas. La extracción en bruto no los encuentra; hace falta una conversión a SVG.
Cómo comprobarlo: amplía mucho el elemento en el PDF. Si se pixela es ráster (la extracción en bruto funciona); si se mantiene nítido es vectorial (no funciona).
Paso 2: Haz la extracción
Abre la herramienta de extracción de imágenes de PDF y sube tu archivo. El proceso se ejecuta en tu navegador; tu documento no viaja al servidor.
La herramienta recorre el PDF, encuentra los objetos de imagen incrustados y te permite descargarlos como un archivo ZIP. El número de imágenes puede ser mayor o menor de lo que esperabas; enseguida veremos por qué.
Paso 3: Entiende los archivos resultantes
Prepárate para lo que te encontrarás al abrir el ZIP. La extracción en bruto es justamente "en bruto": te da lo que hay dentro del PDF, y eso no siempre se ve como esperas.
Más archivos de los esperados. Has visto una fotografía en la página y en el ZIP hay diez archivos. Los motivos:
- Imágenes troceadas. Algunos generadores de PDF, sobre todo los programas de escáner, parten las imágenes grandes en franjas horizontales. En la página se ven unidas pero en el archivo son objetos separados.
- Máscaras. La información de transparencia de una imagen se guarda como una imagen de máscara aparte en blanco y negro. En la extracción, esa máscara sale también como archivo independiente.
- Imágenes invisibles. Las imágenes que quedan fuera de la página, tapadas o fuera de la caja de recorte también están en el archivo y se extraen.
Menos archivos de los esperados. Lo que creías que era una imagen puede ser en realidad un dibujo vectorial. O, si la misma imagen se usa en varias páginas, se guarda una sola vez en el archivo y sale como un único archivo.
Archivos de aspecto extraño. Si una imagen se usa como máscara de transparencia, por sí sola se ve como una silueta en blanco y negro. No es un archivo corrupto, es la máscara en sí.
Paso 4: Comprobaciones de calidad y tamaño
En los archivos resultantes, fíjate en esto:
Resolución. Abre el archivo y mira sus dimensiones en píxeles. Una fotografía que en la página se ve pequeña puede ser enorme en su origen: eso es una buena noticia, has conseguido una imagen de calidad que puedes reutilizar.
También es posible lo contrario: si al generar el PDF la imagen se comprimió y se redujo a baja resolución, la extracción en bruto dará esa baja resolución. Los píxeles perdidos no vuelven.
Espacio de color. Los PDF pueden llevar imágenes CMYK. Si el archivo resultante es CMYK, algunos programas pueden mostrar los colores de otra manera; si lo vas a usar en la web, tendrás que pasarlo a RGB.
Transparencia. Una imagen que en el PDF se veía transparente puede salir opaca en la extracción, porque la información de transparencia está en un objeto de máscara aparte. Para recuperarla tendrás que combinar la imagen y su máscara en un editor.
Orientación. La imagen puede estar colocada girada en la página. La extracción en bruto te da la orientación original, no la de la página.
Paso 5: Corrige lo que haga falta
Puede que los archivos resultantes no estén listos para usarse directamente. Correcciones habituales:
Unir las piezas. Una imagen partida en franjas hay que juntarla y unirla en un editor (GIMP, Photoshop o incluso una herramienta en línea). Puedes deducir el orden de las piezas por los números de los nombres de archivo, pero no es garantía; emparejarlas visualmente es más fiable.
Aplicar la máscara. Si quieres transparencia, tendrás que abrir la imagen principal y el archivo de máscara en el editor y aplicar la máscara como canal alfa.
Recortar. Si en el PDF solo se veía una parte de la imagen (porque tenía aplicado un trazado de recorte), la extracción en bruto te da la imagen entera. Tendrás que recortar la parte que quieres.
Conversión de color. Pasar de CMYK a RGB es necesario para el uso web.
Cuándo usar la conversión de página en lugar de la extracción en bruto
Situaciones en las que la extracción en bruto no sirve:
Gráficos vectoriales. Los logotipos, esquemas y gráficos suelen ser vectoriales. Hace falta una conversión a SVG.
Cuando quieres el texto y la imagen juntos. Si quieres una infografía completa —la imagen y las etiquetas que lleva encima—, la extracción en bruto te da solo la parte de imagen. Convertir la página a PNG es el enfoque correcto.
Composiciones complejas. Si en una página se superponen varias imágenes, transparencias y efectos, tomar las piezas por separado no te dará el resultado que ves. Hay que renderizar la página.
Si solo quieres el aspecto visible. Si quieres exactamente la composición que ves en la página, la extracción en bruto es la herramienta equivocada.
Caso especial de los documentos escaneados
En un PDF escaneado, cada página consiste en una única imagen grande. La extracción en bruto funciona aquí de forma muy eficiente: obtienes un archivo de imagen por página y son los datos originales del escaneo.
Es útil cuando quieres reorganizar un documento escaneado como archivo de imágenes o pasar las páginas por una cadena de procesamiento de imagen.
Atención: si el escaneo se guardó como JPEG, el archivo resultante será un JPEG y arrastrará la pérdida por compresión del momento del escaneo. La extracción en bruto no lo corrige, lo entrega tal cual.
Aviso sobre derechos de autor
Que puedas extraer técnicamente una imagen no significa que tengas derecho a usarla.
Sacar tus propias imágenes de tus propios documentos no es problema. Pero las fotografías e ilustraciones que tomes del catálogo, el libro, el informe o la presentación de otra persona pueden estar protegidas por derechos de autor. Las fotos de banco de imágenes suelen haberse comprado con licencias de uso concretas, y esa licencia no te cubre a ti.
Si las vas a usar en un trabajo comercial, comprueba la fuente y la situación de la licencia.
En resumen
La extracción de imágenes en bruto toma las imágenes ráster incrustadas en un PDF a resolución original y sin recodificarlas. Esa es su diferencia fundamental con guardar la página como imagen: obtienes solo la fotografía, no una fotografía de la página. Los gráficos vectoriales no se pueden extraer con este método; para ellos hace falta una conversión a SVG. Entre los archivos resultantes puedes encontrar imágenes troceadas, archivos de máscara aparte y contenido que no se ve en la página; no son errores, sino consecuencias naturales de la estructura interna del PDF. Después de extraer, comprobar la resolución, el espacio de color y la transparencia y, si hace falta, unir las piezas, remata el trabajo.
Preguntas frecuentes
¿Cuál es la diferencia entre la extracción en bruto y guardar la página como imagen?
La extracción en bruto toma tal cual los objetos de imagen incrustados en el PDF, sin pérdida de calidad y a resolución original. Guardar la página como imagen renderiza la página entera (incluidos el texto, las líneas y el fondo) en una imagen nueva. Con la primera obtienes solo la fotografía; con la segunda, una fotografía de la página. Si quieres las fotos de producto de un catálogo, la extracción en bruto es la herramienta correcta.
¿Por qué la imagen extraída se ve distinta de como la veía en el PDF?
Puede haber varios motivos. La imagen puede estar escalada, girada o recortada en el PDF; la extracción en bruto te da su estado original, no el de la página. Además, puede tener aplicada una máscara de transparencia; como la máscara es un objeto aparte, en el archivo extraído la transparencia se pierde y el fondo aparece negro o blanco.
¿Por qué una fotografía ha salido partida en varios trozos?
Algunos generadores de PDF, sobre todo los programas de escáner y ciertos programas de ofimática, parten las imágenes grandes en franjas horizontales por eficiencia de memoria. En la página se ven unidas, pero en el archivo son objetos separados y la extracción en bruto entrega cada uno como archivo aparte. Para unirlas tendrás que juntarlas en un editor de imagen.
¿Es legal usar las imágenes que he extraído?
Que puedas extraerlas técnicamente no significa que tengas derecho a usarlas. Las fotografías, figuras e ilustraciones de un PDF pueden estar protegidas por derechos de autor. Sacar tus propias imágenes de tus propios documentos no es problema; antes de usar imágenes tomadas del catálogo, el libro o el informe de otra persona tienes que comprobar el permiso o la licencia.
Pruébalo ahora mismo con PDF'ten Görsel Çıkar (Ham).
Probar PDF'ten Görsel Çıkar (Ham)