¿Por qué convertir PDF a imágenes?
Para previsualizaciones, extracción de contenido, edición en Photoshop, compatibilidad o preparación para OCR.
Ghostscript — La herramienta más potente
# Todas las páginas a JPEG (150 DPI)
gs -dNOPAUSE -dBATCH -sDEVICE=jpeg -r150 -sOutputFile=pagina_%02d.jpg documento.pdf
# Solo la primera página
gs -dNOPAUSE -dBATCH -dFirstPage=1 -dLastPage=1 -sDEVICE=jpeg -r150 -sOutputFile=portada.jpg doc.pdf
Poppler (pdftoppm) — Rápido en Linux/macOS
sudo apt install poppler-utils # Ubuntu/Debian
brew install poppler # macOS
pdftoppm -r 150 -png documento.pdf pagina # → pagina-1.png, pagina-2.png...
pdftoppm -r 150 -jpeg -jpegopt quality=85 documento.pdf pagina
pdftoppm -r 150 -png -f 2 -l 5 documento.pdf pagina # Solo páginas 2-5
Python con pdf2image
from pdf2image import convert_from_path
pages = convert_from_path('documento.pdf', dpi=150)
for i, page in enumerate(pages, 1):
page.save(f'pagina_{i:02d}.jpg', 'JPEG', quality=85)
¿Qué DPI usar?
| Uso | DPI | Notas |
|---|---|---|
| Miniatura web | 72 | Pequeño y rápido |
| Pantalla HD | 150 | Equilibrio calidad/tamaño |
| Impresión / OCR | 300 | Texto nítido |
| Archivo de calidad | 600 | Para documentos críticos |
Conclusión
Ghostscript para conversión masiva en servidor. pdf2image para Python. Herramientas online para conversiones puntuales. El DPI es el parámetro más crítico.
Casos de uso avanzados
Workflow legal y empresarial: contratos firmados se distribuyen en PDF/A (PDF Archival) que garantiza que el documento se renderice idénticamente en 50 años — todas las fonts embedded, no JavaScript, no contenido dinámico. La firma electrónica (PAdES, advanced eSignatures) está integrada en el PDF y se valida criptográficamente. Publicación académica: tesis y papers usan LaTeX → PDF para fórmulas matemáticas precisas; los journals requieren formato específico (Word con styles, LaTeX con clase del journal, o ambos). Convertir entre LaTeX, DOCX y PDF preservando estructura semántica (citations, references, equations) requiere herramientas especializadas como Pandoc. E-books: Amazon KDP requiere formato MOBI (legacy) o KFX (moderno) generado desde EPUB; Apple Books acepta EPUB nativamente; Kobo, PocketBook y Nook prefieren EPUB; Google Play Books acepta PDF y EPUB. Convertir manuscrito DOCX a EPUB requiere atención al markup semántico (headings jerárquicos, listas, blockquotes) para que el reflowable layout funcione bien. Translation workflows: traductores profesionales prefieren XLIFF como intermediate format — mantiene segmentación, translation memory matches, y context info que se pierde en plain text export.
Mejores prácticas y consejos profesionales
Style preservation: al convertir entre formatos editables (DOCX↔ODT↔RTF), usa siempre styles definidos en lugar de formatting directo — Heading 1/2/3 vs "16pt Bold". Esto garantiza que el outline se preserve y la conversión mantenga estructura jerárquica. Font embedding: para distribución cross-platform (PDF), embebe todas las fonts no-estándar — sin embedding, los lectores sustituyen automáticamente con fonts disponibles que pueden romper el layout. PDF/A para archivado: para documentos legales, regulatorios o de archivo permanente, exporta como PDF/A-1b (basic) o PDF/A-2u (Unicode + JPEG2000) — no permite contenido dinámico, garantiza self-contained rendering. Revision history: PDF, DOCX y ODT soportan tracked changes y comments — al convertir, decide si quieres preservarlos (DOCX→DOCX o DOCX→ODT) o aplanarlos (DOCX→PDF típicamente acepta solo el final state). Accesibilidad: documentos PDF para distribución pública deben cumplir PDF/UA — heading structure, alt text en imágenes, reading order definido para screen readers.
Compatibilidad y consideraciones técnicas
KaijuConverter usa LibreOffice 7.6 headless como engine principal con Pandoc 3.x como fallback para markup conversions complejas. Soportamos más de 60 formatos de documento (PDF, DOCX, DOC, ODT, RTF, TXT, HTML, MD, EPUB, MOBI, AZW3, FB2, LaTeX, RST y más). Fidelity de formato: preservamos fonts (con substitution fallback si la fuente original no está en el sistema), tamaños, colores, párrafos completos con indentación y line spacing, listas anidadas, tablas con cell merging y borders complejos, imágenes embedded con anchor positioning, headers/footers con campos dinámicos (page number, date, document title), footnotes y endnotes. Conversión a PDF: garantizamos PDF/A-conforme cuando se requiere, con font embedding correcto y ICC profile embedding para color fidelity absoluta. Limitaciones: documentos con macros (DOCX con VBA) no ejecutan los macros durante conversión — solo se preserva el contenido estático. PDFs escaneados (imagen sin OCR) no son editables — necesitan OCR previo (Tesseract, ABBYY) para extraer texto. Privacidad: TLS 1.3, contenedores Docker aislados, eliminación tras 2 horas. Performance: documento típico de 20 páginas tarda 3-8 segundos; documentos grandes con muchas imágenes pueden requerir 15-30 segundos.
Conversiones relacionadas
Lo más habitual al trabajar con imágenes son estas direcciones de conversión: