¿Por qué son tan grandes los archivos PDF?
- Imágenes de alta resolución incrustadas sin comprimir.
- Fuentes incrustadas completas en lugar de subconjuntos.
- Metadatos excesivos o capas de edición incrustadas.
- Exportación desde herramientas que priorizan calidad sobre tamaño.
Ghostscript — La herramienta más potente (gratuita)
# Compresión para pantalla (máxima reducción)
gs -dNOPAUSE -dBATCH -sDEVICE=pdfwrite \
-dCompatibilityLevel=1.4 \
-dPDFSETTINGS=/screen \
-sOutputFile=comprimido.pdf original.pdf
# Compresión equilibrada para la mayoría de usos
gs -dNOPAUSE -dBATCH -sDEVICE=pdfwrite \
-dCompatibilityLevel=1.4 \
-dPDFSETTINGS=/ebook \
-sOutputFile=comprimido.pdf original.pdf
Niveles de PDFSETTINGS:
| Nivel | DPI | Uso |
|---|---|---|
/screen |
72 dpi | Pantalla, tamaño mínimo |
/ebook |
150 dpi | Equilibrio óptimo |
/printer |
300 dpi | Impresión de calidad |
/prepress |
300 dpi | Pre-impresión profesional |
qpdf — Optimización sin pérdida
# Linearizar y comprimir streams (sin tocar imágenes)
qpdf --linearize --compress-streams=y --recompress-flate original.pdf comprimido.pdf
Muy útil para PDFs creados con herramientas que no optimizan bien los flujos de datos.
Herramientas online
| Herramienta | Límite gratis | Notas |
|---|---|---|
| Smallpdf | 2/hora | Popular, interfaz limpia |
| ILovePDF | Uso limitado | Múltiples herramientas |
| PDF2Go | 50 MB | Sin registro |
⚠️ Para documentos confidenciales, usa siempre herramientas locales.
¿Cuánto se puede reducir?
| Tipo de PDF | Reducción típica con /ebook |
|---|---|
| Texto puro | 10-30% |
| Imágenes web (JPG) | 5-15% |
| Escaneado sin OCR | 60-80% |
| Exportado desde InDesign (alta res) | 70-90% |
Conclusión
Para máxima compresión con control de calidad: Ghostscript con /ebook. Para optimización sin pérdida: qpdf. Para uso puntual sin confidencialidad: herramientas online. Combinar ambas herramientas puede reducir el tamaño un 80% o más en PDFs escaneados.
Casos de uso avanzados
Workflow legal y empresarial: contratos firmados se distribuyen en PDF/A (PDF Archival) que garantiza que el documento se renderice idénticamente en 50 años — todas las fonts embedded, no JavaScript, no contenido dinámico. La firma electrónica (PAdES, advanced eSignatures) está integrada en el PDF y se valida criptográficamente. Publicación académica: tesis y papers usan LaTeX → PDF para fórmulas matemáticas precisas; los journals requieren formato específico (Word con styles, LaTeX con clase del journal, o ambos). Convertir entre LaTeX, DOCX y PDF preservando estructura semántica (citations, references, equations) requiere herramientas especializadas como Pandoc. E-books: Amazon KDP requiere formato MOBI (legacy) o KFX (moderno) generado desde EPUB; Apple Books acepta EPUB nativamente; Kobo, PocketBook y Nook prefieren EPUB; Google Play Books acepta PDF y EPUB. Convertir manuscrito DOCX a EPUB requiere atención al markup semántico (headings jerárquicos, listas, blockquotes) para que el reflowable layout funcione bien. Translation workflows: traductores profesionales prefieren XLIFF como intermediate format — mantiene segmentación, translation memory matches, y context info que se pierde en plain text export.
Mejores prácticas y consejos profesionales
Style preservation: al convertir entre formatos editables (DOCX↔ODT↔RTF), usa siempre styles definidos en lugar de formatting directo — Heading 1/2/3 vs "16pt Bold". Esto garantiza que el outline se preserve y la conversión mantenga estructura jerárquica. Font embedding: para distribución cross-platform (PDF), embebe todas las fonts no-estándar — sin embedding, los lectores sustituyen automáticamente con fonts disponibles que pueden romper el layout. PDF/A para archivado: para documentos legales, regulatorios o de archivo permanente, exporta como PDF/A-1b (basic) o PDF/A-2u (Unicode + JPEG2000) — no permite contenido dinámico, garantiza self-contained rendering. Revision history: PDF, DOCX y ODT soportan tracked changes y comments — al convertir, decide si quieres preservarlos (DOCX→DOCX o DOCX→ODT) o aplanarlos (DOCX→PDF típicamente acepta solo el final state). Accesibilidad: documentos PDF para distribución pública deben cumplir PDF/UA — heading structure, alt text en imágenes, reading order definido para screen readers.
Compatibilidad y consideraciones técnicas
KaijuConverter usa LibreOffice 7.6 headless como engine principal con Pandoc 3.x como fallback para markup conversions complejas. Soportamos más de 60 formatos de documento (PDF, DOCX, DOC, ODT, RTF, TXT, HTML, MD, EPUB, MOBI, AZW3, FB2, LaTeX, RST y más). Fidelity de formato: preservamos fonts (con substitution fallback si la fuente original no está en el sistema), tamaños, colores, párrafos completos con indentación y line spacing, listas anidadas, tablas con cell merging y borders complejos, imágenes embedded con anchor positioning, headers/footers con campos dinámicos (page number, date, document title), footnotes y endnotes. Conversión a PDF: garantizamos PDF/A-conforme cuando se requiere, con font embedding correcto y ICC profile embedding para color fidelity absoluta. Limitaciones: documentos con macros (DOCX con VBA) no ejecutan los macros durante conversión — solo se preserva el contenido estático. PDFs escaneados (imagen sin OCR) no son editables — necesitan OCR previo (Tesseract, ABBYY) para extraer texto. Privacidad: TLS 1.3, contenedores Docker aislados, eliminación tras 2 horas. Performance: documento típico de 20 páginas tarda 3-8 segundos; documentos grandes con muchas imágenes pueden requerir 15-30 segundos.
Conversiones relacionadas
Conversiones de documento que siguen este tema: