Saltar al contenido principal
🇬🇧 English 🇧🇷 Português 🇩🇪 Deutsch
Convertidor de imágenes Convertidor de vídeo Convertidor de audio Convertidor de documentos
Herramientas Guías Formatos Precios API
Iniciar sesión
Guía

Formato HTML: Guía Completa del Lenguaje de Documentos Web

PC Por Pablo Cirre

Preguntas frecuentes

Tres enfoques principales: (1) Impresión desde el navegador — abre el archivo HTML en Chrome/Firefox, pulsa Ctrl+P, selecciona "Guardar como PDF". Mejor para páginas sencillas. (2) wkhtmltopdf — herramienta de línea de comandos que usa WebKit: `wkhtmltopdf entrada.html salida.pdf`. (3) Puppeteer — automatización de Chrome sin cabecera para PDF perfecto. (4) Pandoc — `pandoc entrada.html -o salida.pdf`. Para páginas web con CSS y JavaScript complejos, la impresión desde el navegador o Puppeteer ofrecen los mejores resultados.

Envía <strong>PDF</strong> cuando el documento es final y el layout debe preservarse tal cual (contratos, facturas, certificados). Envía <strong>DOCX</strong> cuando los revisores deben editar, comentar o usar control de cambios. Muchos equipos envían ambos: PDF como versión canónica + DOCX para feedback editable. PDF/A es el adecuado para archivado legal (ISO 19005).

.html y .htm son idénticos — ambos son archivos HTML de texto plano procesados de forma idéntica por navegadores y servidores. La extensión .htm es un legado de DOS/Windows 3.x que solo admitía nombres de archivo 8.3 (8 caracteres + extensión de 3 caracteres). Los sistemas modernos usan .html. No hay diferencia técnica; puedes renombrar .htm a .html y funciona de forma idéntica.

Round-trip entre formatos similares (DOCX ↔ ODT, DOCX → PDF) suele ser seguro. Round-trip con funciones específicas del formato (macros de Word, tablas complejas, notas al pie) suele perder fidelidad. Las fuentes incrustadas sobreviven solo si origen y destino lo soportan (PDF sí, DOCX sí, HTML plano no). Previsualiza siempre antes de borrar el original.

Múltiples enfoques: (1) Python con BeautifulSoup: `soup.get_text()` elimina todas las etiquetas y devuelve texto plano. (2) Línea de comandos: `lynx -dump entrada.html` emite texto renderizado por el navegador. (3) Pandoc: `pandoc entrada.html -t plain -o salida.txt`. Siempre elimina el contenido de `<script>`, `<style>` y `<head>` antes de extraer texto, ya que contienen código/metadatos en lugar de texto del documento.

Si el PDF contiene texto real (no imágenes escaneadas), <code>pdftotext</code> de poppler-utils o <a href="/es/convert/pdf-a-txt">PDF a TXT</a> funcionan en segundos. Si el PDF es escaneado, necesitas OCR — Tesseract es el estándar open-source. Las herramientas PDF de KaijuConverter detectan automáticamente texto vs. imagen y enrutan según el caso.

MHTML (MIME HTML) es un archivo de una sola página que agrupa una página HTML con todos sus recursos (imágenes, CSS, fuentes, JavaScript) codificados como contenido MIME multipart. Los archivos HTML normales referencian recursos externos con URLs; MHTML los incrusta como secciones codificadas en Base64 dentro del archivo único. Chrome, Edge e IE han ofrecido "Guardar página web, archivo único" que crea MHTML. Desventaja: los archivos MHTML no son legibles por humanos y pueden ser mucho más grandes que la página original.

Edición ligera (anotaciones, firmas, campos de formulario) es viable en cualquier lector PDF. Edición estructural (cambiar párrafos, reemplazar imágenes) es incómoda — PDF es un formato de presentación, no de edición. El flujo robusto es: mantén el origen DOCX/MD/HTML como máster y regenera el PDF cuando haya cambios. Las herramientas que "editan PDF" hacen ingeniería inversa del layout y suelen romperlo.

Usamos cookies y tecnologías similares para personalizar contenido y anuncios, y para analizar el tráfico. Más información sobre cookies.