Saltar al contenido principal
🇬🇧 English 🇧🇷 Português 🇩🇪 Deutsch
Convertidor de imágenes Convertidor de vídeo Convertidor de audio Convertidor de documentos
Herramientas Guías Formatos Precios API
Iniciar sesión
Guía

Convertir DOCX a Markdown con Pandoc: guía completa

PC Por Pablo Cirre

Preguntas frecuentes

Preserva la estructura semántica (headings, listas, tablas simples, footnotes, imágenes) pero NO el formato visual exacto (fuentes específicas, colores custom, alineaciones detalladas). Markdown es un formato semántico — define "esto es un H2" no "esto es 18pt Times New Roman bold negro". Si necesitas fidelidad visual exacta, mantén el Word como master y exporta a PDF directamente. Si lo que necesitas es contenido editable y versionable (git-friendly), Markdown vía Pandoc es ideal — pierdes el aspecto exacto pero ganas portabilidad infinita.

Añade el flag <code>--extract-media=./carpeta_imagenes</code>. Pandoc descomprime el DOCX, extrae todas las imágenes embebidas en formato original (PNG, JPG, EMF, SVG según cómo se insertaron en Word) a la carpeta especificada, y reescribe los links del Markdown para apuntar ahí. Las imágenes se nombran <code>image1.png</code>, <code>image2.jpg</code> en orden de aparición. Después puedes renombrarlas con scripts si necesitas nombres descriptivos. Sin este flag, Pandoc convierte las imágenes a base64 inline en el Markdown — funciona pero hace el archivo gigante e ilegible.

Tablas simples (filas y columnas regulares, sin celdas combinadas) se convierten perfectamente a tablas Markdown. Tablas con celdas combinadas (merged cells), tablas anidadas, o celdas con párrafos múltiples y listas dentro NO tienen equivalente en Markdown estándar — Pandoc las simplifica perdiendo información. Para esos casos, dos opciones: (1) convertir a HTML en lugar de Markdown (HTML preserva todo), (2) extraer la tabla a CSV ([DOCX a CSV](/es/convert/docx-a-csv)) y enlazar al CSV desde el Markdown, (3) reescribir manualmente la tabla compleja como una tabla Markdown simple aceptando la pérdida.

Sí, con la variante <code>markdown</code> (no <code>gfm</code>) y citeproc activo. Comando: <code>pandoc -f docx -t markdown documento.docx -o documento.md --citeproc --bibliography=refs.bib</code>. Las footnotes Word se convierten a sintaxis Pandoc <code>[^1]</code> con definiciones al final. Para referencias estilo APA/Chicago/IEEE necesitas un archivo .bib (BibTeX) con las entradas y un .csl (Citation Style Language) que defina el formato. Si tu Word tiene citas pero no hay .bib, Pandoc preserva el texto literal de la cita pero pierde la conexión con la fuente.

Sí — <strong>Pandoc Online</strong> (varios servicios), <strong>Markdown Editor de Typora</strong> (importa DOCX directamente), <strong>Visual Studio Code</strong> con la extensión "Markdown All in One" (importa DOCX vía Pandoc en background). Para conversiones puntuales, también puedes usar [DOCX a Markdown online](/es/convert/docx-a-md) directamente sin instalar nada. La ventaja de Pandoc CLI sigue siendo el batch processing y la posibilidad de scriptear pipelines completos — para uso interactivo ocasional, las GUI son más cómodas y producen el mismo resultado.

Por defecto Pandoc descarta estilos personalizados de Word (los que el usuario creó manualmente, ej. "MiEstiloEmpresa"). Para preservarlos como metadata: usa <code>-f docx+styles</code> que añade <code>{custom-style="MiEstiloEmpresa"}</code> después de cada bloque que tenga ese estilo. Esa info se puede usar después al renderizar de vuelta a HTML/PDF para aplicar CSS específico. Si solo quieres mapear estilos custom de Word a clases HTML conocidas, usa la opción <code>--reference-doc</code> con un Word template, o reescribe el .docx limpiando estilos custom antes de convertir (Word: Format → Styles → Clean up styles).

Usamos cookies y tecnologías similares para personalizar contenido y anuncios, y para analizar el tráfico. Más información sobre cookies.