Saltar al contenido principal
🇬🇧 English 🇧🇷 Português 🇩🇪 Deutsch
Convertidor de imágenes Convertidor de vídeo Convertidor de audio Convertidor de documentos
Herramientas Guías Formatos Precios API
Iniciar sesión
Guía

JSON: Guía Técnica Completa

PC Por Pablo Cirre

Preguntas frecuentes

NDJSON (JSON Delimitado por Nueva Línea), también llamado JSON Lines (.jsonl), almacena un valor JSON completo por línea de texto. Esto permite procesar conjuntos de datos arbitrariamente grandes con uso de memoria constante — lees y parseas una línea a la vez en lugar de cargar todo el archivo. Usa NDJSON para archivos de log, flujos de eventos, exportaciones de pipelines de datos, conjuntos de entrenamiento de machine learning y cualquier conjunto de datos cuyo tamaño total supere la RAM disponible. También permite procesamiento paralelo: diferentes workers pueden leer diferentes rangos de bytes del archivo de forma independiente.

Envía <strong>PDF</strong> cuando el documento es final y el layout debe preservarse tal cual (contratos, facturas, certificados). Envía <strong>DOCX</strong> cuando los revisores deben editar, comentar o usar control de cambios. Muchos equipos envían ambos: PDF como versión canónica + DOCX para feedback editable. PDF/A es el adecuado para archivado legal (ISO 19005).

Para arrays en un único archivo JSON, usa un parser incremental/streaming como ijson (Python) que emite eventos (start_array, end_map, etc.) sin construir el árbol de objetos completo. Para archivos de exportación, prefiere el formato NDJSON que permite iteración línea por línea. En Python: `import ijson; for obj in ijson.items(open('grande.json'), 'item'): procesar(obj)`. Para jq, los archivos grandes pueden procesarse con `jq --stream` que emite pares ruta/valor para cada nodo. Evita `json.load()` en archivos de más de unos cientos de MB.

Round-trip entre formatos similares (DOCX ↔ ODT, DOCX → PDF) suele ser seguro. Round-trip con funciones específicas del formato (macros de Word, tablas complejas, notas al pie) suele perder fidelidad. Las fuentes incrustadas sobreviven solo si origen y destino lo soportan (PDF sí, DOCX sí, HTML plano no). Previsualiza siempre antes de borrar el original.

JSON solo tiene tres representaciones para 'sin valor': `null` (ausencia explícita, la única opción correcta en JSON), string vacío `""` (un string válido de cero caracteres — tiene significado semántico) y la ausencia completa de una clave (una clave ausente es diferente de una clave con valor null). `undefined` de JavaScript no es JSON válido — `JSON.stringify({a: undefined})` produce `{}`, eliminando la clave. En APIs, distingue: `null` significa 'el campo existe pero no tiene valor', una clave ausente significa 'campo no aplicable', y `""` significa 'el campo es un string vacío'.

Si el PDF contiene texto real (no imágenes escaneadas), <code>pdftotext</code> de poppler-utils o <a href="/es/convert/pdf-a-txt">PDF a TXT</a> funcionan en segundos. Si el PDF es escaneado, necesitas OCR — Tesseract es el estándar open-source. Las herramientas PDF de KaijuConverter detectan automáticamente texto vs. imagen y enrutan según el caso.

No. RFC 8259 excluye explícitamente los comentarios de la gramática JSON. Douglas Crockford (el creador de JSON) los eliminó intencionalmente para evitar que los comentarios se usaran como directivas de parseo (como ocurrió con SGML). Soluciones comunes: (1) Usa una clave de comentario dedicada como `"_comentario": "esto lo ignoran los consumidores"`. (2) Usa los superconjuntos JSON5 o HJSON que añaden sintaxis de comentarios. (3) Usa YAML, que soporta comentarios `#`. (4) Usa TOML para archivos de configuración. Para respuestas de API e intercambio de datos, la ausencia de comentarios no es un problema; para archivos de configuración editados manualmente, suele ser inconveniente.

Edición ligera (anotaciones, firmas, campos de formulario) es viable en cualquier lector PDF. Edición estructural (cambiar párrafos, reemplazar imágenes) es incómoda — PDF es un formato de presentación, no de edición. El flujo robusto es: mantén el origen DOCX/MD/HTML como máster y regenera el PDF cuando haya cambios. Las herramientas que "editan PDF" hacen ingeniería inversa del layout y suelen romperlo.

Usamos cookies y tecnologías similares para personalizar contenido y anuncios, y para analizar el tráfico. Más información sobre cookies.