Por qué Vulgate usa TEI XML
Cómo la codificación XML estructurada hace que tus documentos sean buscables, citables y listos para trabajo académico.
21 may 2026
Cada documento que llega a Vulgate se codifica como TEI XML — el formato XML de la Text Encoding Initiative, el estándar de facto para ediciones digitales académicas. No tienes que escribir ni siquiera ver el XML tú mismo, pero sustenta casi todo lo que Vulgate hace bien.
Qué es TEI XML
TEI XML es un vocabulario de etiquetas XML para describir la estructura y semántica de un texto — portada, cuerpo, capítulos, secciones, notas marginales, notas al pie, etiquetas de hablante, saltos de línea, saltos de página y muchos más. Fue diseñado por académicos de humanidades a finales de los años 1980 y es mantenido hoy por un consorcio internacional.
A diferencia del texto plano, TEI XML preserva:
- La jerarquía de un documento (libro → capítulo → sección → párrafo).
- Metadatos como autor, editor, fecha de publicación, edición.
- Aparato como notas al pie, marginalia y correcciones editoriales.
- Números de página y línea anclados a posiciones específicas en el texto.
- Turnos de hablante en diálogos, sermones y obras de teatro.
Lo que obtienes gracias a esto
Esta conciencia estructural es la razón por la que Vulgate puede hacer cosas que las herramientas de texto plano no pueden:
- Citas precisas. Las citas apuntan a secciones codificadas en el TEI — normalmente mostradas como título del documento y encabezado de sección más cercano — no rangos de caracteres aproximados.
- Chat consciente de secciones. Chat y el Asistente de IA en documentos recuperan a nivel de sección, lo que da respuestas más enfocadas y precisas que dividir por conteo de caracteres.
- Traducción por párrafo. Las traducciones automáticas funcionan en párrafos completos porque el límite del párrafo está codificado en el XML.
- Marcadores estables. Los Marcadores apuntan a anclas estructurales, no desplazamientos de bytes, así que sobreviven al reprocesamiento o ediciones del documento.
Cómo se produce la codificación
La codificación ocurre durante el procesamiento, completamente automática:
- Se extrae el texto sin procesar (OCR para escaneos, extracción nativa para PDFs buscables y documentos Word).
- Una cadena de modelos de lenguaje segmenta el texto en unidades estructurales.
- Se detectan y etiquetan encabezados, notas al pie, números de página, marginalia y turnos de hablante.
- El resultado se serializa a TEI XML y se almacena junto al archivo original.
Los administradores de Organización pueden inspeccionar el XML subyacente durante la revisión del documento en Subidas → Procesando.
Editar la codificación
Si la codificación automática se equivoca en algo (una nota al pie faltante, un salto de capítulo en el lugar equivocado), un administrador de Organización puede abrir el documento en el editor estructural durante la revisión y ajustar los límites. La IA comienza a usar la estructura corregida una vez que el documento se vuelve a publicar.
Lectura adicional
- Las Directrices TEI oficiales.
- La visión general de la API de ingesta de Vulgate para cómo subir y procesar mediante código.
Buscar ayuda