Problemas de transcripción de audio
Cuando las transcripciones son inexactas, faltan, o el trabajo falla — así es cómo solucionarlo.
21 may 2026
Vulgate transcribe las subidas de audio usando modelos de voz a texto de alta calidad. La gran mayoría de los archivos regresan con transcripciones utilizables, pero surgen algunos problemas comunes — este artículo los cubre.
El trabajo termina en error
Abre Subidas → Procesando en la barra lateral y haz clic en la fila fallida para ver la razón específica. Las más comunes son:
- Formato no compatible — Convierte con
ffmpega MP3 o WAV y vuelve a subir. Aceptamos MP3, M4A, AAC, WAV, FLAC, OGG, Opus y contenedores de video comunes (se transcribe la pista de audio). - Archivo silencioso — Un archivo con menos de unos segundos de contenido audible no se puede transcribir. Confirma que el archivo se reproduce de forma audible en tu reproductor local.
- Archivo muy largo — Los archivos largos pueden agotar el tiempo. Divide con
ffmpeg:
Luego sube cada fragmento individualmente.ffmpeg -i input.mp3 -f segment -segment_time 3600 -c copy chunk_%03d.mp3 - Límite de gasto excedido — Se agotaron los créditos de ingesta de tu plan para el mes. Actualiza o espera hasta el próximo ciclo.
Para otros mensajes de error, copia el texto exacto y envía un correo a info@vulgate.ai con el ID del trabajo.
La transcripción es inexacta
La calidad de la transcripción es principalmente una función de la calidad de la entrada:
- Ruido de fondo. Cafés, multitudes, zumbido de aire acondicionado o viento degradan seriamente la precisión. Vuelve a grabar en un entorno más silencioso si es posible.
- Múltiples hablantes superpuestos. Vulgate detecta turnos de hablante pero el habla superpuesta a menudo se mezcla. Grabar por separado a cada hablante en su propia pista y subir por separado produce resultados dramáticamente mejores.
- Baja tasa de muestreo. Los archivos muestreados a 8 kHz (audio de teléfono antiguo, algunos VoIP) tienen más errores que los de 16 kHz o superiores.
- Acentos o dialectos fuertes. La mayoría de los dialectos principales están bien soportados, pero acentos regionales muy fuertes pueden producir transcripciones literal-pero-incorrectas ("concilio" → "consol").
- Vocabulario especializado. Los términos teológicos, legales o científicos pueden transcribirse fonéticamente.
Audio multilingüe
Si una grabación cambia entre idiomas (por ejemplo, un sermón en italiano con pasajes litúrgicos en latín), la transcripción seguirá el idioma dominante y fallará con el secundario. Mejor práctica: divide el archivo en los límites de idioma antes de subir, aunque sean solo dos archivos.
Cuándo contactarnos
Envía un correo a info@vulgate.ai con el ID del trabajo si:
- Recibes un mensaje de error no cubierto arriba.
- La calidad de transcripción es dramáticamente peor de lo esperado en un archivo que has verificado que está limpio.
- El mismo archivo falla repetidamente a pesar de estar bien dentro de los límites de tamaño y formato.
Relacionado
Buscar ayuda