Problemas de transcripción de audio

Cuando las transcripciones son inexactas, faltan, o el trabajo falla — así es cómo solucionarlo.

21 may 2026

Vulgate transcribe las subidas de audio usando modelos de voz a texto de alta calidad. La gran mayoría de los archivos regresan con transcripciones utilizables, pero surgen algunos problemas comunes — este artículo los cubre.

El trabajo termina en error

Abre Subidas → Procesando en la barra lateral y haz clic en la fila fallida para ver la razón específica. Las más comunes son:

  • Formato no compatible — Convierte con ffmpeg a MP3 o WAV y vuelve a subir. Aceptamos MP3, M4A, AAC, WAV, FLAC, OGG, Opus y contenedores de video comunes (se transcribe la pista de audio).
  • Archivo silencioso — Un archivo con menos de unos segundos de contenido audible no se puede transcribir. Confirma que el archivo se reproduce de forma audible en tu reproductor local.
  • Archivo muy largo — Los archivos largos pueden agotar el tiempo. Divide con ffmpeg:
    ffmpeg -i input.mp3 -f segment -segment_time 3600 -c copy chunk_%03d.mp3
    
    Luego sube cada fragmento individualmente.
  • Límite de gasto excedido — Se agotaron los créditos de ingesta de tu plan para el mes. Actualiza o espera hasta el próximo ciclo.

Para otros mensajes de error, copia el texto exacto y envía un correo a info@vulgate.ai con el ID del trabajo.

La transcripción es inexacta

La calidad de la transcripción es principalmente una función de la calidad de la entrada:

  • Ruido de fondo. Cafés, multitudes, zumbido de aire acondicionado o viento degradan seriamente la precisión. Vuelve a grabar en un entorno más silencioso si es posible.
  • Múltiples hablantes superpuestos. Vulgate detecta turnos de hablante pero el habla superpuesta a menudo se mezcla. Grabar por separado a cada hablante en su propia pista y subir por separado produce resultados dramáticamente mejores.
  • Baja tasa de muestreo. Los archivos muestreados a 8 kHz (audio de teléfono antiguo, algunos VoIP) tienen más errores que los de 16 kHz o superiores.
  • Acentos o dialectos fuertes. La mayoría de los dialectos principales están bien soportados, pero acentos regionales muy fuertes pueden producir transcripciones literal-pero-incorrectas ("concilio" → "consol").
  • Vocabulario especializado. Los términos teológicos, legales o científicos pueden transcribirse fonéticamente.

Audio multilingüe

Si una grabación cambia entre idiomas (por ejemplo, un sermón en italiano con pasajes litúrgicos en latín), la transcripción seguirá el idioma dominante y fallará con el secundario. Mejor práctica: divide el archivo en los límites de idioma antes de subir, aunque sean solo dos archivos.

Cuándo contactarnos

Envía un correo a info@vulgate.ai con el ID del trabajo si:

  • Recibes un mensaje de error no cubierto arriba.
  • La calidad de transcripción es dramáticamente peor de lo esperado en un archivo que has verificado que está limpio.
  • El mismo archivo falla repetidamente a pesar de estar bien dentro de los límites de tamaño y formato.

Relacionado

Buscar ayuda