← Últimos artículos
⚡ electrical engineering

Streaming Speech-to-Text Translation with a SpeechLLM

Este artículo propone un sistema de traducción de voz a texto en tiempo real basado en un SpeechLLM que decide dinámicamente cuándo emitir tokens de salida en función de la entrada de audio, logrando una calidad de traducción cercana a la línea base con una latencia significativamente reducida de 1 a 2 segundos.

Autores originales: Titouan Parcollet, Shucong Zhang, Xianrui Zheng, Rogier C. van Dalen

Publicado 2026-05-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Titouan Parcollet, Shucong Zhang, Xianrui Zheng, Rogier C. van Dalen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando traducir una conversación en vivo del inglés al coreano en tiempo real. Quieres escuchar una oración, comprenderla y hablar inmediatamente la traducción sin esperar a que el hablante termine toda la historia.

Este artículo presenta un nuevo sistema "supertraductor" que hace exactamente eso, pero con un giro inteligente que resuelve el mayor problema de la tecnología actual: la sincronización.

El Problema: El Robot "Espera-K"

La mayoría de los sistemas actuales funcionan como un robot rígido con un temporizador. Utilizan una regla llamada "Espera-K".

  • La Regla: "Escucharé exactamente 5 segundos de audio, luego hablaré 5 segundos de traducción. Luego escucharé 5 segundos más, y luego hablaré 5 segundos más".
  • El Defecto: La vida real no es un robot.
    • Si el hablante hace una pausa para pensar durante 10 segundos, el robot sigue hablando después de 5 segundos, inventando tonterías (alucinando) porque cree que es hora de hablar.
    • Si el hablante habla muy rápido, el robot se queda atrás, perdiendo palabras por completo.
    • Si el hablante es lento, el robot desperdicia energía esperando un temporizador que no coincide con la conversación.

La Solución: El Traductor "Espera Inteligente"

Los autores construyeron un nuevo sistema llamado SpeechLLM (Modelo de Lenguaje Grande de Voz) que no utiliza un temporizador. En su lugar, utiliza una política de "Espera" aprendida.

Piensa en este nuevo sistema como un intérprete humano muy atento que toma notas mientras escucha.

  1. Escuchar y Decidir: A medida que entra el audio, el sistema no solo cuenta segundos. Se pregunta a sí mismo: "¿Tengo suficiente información ahora mismo para decir la siguiente palabra?"
  2. El Token "Espera": Si la respuesta es "No", el sistema genera un token especial e invisible llamado "Espera". Es como si el intérprete levantara la mano para decir: "Espera, necesito escuchar más".
  3. El Token "Habla": Si la respuesta es "Sí", genera inmediatamente la palabra traducida.

Esto ocurre en una mezcla: Espera, Espera, Habla, Espera, Habla, Habla, Espera... El sistema aprende exactamente cuándo cambiar entre "Espera" y "Habla" basándose en el habla real, no en un reloj.

El Truco de la "Salida Anticipada": Ahorrando Batería

Había un inconveniente. Como el sistema tiene que verificar "¿Debería esperar?" tan a menudo, estaba consumiendo mucha energía en los teléfonos (como revisar tu teléfono cada segundo incluso cuando no lo estás mirando).

Para solucionarlo, añadieron una función de "Salida Anticipada".

  • Imagina a un guardia de seguridad de pie fuera de una oficina lujosa (la IA principal).
  • El guardia es rápido y simple. Cuando entra nuevo audio, el guardia verifica: "¿Es esto suficiente para dejar entrar al jefe (la IA)?"
  • Si el guardia dice "No", el jefe nunca tiene que despertar. El sistema simplemente espera más audio.
  • Si el guardia dice "Sí", entonces el jefe despierta, realiza el pensamiento pesado y habla.
  • Resultado: El sistema ahorra cantidades masivas de energía porque el "jefe" no tiene que trabajar cada vez, solo cuando el guardia dice que es necesario.

Cómo lo Enseñaron (El Rompecabezas de las "Frases")

Para enseñarle a este sistema cuándo esperar, no podían simplemente emparejar palabra por palabra (por ejemplo, "The" = "The"). En idiomas como el inglés y el coreano, el orden de las palabras es totalmente diferente. Podrías escuchar "Naciones Unidas" al final de una oración en inglés, pero necesitas decirlo al principio en coreano.

Los autores crearon una nueva forma de enseñar a la IA utilizando frases en lugar de palabras individuales.

  • Utilizaron una herramienta inteligente para emparejar fragmentos de significado (frases) entre los dos idiomas.
  • Esto enseñó a la IA: "No puedo decir la palabra coreana para 'Naciones Unidas' hasta que haya escuchado la frase completa en inglés 'Naciones Unidas'."
  • Esto permitió a la IA aprender el ritmo perfecto de cuándo esperar y cuándo hablar.

Los Resultados: Rápido, Preciso y Robusto

El artículo probó este sistema contra los antiguos robots "Espera-K".

  • Velocidad: El nuevo sistema es increíblemente rápido, con un retraso (latencia) de solo 1 a 2 segundos.
  • Calidad: Traduce tan bien como los sistemas que esperan a que termine la oración completa antes de hablar.
  • Prueba del Mundo Real: Lo probaron con silencio y ruido añadido al audio (como una llamada telefónica con estática). Los antiguos robots "Espera-K" fallaron miserablemente, hablando tonterías. El nuevo sistema "Espera Inteligente" ignoró el silencio y esperó pacientemente, produciendo traducciones perfectas.

Resumen

El artículo presenta un traductor que actúa como un humano: escucha, decide cuándo tiene suficiente información y habla. No depende de un temporizador rígido. También tiene un "asistente inteligente" (la política de Salida Anticipada) que ahorra batería realizando el trabajo pesado solo cuando es absolutamente necesario. El resultado es un sistema que es rápido, preciso y no se confunde con pausas o ruido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →