← Últimos artículos
⚡ electrical engineering

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

Este trabajo propone una adaptación de modelos de lenguaje conscientes del habla para predecir marcas de tiempo a nivel de palabra de forma integrada, utilizando estrategias de entrenamiento ligeras que mejoran tanto la precisión de la sincronización como el rendimiento general del reconocimiento de voz.

Autores originales: Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

Publicado 2026-04-28
📖 3 min de lectura☕ Lectura para el café

Autores originales: Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El "Secretario Distraído"

Imagina que tienes un secretario que es increíblemente bueno escribiendo lo que dices (eso es el ASR o Reconocimiento Automático de Voz). Si le hablas, te entrega una hoja de papel con todo el texto perfecto.

Sin embargo, ese secretario tiene un problema: es un poco "despistado" con el tiempo. Si le pides que te diga exactamente en qué segundo dijo cada palabra (para poder poner subtítulos en un video o buscar una palabra en un podcast), el secretario se confunde. O bien, se concentra tanto en los segundos que empieza a cometer errores al escribir las palabras, o bien, escribe bien las palabras pero pierde la noción de cuándo ocurrieron.

Hasta ahora, para solucionar esto, la gente usaba dos herramientas separadas: una para escribir y otra (un "relojero" externo) para ajustar los tiempos. Pero esto es lento y complicado.

La Solución: "In-Sync" (Sincronizados)

Los investigadores de IBM y la Universidad de Illinois crearon un sistema llamado In-Sync. Su objetivo es que el secretario sea un "supersecretario": alguien que pueda escribir el texto y, al mismo tiempo, marcar el cronómetro para cada palabra, todo en un solo paso, sin perder la calidad.

Para lograr que este secretario no se vuelva loco intentando hacer las dos cosas a la vez, inventaron tres "trucos" o entrenamientos especiales:

1. El Entrenamiento de la "Maratón" (Aumento de longitud)

Imagina que estás aprendiendo a medir el tiempo. Si siempre practicas con carreras de 10 metros, cuando te toque medir una maratón, no sabrás qué hacer.
El modelo suele entrenarse con audios cortos, por lo que se vuelve experto en los primeros segundos pero se pierde cuando el audio es largo. Los investigadores empezaron a "pegar" audios cortos uno tras otro para crear "maratones" de audio. Así, el modelo aprende a manejar cronómetros que avanzan mucho más allá de los primeros segundos.

2. El "Orden de la Escalera" (Regularización de embeddings)

Imagina que tienes una escalera donde cada escalón es un segundo. El modelo debe entender que el escalón 1 va antes que el 2, y el 2 antes que el 3.
A veces, el cerebro de la Inteligencia Artificial se confunde y trata los segundos como números sueltos sin orden. Los investigadores le aplicaron una regla matemática (una especie de "pegamento lógico") que le obliga a entender que el tiempo es una línea continua y ordenada. Si el tiempo avanza, los conceptos en su "mente" también deben avanzar en una dirección lógica, como subir una escalera.

3. El "Entrenamiento con Obstáculos" (Reducción del Teacher Forcing)

Cuando un estudiante aprende, el profesor suele darle todas las respuestas correctas para que no se equivoque. Pero si el profesor siempre le da la respuesta perfecta, el estudiante se vuelve "dependiente": en cuanto el profesor se distrae, el estudiante se pierde por completo.
En el entrenamiento normal, la IA siempre recibe el tiempo exacto de la palabra anterior. Los investigadores decidieron "engañarla" un poco: de vez en cuando, le dan un tiempo ligeramente incorrecto para obligarla a que aprenda a "recalcular" su posición. Esto la hace mucho más robusta y evita que, si comete un pequeño error de un segundo, todo el resto del video se desincronice (el famoso "efecto dominó").

¿Por qué es importante esto?

Gracias a In-Sync, ya no necesitamos herramientas extra para poner subtítulos precisos, buscar momentos exactos en un video o sincronizar audio con imágenes. Hemos pasado de tener un secretario que solo escribe, a tener un experto que escribe y lleva el cronómetro con una precisión asombrosa, todo al mismo tiempo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →