← Últimos artículos
⚡ electrical engineering

MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond

El artículo presenta MEUSLI, la primera familia de proyectores multilingües de ciencia abierta que conecta un codificador de voz Whisper con LLMs de código abierto para permitir el reconocimiento automático de voz y otras tareas de comprensión de voz escalables de extremo a extremo en 28 lenguas europeas.

Autores originales: Lorenzo Concina, Seraphina Fong, Marco Matassoni, Alessio Brutti

Publicado 2026-07-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Lorenzo Concina, Seraphina Fong, Marco Matassoni, Alessio Brutti

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un cerebro de robot superinteligente que puede leer y escribir cualquier texto del mundo, pero es completamente sordo. No puede oír ni una sola palabra hablada. Por otro lado, tienes un superoído que puede escuchar sonidos perfectamente, pero no entiende lo que significan. Durante mucho tiempo, para hacer que se comunicaran entre sí, los ingenieros tuvieron que construir un intermediario tosco: el sonido pasaba a un traductor, luego a un convertidor de texto y finalmente al cerebro. Esto era lento, y si el traductor cometía un error, el cerebro se confundía.

Recientemente, los científicos descubrieron cómo construir un puente directo entre el "superoído" y el "supercerebro". Este puente se llama proyector. Piensa en ello como un adaptador universal. Toma las señales eléctricas puras del sonido e instantáneamente las traduce al lenguaje que el cerebro entiende, permitiendo que ambos charlen directamente. Este es el mundo de los Modelos de Lenguaje de Voz (SLM, por sus siglas en inglés). La gran pregunta que se hacen los investigadores es: ¿Podemos construir uno de estos adaptadores que funcione para todos, no solo para los angloparlantes? Si podemos lograrlo, finalmente podríamos dar voz a miles de lenguas que han quedado fuera de la conversación digital, especialmente aquellas con muy pocos hablantes o con insuficientes datos grabados.

Aquí entra MEUSLI, un nuevo proyecto que actúa como una llave maestra para 28 lenguas europeas. Los investigadores construyeron una familia de estos "adaptadores" que conectan un oído sonoro muy potente (llamado Whisper) con cerebros robóticos multilingües de código abierto. Su principal hallazgo es que este sistema funciona increíblemente bien, no solo para lenguas comunes como el español o el alemán, sino también para otras más raras como el bretón o el maltés. Descubrieron que, si empiezas con su adaptador multilingüe prefabricado, puedes enseñarle un nuevo idioma con una cantidad mínima de datos, a veces tan solo 46 minutos de audio.

Sin embargo, hay un inconveniente. Si intentas enseñarle este adaptador un nuevo idioma sin ningún cuidado, tiende a "olvidar" todo lo que sabía sobre las 28 lenguas originales, como un estudiante que estudia para un examen nuevo e instantáneamente olvida su tarea anterior. El artículo sugiere que, para solucionar esto, necesitas usar una técnica llamada "reproducción de datos" (data replay), donde practicas ocasionalmente los idiomas antiguos mientras aprendes el nuevo, manteniendo viva la memoria.

Más allá de simplemente transcribir lo que la gente dice (transcripción), el equipo demostró que este adaptador puede ajustarse para realizar otros trabajos, como traducir palabras habladas al inglés o adivinar el tema de una conversación (como deportes o política). Descubrieron que, con solo unas pocas horas de entrenamiento específico para cada nueva tarea, el sistema podía aprender a hacer estas cosas también.

El artículo descarta explícitamente la idea de que necesites cantidades masivas de datos o información propietaria (secreta) para construir estos sistemas. Argumentan en contra de la noción de que los idiomas de bajos recursos son imposibles de apoyar, mostrando en cambio que un buen punto de partida (su proyector multilingüe) hace posible "arrancar" nuevos idiomas a partir de muy pocos datos. Aunque no pretenden haber resuelto todos los problemas del mundo, aportan pruebas sólidas de que este enfoque es escalable, abierto y eficaz. Midieron estos resultados utilizando pruebas estándar con datos del mundo real, demostrando que su método supera consistentemente al empezar desde cero, especialmente para las lenguas más difíciles y raras.

En resumen, MEUSLI es un kit de herramientas que demuestra que podemos construir tecnología de voz inclusiva y de código abierto que no solo funcione para unos pocos, sino para la mayoría, convirtiendo un cerebro de robot sordo en un oyente políglota con la ayuda de un adaptador inteligente y ligero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →