← Últimos artículos
💻 computer science

EXAM2^2: Extending\underline{Ex}tending Audio\underline{A}udio $Understanding$ $in$ Multilingual\underline{M}ultilingual $and$ Multimodal\underline{M}ultimodal $Analysis$

Este artículo presenta EXAM2^2, un benchmark multilingüe y multimodal exhaustivo diseñado para evaluar y avanzar en la comprensión de audio a través de seis idiomas y diversos escenarios audiovisuales, demostrando brechas de rendimiento significativas en los modelos actuales y la efectividad de un nuevo modelo ajustado propuesto para abordar estos desafíos.

Autores originales: Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

Publicado 2026-08-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El mundo del sonido es vasto y variado, lleno de la voz humana, el estruendo de una ola y la melodía de una canción. Durante décadas, las computadoras han luchado por dar sentido a estas señales auditivas, tratándolas a menudo como mero ruido en lugar de información significativa. En años recientes, ha surgido una nueva generación de inteligencia artificial, capaz de escuchar audio y responder preguntas sobre lo que oye. Estos sistemas, conocidos como grandes modelos de lenguaje de audio, han mostrado una promesa notable en la comprensión del habla y la identificación de sonidos. Sin embargo, persiste una brecha significativa en cómo los evaluamos. La mayoría de las pruebas existentes se centran únicamente en el inglés y dependen exclusivamente del audio, ignorando el hecho de que, en el mundo real, el sonido rara vez ocurre en el vacío. Casi siempre viene acompañado de una escena visual, y el significado de un sonido puede cambiar dependiendo del idioma hablado y el contexto visto.

Para cerrar esta brecha, los investigadores han introducido una nueva herramienta de evaluación llamada EXAM2. Este referente (benchmark) está diseñado para probar qué tan bien puede la inteligencia artificial comprender el audio cuando este se combina con imágenes visuales y se habla en múltiples idiomas. El equipo detrás del proyecto, compuesto por expertos de instituciones de Alemania, China, Japón y Singapur, reconoció que las pruebas actuales eran demasiado estrechas. Construyeron un conjunto de datos exhaustivo que contiene miles de preguntas que requieren que una computadora escuche un clip de audio, observe una imagen y luego elija la respuesta correcta de una lista de opciones. Las preguntas cubren tres tipos principales de sonido: el habla humana, ruidos ambientales y música. Crucialmente, estas preguntas no son solo en inglés, sino que han sido traducidas a otros cinco idiomas: alemán, español, japonés, malayo y chino. Esto permite a los investigadores ver si la comprensión de un modelo se mantiene cuando el idioma cambia o cuando debe conectar lo que oye con lo que ve.

Los investigadores construyeron este referente seleccionando cuidadosamente grabaciones de audio de diversas fuentes, asegurando que representaran escenarios del mundo real en lugar de datos sintéticos. Para cada pregunta de opción múltiple, generaron una imagen correspondiente para servir como pista visual. Este proceso involucró un riguroso flujo de control de calidad, donde expertos humanos revisaron el audio, el texto y las imágenes generadas para asegurar que fueran precisos y relevantes. El conjunto de datos final incluye casi 5,700 preguntas, más de 22,000 imágenes y más de 135,000 instancias traducidas a través de los seis idiomas. Esta masiva colección sirve como un riguroso campo de entrenamiento y de prueba para la inteligencia artificial, impulsando a estos sistemas a razonar a través de diferentes tipos de información simultáneamente.

Cuando los investigadores probaron modelos de inteligencia artificial de vanguardia en este nuevo referente, los resultados revelaron tanto fortalezas como debilidades significativas. Los modelos más capaces, particularmente aquellos que podían procesar tanto audio como imágenes juntos, tuvieron un mejor desempeño que aquellos que dependían solo del sonido. Esto sugiere que el contexto visual ayuda a la computadora a desambiguar los sonidos, facilitando la comprensión de lo que sucede en una escena. Sin embargo, el estudio también encontró una clara disparidad en el desempeño basada en el idioma. Los modelos generalmente funcionaron mucho mejor en lenguas occidentales como el inglés, el alemán y el español, en comparación con lenguas orientales como el japonés y el chino. Esta brecha fue especialmente notable cuando la tarea consistía en identificar sonidos ambientales o música, lo que indica que los sistemas actuales todavía están fuertemente sesgados hacia los idiomas de altos recursos y tienen dificultades con los matices de otros contextos lingüísticos y culturales.

Para abordar estos desafíos, el equipo desarrolló su propio modelo ligero, el cual ajustaron finamente utilizando sus nuevos datos multilingües y multimodales. Este modelo, entrenado para manejar los seis idiomas y tanto la entrada de audio como la visual, mostró mejoras sustanciales sobre las bases de comparación existentes. Logró un aumento significativo en la precisión, particularmente en las categorías de habla y música, y demostró que el entrenamiento en múltiples idiomas simultáneamente ayuda al modelo a generalizar mejor a través de diferentes entornos lingüísticos. Los hallazgos sugieren que, si bien la inteligencia artificial se está volviendo mejor en la escucha, la verdadera comprensión requiere la capacidad de ver y hablar los idiomas del mundo. Los investigadores concluyen que, para que estos sistemas sean verdaderamente robustos, el desarrollo futuro debe priorizar la diversidad de idiomas y la integración de la información visual y auditiva, yendo más allá de las limitaciones de las pruebas de solo audio y solo inglés.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →