← Derniers articles
💻 computer science

EXAM2^2: Extending\underline{Ex}tending Audio\underline{A}udio $Understanding$ $in$ Multilingual\underline{M}ultilingual $and$ Multimodal\underline{M}ultimodal $Analysis$

Cet article présente EXAM2^2, un benchmark multilingue et multimodal complet conçu pour évaluer et faire progresser la compréhension audio à travers six langues et divers scénarios audiovisuels, démontrant des écarts de performance significatifs dans les modèles actuels ainsi que l'efficacité d'un nouveau modèle affiné proposé pour relever ces défis.

Auteurs originaux : Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

Publié 2026-08-26
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le monde du son est vaste et varié, rempli de la voix humaine, du fracas d'une vague et de la mélodie d'une chanson. Pendant des décennies, les ordinateurs ont lutté pour donner un sens à ces signaux auditifs, les traitant souvent comme de simples bruits plutôt que comme des informations significatives. Ces dernières années, une nouvelle génération d'intelligence artificielle a émergé, capable d'écouter l'audio et de répondre à des questions sur ce qu'elle entend. Ces systèmes, connus sous le nom de grands modèles de langage audio, ont montré des promesses remarquables dans la compréhension de la parole et l'identification des sons. Cependant, un fossé important subsiste dans la manière dont nous les testons. La plupart des tests existants se concentrent uniquement sur l'anglais et reposent exclusivement sur l'audio, ignorant le fait que, dans le monde réel, le son ne se produit presque jamais dans le vide. Il est presque toujours accompagné d'une scène visuelle, et la signification d'un son peut changer selon la langue parlée et le contexte observé.

Pour combler ce fossé, des chercheurs ont introduit un nouvel outil d'évaluation appelé EXAM2. Ce banc d'essai est conçu pour tester la capacité de l'intelligence artificielle à comprendre l'audio lorsqu'il est combiné avec des images visuelles et parlé en plusieurs langues. L'équipe derrière le projet, composée d'experts d'institutions en Allemagne, en Chine, au Japon et à Singapour, a reconnu que les tests actuels étaient trop étroits. Ils ont construit un ensemble de données complet contenant des milliers de questions qui exigent qu'un ordinateur écoute un clip audio, regarde une image, puis choisisse la bonne réponse parmi une liste d'options. Les questions couvrent trois principaux types de sons : la parole humaine, les bruits environnementaux et la musique. Crucialement, ces questions ne sont pas seulement en anglais, mais ont été traduites en cinq autres langues : l'allemand, l'espagnol, le japonais, le malais et le chinois. Cela permet aux chercheurs de voir si la compréhension d'un modèle se maintient lorsque la langue change ou lorsqu'il doit relier ce qu'il entend à ce qu'il voit.

Les chercheurs ont construit ce banc d'essai en sélectionnant soigneusement des enregistrements audio provenant de diverses sources, garantissant qu'ils représentaient des scénarios du monde réel plutôt que des données synthétiques. Pour chaque question à choix multiples, ils ont généré une image correspondante pour servir d'indice visuel. Ce processus a impliqué un pipeline rigoureux de contrôle de qualité, où des experts humains ont examiné l'audio, le texte et les images générées pour s'assurer qu'ils étaient précis et pertinents. L'ensemble de données final comprend près de 5 700 questions, plus de 22 000 images et plus de 135 000 instances traduites à travers les six langues. Cette vaste collection sert de terrain d'entraînement et de test rigoureux pour l'intelligence artificielle, poussant ces systèmes à raisonner à travers différents types d'informations simultanément.

Lorsque les chercheurs ont testé des modèles d'intelligence artificielle de pointe sur ce nouveau banc d'essai, les résultats ont révélé des forces et des faiblesses significatives. Les modèles les plus capables, particulièrement ceux qui pouvaient traiter à la fois l'audio et les images ensemble, ont obtenu de meilleurs résultats que ceux qui reposaient uniquement sur le son. Cela suggère que le contexte visuel aide l'ordinateur à lever les ambiguïtés sonores, rendant plus facile la compréhension de ce qui se passe dans une scène. Cependant, l'étude a également trouvé une disparité claire de performance basée sur la langue. Les modèles ont généralement bien mieux performé sur les langues occidentales comme l'anglais, l'allemand et l'espagnol par rapport aux langues orientales comme le japonais et le chinois. Cet écart était particulièrement notable lorsque la tâche consistait à identifier des sons environnementaux ou de la musique, indiquant que les systèmes actuels sont encore fortement biaisés en faveur des langues à hautes ressources et peinent avec les nuances d'autres contextes linguistiques et culturels.

Pour relever ces défis, l'équipe a développé son propre modèle léger, qu'elle a affiné en utilisant ses nouvelles données multilingues et multimodales. Ce modèle, entraîné pour gérer les six langues ainsi que les entrées audio et visuelles, a montré des améliorations substantielles par rapport aux bases de référence existantes. Il a atteint un gain significatif de précision, particulièrement dans les catégories de la parole et de la musique, et a démontré que l'entraînement sur plusieurs langues simultanément aide le modèle à mieux généraliser à travers différents contextes linguistiques. Les conclusions suggèrent que, bien que l'intelligence artificielle devienne meilleure pour écouter, une véritable compréhension nécessite la capacité de voir et de parler les langues du monde. Les chercheurs concluent que pour que ces systèmes deviennent véritablement robustes, le développement futur doit donner la priorité à la diversité des langues et à l'intégration de l'information visuelle et auditive, allant au-delà des limites des tests exclusivement en anglais et exclusivement audio.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →