← Derniers articles
⚡ electrical engineering

The NTNU System at the S&I Challenge 2025 SLA Open Track

Le système de l'équipe NTNU pour le S&I Challenge 2025 SLA Open Track intègre wav2vec 2.0 avec le modèle de langage multimodal Phi-4 via une stratégie de fusion de scores pour surmonter les limitations spécifiques à chaque modalité, obtenant ainsi une deuxième place avec une erreur quadratique moyenne de 0,375.

Auteurs originaux : Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

Publié 2026-06-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un professeur essayant de noter l'anglais oral d'un élève. Vous devez l'écouter et décider : Quel est son niveau ? Est-il fluide ? Sa prononciation est-elle claire ? Utilise-t-il les bons mots ?

Pendant longtemps, les ordinateurs ont essayé de faire cela en faisant deux choses séparées, mais ils étaient comme deux spécialistes qui ne pouvaient pas communiquer entre eux :

  1. Le « Transcripteur » (BERT) : Cet ordinateur écoute, écrit exactement ce que l'élève a dit, puis évalue les mots. Il est excellent pour vérifier si l'élève a utilisé le bon vocabulaire. Mais, si l'ordinateur comprend mal un mot (ce qui arrive souvent avec les accents), toute la note est faussée. De plus, il ne peut pas entendre comment l'élève l'a dit — par exemple, s'il avait l'air nerveux ou s'il parlait avec un rythme étrange.

  2. L'« Ingénieur du son » (wav2vec 2.0) : Cet ordinateur ignore totalement les mots. Il écoute simplement les ondes sonores. Il est incroyable pour entendre si l'élève parle de manière fluide, si son accent est clair et s'il fait trop de pauses. Mais il ne comprend pas vraiment ce que l'élève dit. Il pourrait penser qu'un étudiant est excellent simplement parce qu'il parle avec fluidité, même s'il dit des choses insensées.

La solution de l'équipe NTNU : Le « Super-Professeur »

L'équipe de l'Université Normale Nationale de Taïwan (NTNU) a réalisé que pour obtenir une note parfaite, il faut que le Transcripteur et l'Ingénieur du son travaillent ensemble. Ils ont construit un système pour le « Speak & Improve Challenge 2025 » (une grande compétition d'IA pour évaluer l'expression orale) qui agit comme un Super-Professeur.

Voici comment leur système fonctionne, en utilisant une analogie simple :

1. Les deux évaluateurs
Ils ont construit deux « évaluateurs IA » distincts qui écoutent l'enregistrement du même élève en même temps :

  • Évaluateur A (L'expert du son) : Utilise un modèle appelé wav2vec 2.0. Il se concentre entièrement sur la musique de la parole — le rythme, la prononciation et le flux.
  • Évaluateur B (L'expert du sens) : Utilise une IA massive et intelligente appelée Phi-4. C'est un « Modèle de Langage Large Multimodal ». C'est comme un tuteur super intelligent capable de lire le texte et d'écouter la voix en même temps. Il comprend le sens, la grammaire et le contexte de l'histoire racontée par l'élève.

2. La « Fusion des scores » (La décision finale)
Au lieu de laisser une seule IA prendre la décision finale, ils ont combiné les deux. Imaginez un panel de juges où un juge vote pour la « Fluidité » et l'autre pour le « Contenu ».

  • Ils n'ont pas simplement fait une moyenne aveugle des scores. Ils ont utilisé une stratégie intelligente appelée Fusion des scores.
  • Ils ont examiné différents « niveaux » d'anglais (du débutant à l'avancé). Pour chaque niveau, ils ont déterminé exactement quel poids accorder à l'Expert du Son par rapport à l'Expert du Sens pour obtenir le résultat le plus précis.
  • C'est comme dire : « Pour un débutant, accordons un peu plus de confiance à l'Expert du Son. Pour un élève avancé, accordons plus de confiance à l'Expert du Sens. »

Le résultat : Deuxième place !

Lorsqu'ils ont testé ce système de « Super-Professeur » contre le jeu de test officiel :

  • L'ancienne méthode (Base de référence) : Faisait une erreur d'environ 0,44 point en moyenne.
  • L'Expert du son seul : Faisait une erreur de 0,39.
  • L'Expert du sens seul : Faisait une erreur de 0,39.
  • Le Super-Professeur de la NTNU (Combiné) : Faisait une erreur de seulement 0,375.

Cette petite amélioration a suffi à leur assurer la deuxième place de toute la compétition, battant ainsi de nombreuses autres équipes de chercheurs de haut niveau. La seule équipe qui a fait légèrement mieux (1ère place) avait un score de 0,364.

Pourquoi cela importe (selon l'article)

L'article affirme que cela prouve que l'on ne peut pas se contenter de compter sur un seul type d'IA.

  • Si vous ne regardez que les mots, vous manquez le ressenti de la parole.
  • Si vous n'écoutez que les sons, vous manquez le sens.
  • En combinant un « Expert du Son » spécialisé avec un « Tuteur super intelligent » et en les laissant voter ensemble, on obtient une note beaucoup plus juste et précise.

L'équipe a également découvert que le fait d'avoir un « Tuteur » spécifique pour chaque type de question de test (comme un entretien versus une présentation) fonctionnait mieux que d'avoir un seul « Tuteur » essayant de répondre à tout à la fois.

En résumé, pour évaluer un humain qui parle, il faut un ordinateur capable d'entendre la musique et de comprendre les paroles, travaillant ensemble en équipe.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →