← Nieuwste papers
⚡ electrical engineering

The NTNU System at the S&I Challenge 2025 SLA Open Track

Het systeem van het NTNU-team voor de S&I Challenge 2025 SLA Open Track integreert wav2vec 2.0 met het multimodale grote taalmodel Phi-4 via een scorefusiestrategie om modaliteitsspecifieke beperkingen te overwinnen, waarmee een tweede plaats werd behaald met een wortelgemiddelde kwadratische fout van 0,375.

Oorspronkelijke auteurs: Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

Gepubliceerd 2026-06-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een docent bent die probeert de gesproken Engelse vaardigheden van een student te beoordelen. Je moet naar hen luisteren en beslissen: Hoe goed zijn ze? Klinken ze vloeiend? Is hun uitspraak duidelijk? Gebruiken ze de juiste woorden?

Lange tijd probeerden computers dit te doen door twee aparte dingen te doen, maar ze waren als twee specialisten die niet met elkaar konden praten:

  1. De "Transcriptie-expert" (BERT): Deze computer luistert, schrijft precies op wat de student zei, en beoordeelt vervolgens de woorden. Het is erg goed in het controleren of de student de juiste woordenschat heeft gebruikt. Maar als de computer een woord verkeerd verstaan heeft (wat vaak gebeurt bij accenten), raakt de hele beoordeling in de war. Ook kan het niet horen hoe de student het zei—bijvoorbeeld of ze zenuwachtig klonken of op een vreemde manier spraken.
  2. De "Geluidsingenieur" (wav2vec 2.0): Deze computer negeert de woorden volledig. Hij luistert alleen naar de geluidsgolven. Hij is geweldig in het horen of een student vloeiend spreekt, of het accent duidelijk is, en of er te veel pauzes worden ingelast. Maar hij begrijpt niet echt wat de student zegt. Hij zou kunnen denken dat een student geweldig is, simpelweg omdat ze vloeiend spraken, zelfs als ze onzin uitkraamden.

De oplossing van het NTNU-team: De "Superdocent"

Het team van de National Taiwan Normal University (NTNU) realiseerde zich dat je voor een perfect cijfer beide nodig hebt: de Transcriptie-expert én de Geluidsingenieur die samenwerken. Ze bouwden een systeem voor de "Speak & Improve Challenge 2025" (een grote competitie voor AI die spraak beoordeelt) dat werkt als een Superdocent.

Zo werkt hun systeem, met behulp van een eenvoudige analogie:

1. De Twee Beoordelaars
Ze bouwden twee afzonderlijke "AI-beoordelaars" die tegelijkertijd naar dezelfde opname van een student luisteren:

  • Beoordelaar A (De Klankexpert): Gebruikt een model genaamd wav2vec 2.0. Deze richt zich volledig op de muziek van de spraak—het ritme, de uitspraak en de flow.
  • Beoordelaar B (De Betekenisexpert): Gebruikt een enorme, slimme AI genaamd Phi-4. Dit is een "Multimodale Large Language Model". Het is als een super slimme tutor die zowel de tekst kan lezen als tegelijkertijd naar de stem kan luisteren. Het begrijpt de betekenis, de grammatica en de context van het verhaal dat de student vertelt.

2. De "Score Fusion" (De Eindbeslissing)
In plaats van één AI de uiteindelijke beslissing te laten nemen, hebben ze de twee gecombineerd. Stel je een panel van juryleden voor waarbij de ene jurylid stemt op "Vloeiendheid" en de andere op "Inhoud".

  • Ze hebben de scores niet zomaar gemiddeld. Ze gebruikten een slimme strategie genaamd Score Fusion.
  • Ze keken naar verschillende "niveaus" van Engels (van beginner tot gevorderd). Voor elk niveau berekenden ze precies hoeveel gewicht ze aan de Klankexpert versus de Betekenisexpert moesten geven om het meest nauwkeurige resultaat te krijgen.
  • Het is alsof je zegt: "Voor een beginner vertrouwen we de Klankexpert iets meer. Voor een gevorderde student vertrouwen we de Betekenisexpert meer."

Het Resultaat: Tweede Plaats!

Toen ze dit "Superdocent"-systeem testten tegen de officiële testset:

  • De Oude Manier (Baseline): Maakte een fout van ongeveer 0,44 punten gemiddeld.
  • De Klankexpert alleen: Maakte een fout van 0,39.
  • De Betekenisexpert alleen: Maakte een fout van 0,39.
  • De NTNU Superdocent (Gecombineerd): Maakte een fout van slechts 0,375.

Deze kleine verbetering was genoeg om 2e plaats te bemachtigen in de gehele competitie, waarmee ze veel andere toponderzoekers versloegen. Het enige team dat iets beter presteerde (1e plaats), had een score van 0,364.

Waarom dit belangrijk is (volgens het paper)

Het paper beweert dat dit bewijst dat je niet alleen op één type AI kunt vertrouwen.

  • Als je alleen naar de woorden kijelt, mis je het gevoel van de spraak.
  • Als je alleen naar de geluiden luistert, mis je de betekenis.
  • Door een gespecialiseerde "Klankexpert" te combineren met een "Super-slimme Tutor" en hen samen te laten stemmen, krijg je een veel eerlijker en nauwkeuriger cijfer.

Het team ontdekte ook dat het werken met een specifieke "Tutor" voor elk specifiek type testvraag (zoals een interview versus een presentatie) beter werkte dan het hebben van één "Tutor" die alles tegelijk probeert te beantwoorden.

Kortom: Om de spraak van een mens te beoordelen, heb je een computer nodig die zowel de muziek kan horen als de tekst kan begrijpen, werkend als een team.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →