← Derniers articles
⚡ electrical engineering

HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

Cet article présente HALAS, le premier ensemble de données annotées par l'humain comprenant des hallucinations naturellement survenant dans les systèmes ASR modernes, dérivées de véritables conférences de résultats, ce qui révèle que les méthodes de détection actuelles sont peu performantes et établit un banc d'essai rigoureux pour évaluer l'atténuation des hallucinations.

Auteurs originaux : Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

Publié 2026-06-23
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un scribe très intelligent et de haute technologie nommé « ASR » (Reconnaissance Automatique de la Parole). Ce scribe est engagé pour écouter les gens parler et écrire exactement ce qu'ils disent. Habituellement, ce scribe est incroyable. Mais parfois, quand l'audio devient un peu difficile ou que le scribe est fatigué, il commence à halluciner.

Dans ce contexte, une hallucination n'est pas une vision de fantômes ; c'est le scribe qui écrit avec assurance des mots qui n'ont jamais été prononcés. Il peut ajouter un « merci » alors que personne ne l'a dit, répéter une phrase trois fois, ou inventer une toute nouvelle phrase qui change le sens de la conversation.

Voici une décomposition simple de ce que les chercheurs de cet article ont fait, en utilisant des analogies de la vie quotidienne :

1. Le Problème : Le test du « Silence »

Auparavant, les scientifiques essayaient de corriger ces hallucinations en testant les scribes sur de faux problèmes. Ils injectaient du bruit statique ou du silence dans le système pour voir si le scribe inventait des mots.

  • L'analogie : C'est comme tester la capacité d'un chef à cuisiner un steak en lui demandant de cuisiner un caillou. S'il échoue, vous savez qu'il ne sait pas cuisiner les cailloux, mais vous ne savez pas s'il peut gérer une vraie pièce de viande coriace.
  • La réalité : Les chercheurs ont réalisé que la parole du monde réel (comme des gens qui se coupent la parole dans un bureau animé) est différente du bruit artificiel. Ils avaient besoin de voir comment les scribes se comportaient dans le monde réel.

2. La Solution : HALAS (Le « Hall of Fame des Hallucinations »)

L'équipe a créé un nouveau jeu de données appelé HALAS. Voyez cela comme un « Hall de la Honte » ou un « Hall de la Renommée » pour les erreurs, mais spécifiquement pour les choses que les scribes inventent.

  • Comment ils l'ont construit : Ils ont pris 119 heures d'enregistrements réels de conférences téléphoniques d'entreprises (des gens parlant d'argent et de business).
  • La sélection « Délicate » : Ils n'ont pas simplement choisi des clips au hasard. Ils ont cherché les moments où sept scribes de haut niveau différents ont tous donné des réponses différentes.
    • Analogie : Imaginez demander à sept personnes différentes de décrire une photo floue. Si elles disent toutes des choses différentes, c'est que la photo est probablement très difficile à voir. Les chercheurs ont choisi ces moments « flous » car c'est là que les scribes sont les plus susceptibles de commencer à inventer des choses.
  • La Touche Humaine : Ils ont engagé 10 experts humains pour écouter l'audio et le résultat du scribe. Si le scribe a écrit un mot qui n'était pas dans l'audio, l'humain le marquait comme une « Hallucination ».

3. Ce qu'ils ont trouvé : Les « Mots Fantômes »

Lorsqu'ils ont analysé les données, ils ont découvert des schémas surprenants :

  • Tout le monde le fait : Les sept modèles d'IA les plus avancés qu'ils ont testés ont commis ces erreurs. Personne n'était parfait.
  • Les erreurs « Favorites » : Les scribes ne faisaient pas des erreurs aléatoires. Ils faisaient les mêmes erreurs encore et encore.
    • Analogie : C'est comme un élève qui oublie systématiquement de mettre un point à la fin de sa phrase. Ils peuvent écrire « vous », « d'accord », « merci » ou « ouais » même quand personne n'a prononcé ces mots. Environ 55 % de toutes les hallucinations étaient juste ces quelques phrases communes.
  • Faible erreur, Haut Risque : Parfois, le scribe obtenait 95 % des mots corrects (un faible « Taux d'Erreur de Mots »), mais les 5 % qu'il ratait étaient des mensonges totaux (hallucinations). Cela est dangereux car le texte semble presque correct, de sorte que vous pourriez ne pas remarquer le mensonge.
  • Sévérité : Certaines erreurs étaient mineures (ajouter un « euh » ou un « hum »), mais d'autres étaient graves (changer le sens d'une phrase ou contredire ce qui a été dit).

4. Le Test : Peut-on attraper les menteurs ?

Les chercheurs ont utilisé HALAS pour tester si les méthodes actuelles pouvaient détecter ces hallucinations.

  • Les « Tests Proxy » : Ils ont essayé d'utiliser des outils mathématiques simples (comme vérifier la longueur du texte ou la similitude avec l'audio original).
    • Résultat : Ces outils étaient corrects, mais pas excellents. Ils pouvaient attraper les erreurs flagrantes et délirantes, mais ils manquaient les plus subtiles.
  • Le Test « IA contre IA » : Ils ont essayé d'utiliser d'autres IA (comme des Modèles de Langage de Grande Taille - LLM) pour vérifier le travail.
    • Résultat : Étonnamment, les méthodes « sans référence » (qui regardent les signaux cérébraux internes du scribe plutôt que de comparer avec une « bonne réponse ») fonctionnaient mieux que celles qui avaient la « bonne réponse » sous les yeux.
  • Le Score : La meilleure méthode de détection qu'ils ont trouvée n'a attrapé qu'environ 53 % des hallucinations. Cela signifie que même avec les meilleurs outils, nous en manquons encore presque la moitié.

L'essentiel à retenir

Cet article présente HALAS, le premier « jeu de données d'hallucinations » réel où des humains ont soigneusement marqué précisément où les systèmes de reconnaissance vocale par IA mentent.

Ils ont découvert que :

  1. Même les scribes IA les plus intelligents inventent des mots dans les conversations réelles.
  2. Ils font tendance à commettre les mêmes erreurs spécifiques de manière répétée.
  3. Les outils actuels ne sont pas très bons pour attraper ces mensonges, surtout lorsque le reste du texte semble correct.

L'article conclut que HALAS est désormais le nouveau « standard d'excellence » pour tester la capacité à détecter ces hallucinations d'IA, nous éloignant des tests basés sur du bruit artificiel pour nous diriger vers la parole humaine réelle et désordonnée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →