← Derniers articles
💬 NLP

Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation

Cet article propose une nouvelle mesure de fiabilité visuelle au niveau du jeton qui combine la sensibilité des caractéristiques et les signaux contrefactuels afin de détecter et de diagnostiquer efficacement les hallucinations dans la traduction de la langue des signes en quantifiant la mesure dans laquelle les modèles s'appuient sur des preuves visuelles plutôt que sur des a priori linguistiques.

Auteurs originaux : Yasser Hamidullah, Koel Dutta Chowdhury, Yusser Al Ghussin, Shakib Yazdani, Cennet Oguz, Josef van Genabith, Cristina España-Bonet

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yasser Hamidullah, Koel Dutta Chowdhury, Yusser Al Ghussin, Shakib Yazdani, Cennet Oguz, Josef van Genabith, Cristina España-Bonet

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : Le traducteur « aveugle »

Imaginez un traducteur qui essaie de traduire une vidéo d'une personne signant (en utilisant des gestes de la main) en texte parlé.

  • L'objectif : Le traducteur doit regarder les mains et dire exactement ce qu'elles disent.
  • Le problème : Parfois, le traducteur devient paresseux ou trop sûr de lui. Au lieu de regarder les mains, il devine simplement ce que la personne a probablement dit en se basant sur la façon dont les phrases se construisent habituellement. Il peut produire une phrase qui semble parfaite et grammaticalement correcte, mais qui n'a rien à voir avec ce que le signeur a réellement fait. En termes d'IA, c'est ce qu'on appelle une hallucination.

Cet article soutient que les traducteurs plus récents et plus « intelligents » (qui sautent une étape intermédiaire appelée « glosses ») sont en réalité moins bons pour cela. Ils sont si doués pour deviner en se basant sur les structures du langage qu'ils arrêtent souvent de regarder entièrement la vidéo.

L'idée centrale : « Grounding » (Ancrage) vs « Guessing » (Devinette)

Les auteurs introduisent une nouvelle façon de vérifier si l'IA regarde réellement la vidéo ou si elle invente des choses. Ils appellent cela la Fiabilité (Reliability).

Voyez cela comme un détective vérifiant un alibi :

  • Grounding (Regarder les preuves) : L'IA dit : « Je choisis ce mot parce que je vois la main du signeur bouger d'une manière spécifique. »
  • Guessing (Se fier à la mémoire) : L'IA dit : « Je choisis ce mot parce qu'en anglais, les gens disent généralement "bonjour" après "bonjour" ».

Le travail principal de l'article est de construire un « détecteur de mensonges » capable de faire la distinction entre ces deux comportements.

Comment fonctionne le « Détecteur de mensonges »

Les auteurs ont créé un test pour voir à quel point l'IA s'appuie sur la vidéo. Ils lancent la traduction trois fois en parallèle :

  1. La version réelle : L'IA voit la véritable vidéo.
  2. L'écran noir : L'IA voit la vidéo, mais l'écran est noir (aucune donnée visuelle).
  3. La mauvaise vidéo : L'IA voit une vidéo complètement différente (comme un chat au lieu d'un signeur).

Le Test :

  • Si l'IA change significativement sa réponse lorsque la vidéo est supprimée ou remplacée, cela signifie qu'elle était Grounded (elle regardait réellement la vidéo).
  • Si l'IA continue de dire exactement la même chose même quand la vidéo est absente ou erronée, cela signifie qu'elle était en train de Deviner (elle se fiait uniquement à ses habitudes linguistiques internes).

Ils combinent ces tests en un score unique appelé Fiabilité. Un score élevé signifie que l'IA prête attention à la vidéo. Un score faible signifie qu'elle hallucine.

Le piège du « Sans Glosses » (Gloss-Free)

L'article compare deux types de traducteurs :

  1. Basé sur les Glosses (L'ancienne méthode) : Ces modèles utilisent un intermédiaire. Ils traduisent d'abord la vidéo en « glosses » (étiquettes simples pour les mouvements des mains), puis en texte. C'est comme avoir un professeur strict qui force l'élève à pointer l'objet avant de le nommer. Cela les oblige à rester honnêtes.
  2. Sans Glosses (La nouvelle méthode) : Ces modèles passent directement de la vidéo au texte. Ils sont comme un élève à qui l'on dit : « Dis-moi juste ce que tu vois », sans étiquettes strictes.

Le constat : Les modèles « Sans Glosses » sont beaucoup plus sujets aux hallucinations. Parce qu'ils ne sont pas forcés de marquer une pause pour étiqueter les mouvements, ils ont tendance à sauter l'étape de l'observation de la vidéo pour simplement « combler les vides » avec ce qui sonne bien. L'article prouve que ces modèles « devinent » bien plus souvent que les anciens modèles.

Pourquoi cela importe

Habituellement, lorsque nous vérifions si une IA ment, nous regardons à quel point elle semble « confiante ». Si elle dit quelque chose avec une grande confiance, nous supposons que c'est vrai.

  • Le rebondissement de l'article : En traduction de langue des signes, la confiance est un piège. Un modèle peut être sûr à 100 % qu'il pleut, même si la vidéo montre un temps ensoleillé, car il se contente de deviner en se basant sur les prévisions météo qu'il a lues plus tôt.

Les auteurs démontrent que leur nouveau Score de Fiabilité est bien meilleur pour attraper ces mensonges que la simple vérification de la confiance. Il pose la question : « As-tu réellement regardé la vidéo pour décider cela, ou as-tu simplement deviné ? »

Résumé des résultats

  • Ça fonctionne : Le nouveau score de « Fiabilité » prédit avec succès quand l'IA hallucine.
  • C'est universel : Cela fonctionne sur différents jeux de données et différents types de modèles d'IA.
  • Cela explique le « Pourquoi » : Cela prouve que les nouveaux modèles sans glosses hallucinent davantage parce qu'ils cessent d'utiliser l'information visuelle et commencent à trop compter sur leur entraînement linguistique.
  • C'est un outil de sécurité : En combinant ce contrôle visuel avec les contrôles textuels standards, nous pouvons obtenir une image beaucoup plus claire de quand une IA invente des choses.

En résumé, cet article nous enseigne que pour la traduction de la langue des signes, vous ne pouvez pas simplement faire confiance à la confiance de l'IA ; vous devez vérifier si elle regarde réellement la vidéo.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →