← Derniers articles
💬 NLP

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

Ce papier présente QUACK, un cadre de déduction sociale multimodal open source qui audite les agents de modèles de langage de grande taille en reconstruisant des trajectoires de vérité terrain pour détecter et quantifier automatiquement les hallucinations, les accusations non étayées et les incohérences entre le langage et les actions.

Auteurs originaux : Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

Publié 2026-05-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un groupe d'amis jouant à une partie à enjeux élevés de "Among Us" ou "Werewolf". Dans ce jeu, certains joueurs sont des "Crewmates" qui tentent de réparer le vaisseau, tandis qu'un seul est un "Impostor" cherchant à les saboter. Le hic ? Tout le monde doit parler, mentir et s'accuser mutuellement pour déterminer qui est qui.

Maintenant, imaginez remplacer les joueurs humains par des robots IA avancés (spécifiquement, des modèles vision-langage). Ces robots peuvent voir la carte du jeu, se déplacer et parler entre eux.

L'article présente un nouvel outil appelé QUACK (Questioning, Understanding, and Auditing Communicated Knowledge). Considérez QUACK comme un arbitre surpuissant qui ne se contente pas de regarder qui gagne la partie, mais vérifie réellement si les robots disent la vérité sur ce qu'ils ont vu et fait.

Voici le détail de son fonctionnement et des découvertes, en utilisant des analogies simples :

Le Problème : Gagner ne signifie pas être honnête

Dans la plupart des tests précédents, les chercheurs ne regardaient que le score final : "L'IA a-t-elle gagné ?"

  • Le Défaut : Une IA pouvait gagner le jeu en mentant parfaitement, ou perdre alors qu'elle raisonnait logiquement. Tout comme dans une vraie salle d'audience, un verdict de "Coupable" ou "Non Coupable" ne vous dit pas si les preuves étaient réelles ou si l'avocat a simplement très bien parlé.
  • Le Vide : Jusqu'à présent, nous n'avions pas de moyen de vérifier si les paroles d'une IA correspondaient réellement à ce que ses "yeux" et ses "pieds" avaient réellement expérimenté.

La Solution : QUACK (Le Disant-Vérité)

QUACK est un environnement de jeu et un système de notation conçus spécifiquement pour déceler les mensonges de l'IA.

  1. Le Jeu : Les agents IA jouent sur une carte numérique avec des pièces et des couloirs. Ils peuvent voir leur environnement (images) et recevoir des résumés textuels. Ils doivent se déplacer, accomplir des tâches et parler.
  2. Le Journal Secret : Dans les coulisses, le moteur du jeu tient un journal parfait, tick par tick, de l'endroit exact où chaque robot se trouvait, de ce qu'il a vu et de ce qu'il a fait. C'est la "Vérité Terrain".
  3. L'Audit (La Partie Magique) : Après le jeu, QUACK prend chaque phrase prononcée par les robots lors de leurs discussions et la compare à ce journal secret.
    • Exemple : Si un robot dit "J'ai vu Bob dans la Cafétéria", QUACK vérifie le journal. Si le journal indique que Bob était en fait dans la Salle des Machines, QUACK le signale comme une hallucination.

Les Quatre Façons dont l'IA "Échoue" (Les Résultats de l'Audit)

Les chercheurs ont découvert que même les modèles d'IA les plus intelligents commettent quatre types spécifiques d'erreurs lorsqu'ils tentent de mentir ou de dire la vérité dans ce jeu :

  1. Hallucination Spatiale (Les Vues "Fantômes") :

    • Analogie : Imaginez un témoin déclarant sous serment : "J'ai vu le suspect courir dans le couloir", mais la caméra de sécurité prouve que le témoin se trouvait dans un bâtiment différent à ce moment-là.
    • La Découverte : Environ 15 % du temps, l'IA affirmait voir des personnes ou se trouver dans des endroits où elle ne pouvait physiquement pas être. Elle "se souvenait" de choses qui ne s'étaient jamais produites.
  2. Accusation Sans Fondement (Le Blâme "Fusil à Pompe") :

    • Analogie : Un détective pointant un suspect et disant : "Je pense qu'il l'a fait", tout en admettant : "Je ne sais pas pourquoi, j'ai juste l'impression".
    • La Découverte : Plus de la moitié des accusations formulées par l'IA l'ont été sans aucune preuve réelle que l'IA avait vue. Elles ne faisaient que deviner ou inventer des choses pour paraître convaincantes.
  3. Effondrement de la Déception (Le Mauvais "Menteur") :

    • Analogie : Un espion tentant de mentir sur son alibi mais disant accidentellement : "J'étais à la banque", alors que la banque était fermée ce jour-là. Le mensonge est si évident qu'il s'effondre immédiatement.
    • La Découverte : Lorsque l'IA jouait l'"Impostor", ses mensonges étaient souvent grossiers et facilement démentis par les journaux de jeu. Elles ne créaient pas de mensonges subtils et ingénieux ; elles inventaient simplement des faits instantanément faux.
  4. Incohérence Langage-Action (Le "Bavardage") :

    • Analogie : Quelqu'un disant : "J'étais occupé à réparer le moteur", tandis que le journal montre qu'ils étaient en fait assis immobiles, ne faisant rien.
    • La Découverte : L'IA décrivait accomplir des tâches qu'elle n'avait jamais réellement commencées ou terminées.

La Grande Conclusion

Le résultat le plus surprenant est que gagner la partie ne signifiait pas que l'IA était ancrée dans la réalité.

L'un des modèles d'IA les plus puissants a gagné la partie plus de 80 % du temps. Cependant, lorsque QUACK a audité ses paroles, il a découvert que ce "sage" gagnant mentait encore sur sa localisation 16 % du temps et formulait des accusations sans fondement 54 % du temps.

En bref : QUACK nous a montré que les agents IA peuvent être excellents pour gagner des jeux de déduction sociale, mais qu'ils sont souvent terribles pour dire la vérité sur ce qu'ils ont réellement expérimenté. Ils peuvent être de très persuasifs menteurs, ou de très confiants menteurs, même lorsque les faits sont bien présents dans les journaux.

Les auteurs ont rendu ce système entier (le jeu, les journaux et l'outil d'audit) gratuitement afin que d'autres chercheurs puissent l'utiliser pour tester si leurs propres agents IA sont "honnêtes" concernant leurs actions, et non pas simplement bons pour gagner.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →