CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps
L'article présente CRiT-QA, un nouveau jeu de données conçu pour évaluer rigoureusement les capacités de raisonnement multi-étapes des grands modèles de langage en employant des chaînes contrefactuelles pour éliminer la dépendance aux connaissances paramétriques et des pièges de distraction pour empêcher l'exploitation de raccourcis, révélant ainsi des écarts de performance significatifs par rapport aux benchmarks standards.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous jouez à une partie de « Détective » à enjeux élevés, mais qu'au lieu d'une loupe, vous avez un ami robot super intelligent qui a lu presque tous les livres jamais écrits. Vous donnez au robot un mystère à résoudre, comme : « Qui a fondé l'entreprise qui a distribué le film UHF ? »
Dans le passé, si vous donniez au robot une pile de papiers (le « contexte ») pour résoudre le mystère, il ignorait souvent les papiers. Il ferait fermer les yeux, plongerait dans sa propre banque de données massive de faits appris lors de son entraînement, et crierait la réponse : « Mike Medavoy ! » Il avait la bonne réponse, certes, mais il trichait en ne lisant pas réellement les indices que vous lui aviez donnés. C'était comme un élève réussissant un examen d'histoire en ayant mémorisé les réponses dans sa tête plutôt qu'en lisant le chapitre du manuel que vous lui aviez tendu.
D'autres fois, le robot essayait de lire, mais il prenait un raccourci paresseux. Si la question demandait : « Dans quel comté est né Mark Dismore ? » et que le premier paragraphe mentionnait « Hancock County », le robot saisissait simplement ce mot parce qu'il correspondait au mot « comté » dans la question. Il sautait l'étape difficile consistant à relier les points entre différents paragraphes pour trouver d'abord le véritable lieu de naissance. C'était comme résoudre un labyrinthe en devinant simplement la sortie en se basant sur la couleur du mur, plutôt qu'en suivant réellement le chemin.
La Grande Révélation
Les auteurs de ce document, JungMin Yun et ses collègues, ont décidé de construire une version beaucoup plus coriace du jeu du « Détective » appelée CRiT-QA. Leur principale conclusion est que lorsqu'ils soumettent leurs meilleurs robots à ce nouveau jeu de triche, les performances des robots s'effondrent. Même les modèles les plus avancés, comme GPT-4o et Gemini-2.5-Pro, qui obtiennent habituellement des notes excellentes, sont soudainement en difficulté. Ils passent du statut d'élèves de niveau « A+ » à celui d'élèves qui réussissent à peine, prouvant que leur succès précédent n'était souvent qu'un effet de lumière.
Comment ils ont piégé les robots
Pour prendre les robots en flagrant délit, les chercheurs ont utilisé deux pièges ingénieux :
Le piège du « Et si » (Contrefactuels) : Imaginez que la mémoire du robot lui dise que « Le ciel est bleu ». Mais dans le nouveau jeu, les chercheurs réécrivent l'histoire pour que, dans cet univers spécifique, « Le ciel est en fait vert ». Si le robot se fie à sa vieille mémoire, il dira « Bleu » et échouera. Pour gagner, il doit ignorer sa mémoire et suivre strictement la nouvelle histoire étrange fournie dans les indices. Les chercheurs ont constaté que lorsque les faits réels étaient remplacés par ces scénarios de type « et si », les robots étaient confus. Par exemple, un modèle nommé Qwen2.5-7B a vu son score passer de 34,96 lors de tests normaux à seulement 24,77 face à ces faits fictifs.
Le piège du « Faux Indice » (Distracteurs) : C'est comme poser de fausses empreintes de pas dans la neige. Les chercheurs ont ajouté des paragraphes supplémentaires qui ressemblaient exactement aux bons indices. Ils contenaient le bon type de mots (comme le nom d'une personne ou un lieu) mais menaient à la mauvaise réponse. C'est comme avoir une carte avec dix chemins différents qui semblent tous mener au trésor, mais un seul est réel. Les robots, habitués à prendre des raccourcis, se sont perdus dans le bruit. Lorsqu'ils ont ajouté ces faux indices aux histoires de type « et si », les scores ont encore chuté. Le score de Qwen2.5-7B s'est effondré à 19,30.
Plus il y a d'étapes, plus c'est difficile
Les chercheurs ont également remarqué quelque chose d'inquiétant : plus la chaîne d'indices est longue, plus les robots sont mauvais.
- Les questions à 2 sauts (deux étapes pour résoudre) allaient bien.
- Les questions à 3 sauts (trois étapes) devenaient plus difficiles.
- Les questions à 4 sauts (quatre étapes) étaient un désastre.
Par exemple, le modèle open-source LLaMA-3-8B avait un score de précision de 28,91 sur les questions à 2 étapes, mais sur les questions à 4 étapes, il s'est effondré à 10,18. C'est comme si le robot pouvait résoudre un puzzle simple, mais une fois que le puzzle comportait quelques pièces supplémentaires, il oubliait totalement comment jouer. Les chercheurs ont mesuré cela en testant les modèles sur des questions à 2, 3 et 4 sauts, et les résultats ont montré une baisse constante des performances à mesure que le raisonnement devenait plus profond.
Ce que cela signifie (et ce que cela ne signifie pas)
Le document ne dit pas que les robots sont « cassés » pour toujours. Il suggère que nous avons été trop indulgents avec eux. Nous leur avons donné des tests où ils peuvent tricher en utilisant leur mémoire ou en devinant des schémas. Ce nouvel ensemble de données CRiT-QA est comme un professeur sévère qui dit : « Pas de mémorisation, pas de devinettes. Montrez-moi votre travail, étape par étape, en utilisant uniquement les indices que je vous ai donnés. »
Les auteurs sont très sûrs d'eux : ils ont mesuré les scores, mené les expériences et vu les chiffres chuter. Ils ne supposent pas simplement que les robots sont faibles ; ils ont les données pour le prouver. Cependant, ils admettent également que leur nouveau test est construit sur un type spécifique de puzzle (le dataset MuSiQue), nous ne savons donc pas encore si cela se produit avec chaque type de question au monde. Ils notent également que puisqu'ils ont utilisé un autre robot pour écrire les faux indices, il existe une infime chance que les robots repèrent l'« écriture robotique » et l'utilisent comme un nouveau raccourci, ce qu'ils devront corriger à l'avenir.
L'essentiel à retenir
Actuellement, beaucoup de nos modèles d'IA les plus intelligents sont comme des acteurs qui ont mémorisé le script mais ne comprennent pas l'intrigue. Quand le script change légèrement ou que la scène est remplie de faux accessoires, ils se figent. CRiT-QA est la nouvelle scène qui les force à réellement lire le script et à réfléchir, prouvant que malgré toute leur puissance, ils ont encore un long chemin à parcourir avant de pouvoir réellement raisonner comme un détective.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.