CORTEX: Token-Level Hallucination Detection in RAG via Comparative Internal Representations
L'article propose CORTEX, une méthode de détection d'hallucinations au niveau du jeton pour la génération augmentée par récupération qui identifie le contenu non fondé en comparant les représentations internes d'un modèle avec et sans documents récupérés, tout en exploitant la propagation d'informations et le lissage cohérent des segments pour parvenir à une localisation fine des hallucinations.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez un assistant très intelligent et érudit (l'IA) qui essaie de répondre à votre question. Pour s'assurer que la réponse est exacte, vous donnez à l'assistant une pile de livres de référence (les documents récupérés) pour qu'il les consulte pendant qu'il écrit.
Parfois, l'assistant fait du bon travail, en se tenant strictement aux livres. D'autres fois, il peut accidentellement inventer un fait ou mélanger un détail, même si les livres sont juste là sur le bureau. C'est ce qu'on appelle une « hallucination ».
Le problème est que dans une réponse longue et détaillée, l'IA peut avoir réussi 90 % des faits grâce aux livres, mais commettre une erreur sur une ou deux phrases seulement. La plupart des outils actuels sont comme un garde de sécurité qui ne vérifie que le rapport entier à la fin. Si le rapport est globalement bon, il pourrait dire : « Ça semble correct ! » et passer à côté du minuscule mensonge caché au milieu.
Ce document présente CORTEX, un nouvel outil conçu pour être un « microscope » qui vérifie la réponse mot par mot (ou jeton par jeton) pour repérer exactement l'endroit où l'IA invente des choses.
Voici comment fonctionne CORTEX, en utilisant trois analogies simples :
1. Le test du « Avec et Sans » (Représentations internes comparatives)
Imaginez que vous essayiez de déterminer si un étudiant est réellement en train de lire un manuel ou s'il devine simplement.
- L'ancienne méthode : Vous regardez la réponse de l'étudiant et vous essayez de deviner s'il a lu le livre.
- La méthode CORTEX : Vous posez la même question à l'étudiant deux fois.
- Première fois : Vous lui donnez le manuel à lire.
- Deuxième fois : Vous lui retirez le manuel et vous lui demandez de répondre de mémoire.
CORTEX compare l'« activité cérébrale » (les pensées internes) de l'IA lors de ces deux scénarios.
- Si l'IA parle d'un fait présent dans le livre, son « cerveau » change de manière significative lorsque le livre est présent. C'est comme si les yeux de l'étudiant s'illuminaient parce qu'il a trouvé la réponse dans le texte.
- Si l'IA invente quelque chose (hallucine), son « cerveau » ressemble presque au même état, que le livre soit là ou non, car elle puise simplement dans sa propre mémoire.
En comparant ces deux états, CORTEX peut identifier exactement quels mots ont changé grâce au livre (bon) et quels mots sont restés les mêmes parce qu'ils ont été inventés (mauvais).
2. Le détective du « Chaînage de pensée » (Résidu contextuel)
Parfois, une IA est assez intelligente pour lire un fait dans le livre au début de la réponse, puis utiliser ce fait pour construire le reste de la phrase plus tard.
- Le problème : Si vous ne regardez que la phrase ultérieure, il pourrait sembler que l'IA n'utilise plus le livre, car le livre n'est pas mentionné juste là. Cela pourrait tromper un détecteur qui croirait que la phrase suivante est un mensonge, alors qu'elle est basée sur un fait vrai trouvé plus tôt.
- La solution CORTEX : CORTEX agit comme un détective qui suit la piste. Il réalise : « Hé, cette phrase repose sur un fait que l'IA vient de lire deux phrases plus tôt. » Il soustrait cette « influence indirecte » pour ne pas être confus. Cela empêche l'outil d'accuser faussement l'IA de mentir alors qu'elle est simplement en train de poursuivre un récit vrai.
3. Le « Filtre de bruit » (Lissage de la persistance des étiquettes)
Imaginez que vous écoutez une station de radio qui a beaucoup de parasites. Parfois, les parasites font qu'un seul mot semble être un mensonge, même si toute la phrase est vraie.
- Le problème : Les outils de détection bruts peuvent être instables. Ils pourraient signaler un mot comme un mensonge, puis le mot suivant comme une vérité, puis le suivant comme un mensonge, créant un motif désordonné et éparpillé. Mais en réalité, si une IA ment, elle ment généralement pour toute une expression ou une phrase, et non pour un seul mot isolé.
- La solution CORTX : CORTEX applique un filtre de « lissage ». Il part du principe que si un mot est un mensonge, les mots qui le suivent immédiatement font probablement partie du même mensonge. Il relie les points, transformant un fouillis de « peut-être des mensonges » en un bloc clair et solide de « mensonges certains ». Cela rend le résultat final beaucoup plus facile à lire et à comprendre pour un humain.
Les Résultats
Les auteurs ont testé CORTEX sur deux ensembles différents de questions et sur trois modèles d'IA différents. Ils ont constaté que :
- CORTEX est bien meilleur pour trouver les mots exacts qui sont inventés par rapport aux autres méthodes.
- Il fonctionne même lorsque l'IA est un modèle « API » (une boîte noire dont on ne peut pas voir l'intérieur) en utilisant un autre modèle d'IA ouvert pour effectuer le travail de détective en arrière-plan.
- Chaque partie du système (la comparaison, la vérification du chaînage de pensée et le lissage) a contribué à rendre la détection plus précise.
En résumé, CORTEX est un outil qui nous aide à faire davantage confiance aux réponses de l'IA en identifiant précisément l'endroit où l'IA invente des choses, plutôt que de simplement deviner si la réponse entière est bonne ou mauvaise.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.