Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
Cet article introduit un cadre utilisant des attaques adverses sémantiquement équivalentes pour démontrer que les modèles de langage de pointe demeurent hautement vulnérables aux hallucinations intrinsèques, où des perturbations de requêtes préservant le sens dégradent considérablement leur capacité à utiliser fidèlement les preuves extraites.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous parlez à un robot bibliothécaire super intelligent qui a lu presque tous les livres de l'univers. Vous lui posez une question et, pour être tout à fait sûr, vous lui donnez une page spécifique d'un livre pour qu'il s'en serve comme clé de réponse. Cette configuration est appelée Génération Augmentée par Récupération, ou RAG. C'est comme donner une fiche de référence au robot pour qu'il n'ait pas à deviner à partir de sa propre mémoire. L'espoir est que le robot s'en tienne strictement à la fiche de référence, ignorant ses propres connaissances internes si celles-ci ne correspondent pas. Mais voici le piège : parfois, même avec la fiche de référence en main, le robot s'embrouille, oublie ce qu'il lit, ou commence quand même à inventer des choses. C'est ce qu'on appelle une « hallucination intrinsèque ». Ce n'est pas que le robot ment intentionnellement ; c'est que son cerveau est simplement trop agité pour rester fidèle aux preuves qui sont juste devant lui.
Imaginez maintenant que vous êtes un détective essayant de comprendre à quel point ce robot est réellement agité. Vous pourriez lui poser la même question de cent manières différentes, mais si vous changez le sens de la question, le robot pourrait simplement être confus par le nouveau sujet. Pour tester véritablement sa concentration, vous devez poser exactement la même question, mais en la chuchotant avec une douzaine d'accents, de dialectes ou de structures de phrases différents. Si le robot donne une réponse différente et erronée simplement parce que vous avez dit « Quelle heure est-il ? » au lieu de « Pourriez-vous me dire l'heure actuelle ? », alors le robot a un sérieux problème de cohérence. Ce document traite de la création d'une machine qui chuchote ces variations complexes, préservant le sens, pour voir si le robot bibliothécaire craque sous la pression.
Les chercheurs derrière cette étude ont décidé de tester la résistance de ces systèmes d'IA en utilisant un nouveau cadre ingénieux. Ils n'ont pas seulement demandé aux modèles de transgresser leurs règles de sécurité (ce qui est une façon courante de tester l'IA) ; ils leur ont demandé de transgresser leur propre honnêteté. Ils ont utilisé une équipe d'« attaquants » numériques — certains utilisant les mathématiques pour modifier les mots, d'autres utilisant des algorithmes génétiques pour faire évoluer de nouvelles phrases, et d'autres utilisant d'autres IA pour réécrire les questions — pour trouver la reformulation parfaite, préservant le sens, qui ferait halluciner le modèle. Le but était de voir s'ils pouvaient piéger le modèle pour qu'il ignore le contexte fourni et invente une histoire, même si la question signifiait exactement la même chose que l'originale.
Les résultats ont été un choc. L'équipe a découvert que même les modèles les plus avancés et les plus performants sont étonnamment fragiles. Lorsqu'ils utilisaient ces attaques sémantiquement équivalentes, la capacité des modèles à s'en tenir aux faits chutait de manière spectaculaire. Dans certains cas, la fidélité du modèle aux preuves fournies se dégradait jusqu'à 50 % pour des modèles spécifiques comme GPT-5-mini sur certains ensembles de données. Par exemple, sur l'ensemble de données FaithEval, la fidélité de GPT-5-mini est passée de 0,72 à 0,22 — une baisse de 41,7 % — échouant soudainement à répondre correctement lorsque la question était formulée de manière légèrement différente, même si le sens n'avait pas changé du tout.
Le document suggère que le simple fait de rendre les modèles plus grands ou plus intelligents ne suffit pas à résoudre le problème. Les chercheurs ont testé tout, des petits modèles open-source aux géants massifs et fermés, et tous ont trébuché face à ces tours de passe-passe préservant le sens. Les attaques étaient si efficaces qu'elles pouvaient amener les modèles à dire des choses comme « Incapable de répondre » ou à inventer des détails qui ne figuraient pas dans le texte, alors même que la question restait logiquement identique à l'originale.
Il est intéressant de noter que le type d'attaque importait. Certaines méthodes qui se contentaient de remplacer des mots par des synonymes (comme changer « grand » par « vaste ») rendaient souvent les questions bizarres et peu naturelles, ce que les modèles pouvaient facilement détecter. Mais les méthodes qui utilisaient d'autres IA pour réécrire toute la phrase de manière naturelle — en préservant parfaitement le flux et le sens — étaient les véritables fauteurs de troubles. Ces attaques au ton naturel étaient celles qui provoquaient la plus grande chute de performance, prouvant que les modèles sont fragiles non pas seulement face au charabia étrange, mais face à la variété naturelle du langage humain.
L'étude a également examiné comment les modèles échouaient. Parfois, ils refusaient simplement de répondre, mais souvent, ils se trompaient sur les faits, mal interprétaient le contexte ou faisaient de mauvais sauts logiques. Cela nous indique que le problème n'est pas seulement que les modèles sont têtus ; c'est que leur capacité à ancrer leurs réponses dans le texte fourni est fondamentalement instable. Les chercheurs concluent que nous devons construire de nouvelles architectures et de nouvelles méthodes d'entraînement qui forcent les modèles à rester ancrés dans les preuves. D'ici là, même les bibliothécaires IA les plus intelligents pourraient n'être qu'à une phrase légèrement différente de l'invention d'une toute nouvelle histoire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.