Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
Cet article aborde la question des hallucinations des LLM en proposant un banc d'essai d'évaluation robuste qui tient compte des données de pré-entraînement et en introduisant une nouvelle méthode pour renforcer l'honnêteté du modèle grâce à la récupération de ces données de pré-entraînement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un étudiant brillant mais trop sûr de lui nommé « LLM » qui a lu des milliards de livres durant sa formation. Cet étudiant est excellent pour répondre aux questions, mais il possède un défaut majeur : il ne sait pas ce qu'il ne sait pas. Lorsqu'on lui pose une question sur un sujet qu'il n'a jamais vu, au lieu de dire « Je n'ai jamais entendu parler de cela », il invente une histoire avec assurance. Dans le monde de l'IA, c'est ce qu'on appelle une hallucination.
L'article que vous avez partagé soutient que pour rendre l'IA digne de confiance, nous devons lui apprendre la différence entre « Je sais ceci » et « Je ne sais pas ceci ». Voici une décomposition de leur solution, utilisant des analogies simples.
Le Problème : L'angle mort de la « Boîte Noire »
Habituellement, lorsque les chercheurs tentent de tester si une IA est honnête, ils traitent l'IA comme une boîte noire. Ils lui posent des questions et voient ce qu'elle dit, mais ils ne savent pas exactement quels livres l'IA a lus pour apprendre ses faits.
- Le Défaut : Si l'IA se trompe dans une réponse, les chercheurs supposent que l'IA « ne sait pas » la réponse. Mais peut-être que l'IA a bien lu la réponse dans ses livres d'entraînement ; elle a simplement oublié ou s'est emmêlée les pinceaux.
- Le Résultat : Les tests précédents étaient injustes car ils ne pouvaient pas distinguer si l'IA mentait (hallucinait) ou si elle avait simplement passé une mauvaise journée (oubli).
La Solution : L'approche du « Livre Ouvert »
Les auteurs ont utilisé un modèle d'IA en code source ouvert appelé Pythia. L'avantage clé ? Nous possédons l'intégralité de la bibliothèque de livres que cette IA a lus.
- L'Analogie : Imaginez donner à l'étudiant une liste spécifique de chaque livre qu'il a étudié. Maintenant, quand vous posez une question, vous pouvez réellement vérifier dans la bibliothèque : « Est-ce que cet étudiant a lu la réponse à cette question ? »
- Le Nouveau Référentiel : Ils ont créé un nouveau test (appelé TIP-TRIVIAQA) où nous savons exactement quelles questions l'IA devrait connaître (parce que la réponse est dans ses livres d'entraînement) et lesquelles elle ne devrait pas connaître (parce que la réponse est absente de ses livres). Cela crée un terrain de jeu équitable pour mesurer l'honnêteté.
La Méthode : Le Système du « Bibliothécaire » (RETAIN)
Pour corriger l'honnêteté de l'IA, les auteurs n'ont pas simplement dit à l'IA de « être honnête ». Ils ont construit un système en trois parties appelé RETAIN qui agit comme un bibliothécaire intelligent :
Le Récupérateur (Le Chercheur) :
Lorsqu'on pose une question, cet agent va immédiatement dans la « bibliothèque » de l'IA (ses données de pré-entraînement) pour chercher la réponse. C'est comme un bibliothécaire qui retire des livres des étagères pour voir si la réponse s'y trouve.Le Classificateur de Capacité de Réponse (Le Gardien) :
Cet agent examine les livres que le chercheur a trouvés. Il demande : « Ce livre contient-il réellement la réponse ? »- Si Oui : Il transmet le livre à l'agent suivant.
- Si Non : Il arrête le processus et dit à l'IA : « Nous n'avons pas la réponse dans notre bibliothèque. Dis 'Je ne sais pas' ».
Le Répondeur (L'Orateur) :
C'est l'IA qui vous parle réellement. Elle ne parle que si le Gardien lui donne le feu vert et un livre pertinent à lire. Si le Gardien dit « Non », le Répondeur dit simplement : « Je ne sais pas ».
Pourquoi cela fonctionne
L'article a révélé que cette méthode est bien meilleure que les anciennes astuces.
- L'Ancienne Méthode : Simplement dire à l'IA « Si tu n'es pas sûr, dis 'Je ne sais pas' » ne fonctionnait pas très bien. L'IA essayait quand même de deviner.
- La Méthode RETAIN : En récupérant phys quement le matériel source d'abord, l'IA bénéficie d'un « test de réalité ». Elle peut voir : « Oh, la réponse n'est pas dans mes livres », de sorte qu'elle admet honnêtement qu'elle ne sait pas.
- Bonus : Quand la réponse est dans les livres, l'IA donne une réponse beaucoup plus précise car elle est en train de lire le matériel source à ce moment précis, plutôt que de se fier uniquement à sa mémoire.
Les Résultats
Lorsqu'ils ont testé ce nouveau système :
- Il était bien meilleur pour dire « Je ne sais pas » quand la réponse ne figurait pas dans ses données d'entraînement.
- Il était bien meilleur pour répondre correctement quand la réponse était dans les données.
- Il a surpassé toutes les autres méthodes testées, prouvant que donner accès à l'IA à son propre « code source » (les livres qu'elle a lus) est la clé pour la rendre honnête.
En bref : L'article montre que pour empêcher l'IA d'inventer des choses, il ne faut pas seulement lui dire d'être honnête. Au lieu de cela, il faut lui donner un outil pour vérifier sa propre bibliothèque d'abord. Si la réponse n'y est pas, elle doit être assez honnête pour dire : « Je n'ai pas lu cela ».
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.