← Derniers articles
🤖 machine learning

KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning

KARL est un nouveau cadre d'apprentissage par renforcement qui réduit les hallucinations des LLM en alignant dynamiquement leur capacité d'abstention sur l'évolution de leurs limites de connaissances, permettant ainsi de limiter les réponses erronées sans sacrifier la précision.

Auteurs originaux : Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

Publié 2026-04-28
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème : L'étudiant qui veut trop bien faire (et qui finit par inventer)

Imaginez un étudiant très intelligent, mais qui a une peur bleue de l'échec : l'Intelligence Artificielle (IA).

Lors d'un examen, quand on lui pose une question dont il n'est pas sûr, il a deux mauvais réflexes :

  1. L'hallucination : Il panique et invente une réponse qui a l'air très sérieuse pour ne pas avoir l'air bête. C'est comme un élève qui, face à une question d'histoire, invente une date crédible pour ne pas dire "je ne sais pas".
  2. La prudence excessive : À force d'avoir peur de se tromper, il finit par répondre "Je ne sais pas" à toutes les questions, même à celles qu'il connaît parfaitement. Il devient inutile.

Le défi des chercheurs, c'est de trouver le juste milieu : apprendre à l'IA à dire "Je ne sais pas" uniquement quand elle est vraiment perdue, et à répondre avec assurance quand elle connaît la réponse.


La Solution : KARL (Le Coach de Confiance)

Les chercheurs de l'Université de Tsinghua ont créé KARL. Au lieu de simplement punir l'IA quand elle se trompe, ils lui ont donné un "coach" très intelligent qui comprend ses limites.

Voici comment fonctionne KARL, avec deux étapes clés :

1. Le "Radar de Connaissance" (La Récompense Intelligente)

Imaginez que l'étudiant passe un test blanc. Le coach ne regarde pas seulement si la réponse est juste ou fausse. Il regarde aussi si l'étudiant est capable de trouver la réponse s'il essayait plusieurs fois.

  • Si l'étudiant peut trouver la réponse (même s'il a raté cette fois-ci) : Le coach lui dit : "Hé, tu as le potentiel ! Ne t'avoue pas vaincu, cherche encore, tu connais le sujet !" (On encourage la réponse).
  • Si l'étudiant est totalement incapable de trouver la réponse, peu importe ses essais : Le coach lui dit : "Là, c'est vraiment trop dur pour toi. Ne devine pas, dis simplement que tu ne sais pas." (On encourage l'abstention).

C'est ce qu'ils appellent une "récompense consciente de la frontière de connaissances". Le coach dessine une ligne invisible autour de ce que l'IA sait réellement.

2. L'Entraînement en deux temps (La Stratégie de l'Athlète)

Pour ne pas que l'IA devienne "paresseuse" ou "trop prudente" dès le début, KARL utilise une méthode en deux étapes, comme un athlète qui s'entraîne :

  • Étape 1 : L'Exploration (Le mode "Guerrier") : On demande à l'IA de se concentrer sur l'apprentissage pur. On lui dit : "Essaie de répondre à tout, explore tes connaissances, ne t'inquiète pas trop de dire 'je ne sais pas' pour l'instant." Le but est de muscler son cerveau et de remplir sa mémoire.
  • Étape 2 : Le Calibrage (Le mode "Sagesse") : Une fois qu'elle est devenue très intelligente, on lui apprend la politesse et l'honnêteté. On lui dit : "Maintenant que tu es forte, on va affiner. Si tu es sûre, réponds. Si tu es dans le flou total, sois honnête et dis que tu ne sais pas."

Le Résultat : Un génie honnête

Grâce à KARL, les résultats sont impressionnants. Sur des tests de culture générale (comme NaturalQuestions) :

  • L'IA fait beaucoup moins d'erreurs inventées (les hallucinations chutent de près de 40%).
  • Et contrairement aux autres méthodes, elle ne devient pas moins intelligente : elle continue de donner de bonnes réponses avec précision.

En résumé : KARL transforme l'IA d'un menteur nerveux ou d'un timide inutile en un expert sûr de lui, capable de reconnaître ses propres limites avec élégance.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →