← Derniers articles
💬 NLP

BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation

Le document introduit BALTO, un cadre d'optimisation de politique équilibrée au niveau des jetons qui atténue les hallucinations des LLM en projetant des jugements vérifiés au niveau des affirmations vers des récompenses au niveau des jetons afin d'assurer un entraînement stable et efficace ainsi qu'une fidélité supérieure sans sacrifier l'informativité.

Auteurs originaux : Ning Li, Zixuan Guo, Yan Xu, Wenbo Fei, Yifan Niu, Chang Luo, Yasheng Wang, Weiwen Liu, Yong Yu, Weinan Zhang

Publié 2026-06-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ning Li, Zixuan Guo, Yan Xu, Wenbo Fei, Yifan Niu, Chang Luo, Yasheng Wang, Weiwen Liu, Yong Yu, Weinan Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le gros problème : La punition « taille unique »

Imaginez que vous enseigniez à un élève (l'IA) à rédiger une dissertation d'histoire basée sur un manuel spécifique. L'élève écrit une dissertation de 500 mots. Elle est majoritairement exacte, mais au milieu, il invente une fausse date pour une bataille.

L'ancienne méthode (Récompenses au niveau de la réponse) :
Autrefois, les professeurs (les entraîneurs d'IA) lisaient toute la dissertation et lui attribuaient une note unique. Si la dissertation contenait cette seule fausse date, le professeur pourrait considérer l'intégralité de la dissertation comme « mauvaise ».

  • Le résultat : L'élève est puni pour toute la dissertation, même pour les parties où il a correctement cité les noms des généraux ou la météo. Pour éviter une mauvaise note, l'élève apprend à écrire des dissertations très courtes et ennuyeuses juste pour être prudent, ou il se retrouve confus quant à ce qu'il a bien fait. Il cesse de prendre des risques, et les dissertations deviennent moins utiles.

La nouvelle solution : BALTO (Le professeur « équilibré »)

Les auteurs de cet article proposent une nouvelle méthode appelée BALTO. Au lieu de noter toute la dissertation avec un seul score, BALTO agit comme un éditeur super précis qui souligne exactement quels mots sont faux et lesquels sont bons.

Voici comment cela fonctionne, étape par étape :

1. Trouver les « mauvais fruits » (Détection fine)

BALTO ne regarde pas seulement l'ensemble de la dissertation. Il décompose la dissertation en petites affirmations (comme « La bataille a eu lieu en 1863 »). Il vérifie chaque affirmation par rapport au manuel.

  • Si une affirmation est fausse, il marque les mots spécifiques responsables (ex: « 1863 »).
  • Si une affirmation est vraie, il marque ces mots comme « bons ».
  • Si un mot est simplement un connecteur (comme « et » ou « le »), il l'ignore.

2. La fiche de score « équilibrée » (Attribution de crédit équilibrée)

C'est la partie magique. Dans l'ancienne méthode, si vous trouviez une fausse date, vous pouviez simplement soustraire des points de toute la dissertation. BALTO fait quelque chose de plus intelligent : Il équilibre le score.

  • Les mauvais mots : La fausse date reçoit un score négatif (une pénalité).
  • Les bons mots : Les faits corrects reçoivent un score positif (une récompense).
  • L'équilibre : Le système s'assure que le total des « mauvais points » est égal au total des « bons points ».

L'analogie : Imaginez une balançoire à bascule.

  • Si l'élève écrit un fait faux, la balançoire penche de ce côté.
  • Pour corriger cela, BALTO ne se contente pas de pousser toute la balançoire vers le bas (en punissant toute la dissertation). Au lieu de cela, il pousse les faits corrects vers le haut de l'autre côté.
  • Le but est de déplacer le poids : Déplacer la probabilité loin des faits faux et vers les faits réels.

Pourquoi est-ce meilleur (La théorie)

L'article utilise les mathématiques pour prouver deux points principaux :

  1. Moins de bruit (Stabilité) : Quand vous punissez toute la dissertation pour une seule erreur, vous confondez l'IA. Elle se dit : « Ai-je raté la date ? Ou la grammaire ? Ou l'orthographe ? » BALTO indique à l'IA exactement se trouvait l'erreur. Cela rend le processus d'apprentissage beaucoup plus fluide et moins chaotique.
  2. Pas de « blocage » (Efficacité) : Si l'IA est très mauvaise au début, l'ancienne méthode peut lui donner une telle pénalité qu'elle arrête d'apprendre (c'est la « famine de gradient »). Si l'IA est presque parfaite, l'ancienne méthode peut la punir si durement pour un tout petit écart qu'elle brise le modèle. BALTO maintient les récompenses et les pénalités petites et équilibrées, afin que l'IA apprenne régulièrement du début à la fin.

Les résultats : Qu'est-ce qui s'est passé ?

Les chercheurs ont testé cela sur trois différents « examens » (jeux de données) impliquant des données financières, des connaissances générales et de la compréhension de lecture. Ils ont utilisé deux modèles d'IA différents (Qwen3-8B et Qwen3-4B).

  • Fidélité : BALTO a produit moins de mensonges que toute autre méthode.
  • Informativité : Contra_irement aux anciennes méthodes qui poussaient l'IA à écrire des réponses courtes et prudentes, BALTO a permis à l'IA de continuer à écrire des réponses longues, détaillées et utiles.
  • Le compromis : L'article montre que BALTO atteint le meilleur équilibre : il empêche l'IA de mentir sans pour autant l'empêcher de parler.

Résumé

Considérez BALTO comme un professeur qui cesse de noter les dissertations avec un simple tampon « Réussite/Échec ». Au lieu de cela, il utilise un stylo rouge pour entourer le mensonge et un stylo vert pour souligner la vérité, garantissant que l'élève apprenne exactement ce qu'il doit corriger sans perdre confiance dans le reste de son travail. Cela mène à une IA qui est à la fois honnête et utile.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →