← Derniers articles
🤖 AI

Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

Cet article aborde les limites de l'évaluation basée sur les résultats dans les agents de recherche approfondie en introduisant la taxonomie PING et le benchmark DeepHalluBench afin de permettre un audit conscient du processus et granulaire des hallucinations sur l'ensemble du parcours de recherche, révélant ainsi des lacunes systémiques de fiabilité et offrant des pistes d'action pour l'amélioration architecturale.

Auteurs originaux : Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

Publié 2026-05-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous embauchiez un assistant de recherche ultra-intelligent pour trouver la réponse à une question très délicate. Vous lui demandez : « Qui est la seule personne à avoir remporté un Oscar pour son interprétation dans un film qu'elle a également réalisé ? » Il s'éloigne, parcourt Internet, lit des articles, puis revient avec un rapport final.

L'ancienne méthode de vérification de leur travail :
Auparavant, si vous vouliez savoir si votre assistant était compétent, vous examiniez simplement le rapport final. Si le nom était correct, il obtenait une étoile dorée. Si le nom était incorrect, il obtenait une croix rouge.

Le problème :
Ce papier soutient que se fier uniquement à la réponse finale revient à juger un chef uniquement sur le goût de la soupe, sans observer comment il l'a préparée. Peut-être que la soupe avait mauvais goût parce qu'il avait oublié le sel (une petite erreur), ou peut-être qu'il avait utilisé une tomate pourrie trouvée au fond du réfrigérateur (un gros mensonge), ou encore qu'il avait commencé à préparer un plat complètement différent parce qu'il avait mal compris votre commande.

Les auteurs affirment que les « Agents de recherche approfondie » actuels (les chercheurs en IA) commettent des erreurs pendant le processus, mais comme nous ne vérifions que la réponse finale, nous ne voyons ni ni pourquoi ils ont échoué. Les erreurs se cachent au milieu.

La nouvelle approche : le « Détective du processus »

Les auteurs ont conçu un nouveau système appelé DeepHalluBench. Imaginez cela comme une cuisine transparente où nous pouvons observer l'assistant cuisiner étape par étape. Ils ne vérifient pas seulement la soupe ; ils vérifient chaque ingrédient, chaque découpe et chaque remuement.

Ils ont créé un nouveau code de règles appelé la Taxonomie PING pour catégoriser les différentes façons dont l'IA se trompe. Voici ce que signifie PING, en utilisant des analogies simples :

  1. P - Propagation (L'« Effet domino ») :
    Imaginez que l'assistant commette une petite erreur à l'étape un, par exemple en pensant que « Les pommes sont bleues ». À l'étape deux, il utilise cette idée fausse pour rechercher des « Pommes bleues ». À l'étape trois, il rédige un rapport sur les « Pommes bleues ». Toute la chaîne d'événements est construite sur ce premier mensonge. C'est la Propagation. L'article a révélé que, une fois qu'une IA commence à mentir, elle a souvent tendance à continuer à s'appuyer sur ce mensonge, rendant le rapport final totalement erroné, même si les étapes ultérieures ont été exécutées « correctement » sur la base de ces informations fausses.

  2. I - Intent (L'« Ordre mal compris ») :
    Vous avez demandé une recette « végétarienne », mais l'assistant a ignoré ce mot et vous a donné une recette de steak. Ou vous avez demandé un rapport de « 2023 », et il vous en a fourni un de « 2010 ». L'assistant a effectué la recherche, mais il n'a pas écouté vos règles spécifiques. C'est une hallucination d'Intent.

  3. N - Noise-induced (Le « Bibliothécaire distrait ») :
    Imaginez que l'assistant aille à la bibliothèque et trouve 100 livres. 99 d'entre eux parlent de chats, mais un seul parle du chien spécifique dont vous avez demandé des informations. L'assistant lit les 99 livres sur les chats et ignore le seul livre sur le chien parce qu'il est enfoui dans la pile. Il n'a pas menti, mais il a manqué l'indice le plus important. C'est une hallucination Noise-induced (induite par le bruit).

  4. G - Grounding (Le « Faux fait ») :
    L'assistant consulte un véritable article, puis déclare : « Cet article dit que la Lune est faite de fromage. » L'article ne dit en réalité rien sur le fromage. L'assistant invente des choses ou accuse la mauvaise source. C'est une hallucination de Grounding (ancrage).

Ce qu'ils ont découvert (Les résultats)

Les auteurs ont testé six célèbres assistants de recherche en IA (comme ceux d'OpenAI, de Google et d'autres) en utilisant leur nouveau système de « Détective du processus » sur 100 questions très difficiles.

  • Tout le monde lutte : Même les meilleurs assistants IA ont commis des erreurs au milieu de leurs recherches. Aucun d'eux n'était parfait.
  • Le « Domino » est le plus grand problème : Le problème le plus dangereux n'était pas simplement de commettre un mensonge, mais le fait que l'IA commette une petite erreur au début, puis que le reste de la recherche soit construit sur cette erreur, conduisant à un échec total.
  • Ils s'arrêtent sur la première chose qu'ils voient : L'IA a tendance à se concentrer fortement sur les premiers résultats de recherche qu'elle trouve (comme une personne qui ne lit que la première page d'un livre et suppose qu'elle connaît toute l'histoire). Si la réponse se trouve à la page 50, l'IA la manque souvent.
  • Ils préfèrent les réponses « ennuyeuses » : Si l'IA trouve cinq articles qui disent tous la même chose, elle les adore. Si elle trouve un article unique qui dit quelque chose de différent, elle l'ignore souvent.

La conclusion

L'article conclut que rendre l'IA simplement « plus intelligente » ou lui donner plus d'accès à Internet ne suffit pas. Le problème réside dans la façon dont l'IA pense pendant qu'elle recherche.

Pour résoudre cela, nous devons construire une IA capable de :

  1. Repérer ses propres erreurs tôt (avant qu'elles ne se transforment en effet domino).
  2. Mieux écouter les règles spécifiques que vous lui donnez.
  3. Ne pas se laisser distraire par la première chose qu'elle voit, mais continuer à chercher la meilleure réponse.

En bref : nous ne pouvons plus noter uniquement le rapport final. Nous devons regarder tout le film pour comprendre pourquoi l'IA a échoué.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →