Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback
Cet article introduit un cadre d'évaluation multi-tours pour les agents de recherche approfondie utilisant une nouvelle méthode de rétroaction au niveau du processus appelée Inférence de Lacune de Recherche, révélant que si un tour unique de rétroaction ciblée améliore significativement la qualité des rapports, les tours suivants ne parviennent pas à cumuler les gains en raison d'une régression des agents sur des critères précédemment satisfaits, indiquant qu'une amélioration multi-tours fiable demeure hors de portée pour les architectures actuelles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez engagé une équipe d'assistants de recherche super intelligents (appelés Agents de Recherche Profonde) pour rédiger un rapport détaillé sur un sujet complexe, comme « L'histoire de la technologie des deepfakes » ou « La santé financière d'une entreprise spécifique ».
Habituellement, nous testons ces assistants en leur posant une question, en les laissant rédiger un premier brouillon, puis en évaluant ce brouillon unique. Mais dans la vie réelle, si vous recevez un brouillon d'un chercheur humain, vous ne l'acceptez que rarement tel quel. Vous lui donnez des commentaires du type : « Vous avez oublié certaines lois clés », ou « Vos sources sont trop vagues », et vous lui demandez de le réécrire.
Cette étude pose la question suivante : Les assistants IA peuvent-ils réellement s'améliorer lorsqu'on leur donne des commentaires, ou font-ils simplement un gâchis en essayant de corriger leur propre travail ?
Les chercheurs ont testé cela de deux manières différentes pour donner des commentaires :
1. Le test de l'« Auto-réflexion » (L'éditeur aux yeux bandés)
Dans ce scénario, l'IA se voit dire : « Regarde ton rapport, trouve tes propres erreurs et corrige-les. » Aucune aide extérieure n'est apportée.
- Le Résultat : C'était comme demander à un étudiant de noter sa propre dissertation sans avoir le corrigé du professeur. L'IA a fait de gros efforts, cherchant davantage sur le Web et lisant plus de sources, mais elle n'a pas réussi à comprendre ce qui n'allait pas réellement.
- L'Analogie : Imaginez que vous essayiez de réparer un bateau qui fuit tout en portant un bandeau sur les yeux. Vous allez peut-être marteler le bois et ajouter plus de planches (faire plus de travail), mais parce que vous ne voyez pas le trou, vous pourriez accidentellement percer un trou ailleurs. Le résultat ? Le bateau fuit toujours, ou peut-être fuit-il encore plus. Le score de l'IA a peine changé, ou parfois, a empiré.
2. Le test du « Feedback au niveau du processus » (Le coach stratégique)
Ici, les chercheurs ne se sont pas contentés de dire « corrige ceci ». Ils ont utilisé un outil spécial appelé RGI (Inférence de Lacunes de Recherche). Cet outil a examiné le rapport de l'IA et la grille d'évaluation pour comprendre comment l'IA avait échoué.
Au lieu de dire « Ajoute un fait sur X », le commentaire ressemblait davantage à un coach disant : « Tu regardes le mauvais type de sources », ou « Tu traites ce sujet de manière trop large et tu dois approfondir les détails spécifiques », ou encore « Tu as manqué les documents juridiques les plus importants ».
- Le Résultat : Cela a fonctionné à merveille pour la première série de corrections. L'IA a compris la stratégie, est retournée à la bibliothèque, a trouvé les bons livres et a écrit un bien meilleur rapport. Leurs scores ont bondi de manière significative (d'environ 8 à 15 points).
- L'Analogie : C'est comme un coach qui dit à un coureur : « Tu ne manques pas d'énergie, ce sont tes chaussures qui sont à la mauvaise taille. » Une fois que l'IA a eu les bonnes chaussures (la bonne stratégie de recherche), elle a couru beaucoup plus vite et mieux.
Le Piège : Le problème de la « Réécriture »
Les chercheurs ont ensuite demandé à l'IA de le faire à nouveau (un troisième tour). Ils s'attendaient à ce que les scores continuent de s'améliorer.
- Le Résultat : Pour la plupart des modèles d'IA, l'amélioration s'est arrêtée. En fait, lorsqu'ils ont essayé de corriger les derniers petits problèmes, ils ont accidentellement cassé les parties qui fonctionnaient déjà.
- L'Analogie : Imaginez un chef qui prépare une excellente soupe. Le coach dit : « Ajoute une pincée de sel ». Le chef ajoute le sel, et c'est parfait. Mais ensuite, le coach dit : « Maintenant, corrige la garniture ». Le chef, voulant être parfait, décide de jeter toute la marmite et de recommencer de zéro. Dans le processus de préparation d'une nouvelle marmite, il oublie d'ajouter le sel qu'il venait d'ajouter, ou il rate les légumes qu'il avait réussis la première fois.
- Pourquoi ? Les modèles d'IA utilisés dans cette étude fonctionnent en « réécrivant tout le rapport de zéro » à chaque fois. Ils n'ont pas de mémoire de « ce qui était bien la dernière fois ». Ainsi, lorsqu'ils essaient de corriger une chose, ils perdent souvent les choses qu'ils avaient déjà corrigées.
L'Exception : Le modèle « Prudent »
Un modèle d'IA spécifique (DeepSeek-V4-Flash) s'est comporté différemment. Il n'a pas jeté toute la marmite. Il a gardé la majeure partie de la bonne soupe et a simplement ajouté les nouveaux ingrédients. Il a amélioré son score à nouveau lors du troisième tour.
- Le Coût : Cependant, ce modèle « prudent » était incroyablement coûteux et lent. Il a utilisé environ 4 fois plus de puissance informatique et a mis beaucoup plus de temps à réfléchir que les autres. C'était comme un chef qui refuse de jeter quoi que ce soit et vérifie méticuleusement chaque ingrédient, ce qui prend un temps infini et coûte une fortune.
L'Essentiel à retenir
- L'IA ne peut pas s'auto-corriger : Si vous dites à une IA de « corriger ses propres erreurs », elle finit généralement par aggraver la situation ou ne change rien, car elle ne peut pas voir la vue d'ensemble.
- Le feedback stratégique fonctionne : Si vous dites à l'IA comment faire ses recherches (ex: « cherche des documents officiels, pas des articles de blog »), elle peut rédiger un bien meilleur rapport.
- Le défaut de la « Réécriture complète » : Les outils de recherche IA actuels sont comme des artistes qui effacent l'intégralité de leur toile chaque fois qu'ils veulent ajouter un nouveau coup de pinceau. Cela rend très difficile l'amélioration d'un rapport étape par étape sans supprimer accidentellement les bonnes parties. Pour obtenir des améliorations réellement fiables et multi-étapes, nous avons besoin d'une IA capable de se souvenir de ce qu'elle a réussi et de ne changer que ce qui doit être corrigé, plutôt que de repartir de zéro à chaque fois.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.