← Derniers articles
🤖 AI

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMP remédie au décalage entre récompense et crédit chez les agents de recherche profonde en introduisant un mécanisme d'attribution de crédit guidé par la provenance qui retrace les documents de support jusqu'à leurs actions d'exposition et redistribue l'avantage via une modulation préservant le signe, améliorant ainsi de manière significative les performances par rapport aux bases de référence GRPO sur de multiples benchmarks.

Auteurs originaux : Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous formez un détective numérique super intelligent pour résoudre des mystères complexes sur Internet. Ce détective, appelé « agent de recherche profonde » (deep-search agent), ne se contente pas de deviner ; il traque les indices, lit des pages web et assemble les preuves pour répondre à une question. Pendant longtemps, la façon dont nous enseignions aux détectives était un peu comme noter un film entier en se basant uniquement sur sa scène finale. Si le détective trouvait la bonne réponse à la fin, tout le film recevait une étoile d'or. S'il se trompait, tout le film recevait un « F » rouge.

Mais voici le problème : parfois, le détective trouve un indice brillant au milieu du film mais se trompe dans la réponse finale parce qu'il s'est laissé embrouiller plus tard. D'autres fois, il tombe sur la bonne réponse par chance sans jamais avoir trouvé la véritable preuve. L'ancienne méthode ne pouvait pas faire la différence. Elle attribuait le même crédit (ou le même blâme) à chaque mouvement du détective, même aux mouvements insignifiants. Les auteurs de ce papier appellent cela le « décalage de crédit de récompense » (reward-credit mismatch). C'est comme un professeur qui donnerait une mauvaise note à un étudiant pour l'ensemble d'une dissertation simplement parce que la conclusion est fausse, même si l'étudiant a rédigé trois paragraphes de recherche parfaits au milieu.

La Grande Idée : STAMP
Les chercheurs proposent une nouvelle méthode d'entraînement appelée STAMP (Step-level Trace-guided Advantage Modulation with Provenance). Voyez STAMP comme un critique de cinéma super observateur qui regarde le film du détective image par image.

Au lieu de regarder seulement la réponse finale, STAMP pose deux questions spécifiques :

  1. Le détective a-t-il réellement trouvé la bonne preuve ? (A-t-il trouvé la personne ou le fait spécifique qu'il recherchait ?)
  2. Quel mouvement spécifique a révélé cette preuve pour la première fois ? (L'a-t-il trouvé en tapant une requête de recherche, ou en cliquant sur un lien ?)

STAMP utilise un « vérificateur basé sur une référence » — essentiellement un contrôleur intelligent qui examine les documents trouvés par le détective et demande : « Ce document prouve-t-il réellement le fait recherché ? » Si c'est le cas, STAMP remonte ce document jusqu'au moment précis où le détective l'a vu pour la première fois. Ce moment précis reçoit un « boost de crédit ».

Comment ça fonctionne sans casser le film
C'est là que réside l'astuce : STAMP ne change pas la note finale du film. Si le détective se trompe toujours dans sa réponse finale, le film reste un échec. Mais STAMP utilise une « modulation d'avantage préservant le signe » (sign-preserving advantage modulation) pour ajuster l'entraînement.

Imaginez le détective sur des montagnes russes. Si la course est un succès (avantage positif), STAMP donne un petit boost supplémentaire aux moments spécifiques où il a trouvé de bons indices, rendant ces mouvements encore plus gratifiants. Si la course est un crash (avantage négatif), STAMP ne punit pas les bons mouvements aussi durement. Il dit : « D'accord, la mission a échoué, mais cette requête de recherche que tu as faite était en fait brillante — ne supprimons pas cette leçon. » Cela garantit que le détective apprend exactement quels mouvements de recherche fonctionnent, sans confondre la leçon avec le résultat final.

Ce que le papier dit que ce n'est PAS
Les auteurs sont très clairs sur ce que cette méthode n'est pas. Ils s'opposent à l'idée selon laquelle nous devrions inventer des systèmes de récompense complexes pour chaque étape de la recherche. Ils rejettent également l'idée que nous devions deviner quels mouvements étaient bons sans preuve. STAMP repose sur des preuves avérées : si le document n'est pas là, ou si le vérificateur dit qu'il ne soutient pas le fait, aucun crédit n'est accordé. Ils affirment explicitement que le simple fait d'ajouter des bonus aléatoires aux étapes ne fonctionne pas, car les anciens systèmes les compensent de toute façon.

Les Résultats : Est-ce que ça marche ?
L'équipe a testé STAMP sur trois ensembles de défis : BrowseComp, BrowseComp-ZH (une version chinoise) et xbench-DS. Ils ont comparé STAMP à une méthode d'entraînement standard appelée GRPO en utilisant exactement le même modèle de départ, les mêmes données d'entraînement et les mêmes outils de recherche.

Les résultats ont montré que STAMP améliore systématiquement les performances du détective :

  • Sur BrowseComp, la précision a augmenté de +2,0 points.
  • Sur BrowseComp-ZH, elle a bondi de +5,5 points.
  • Sur xbench-DS, elle s'est améliorée de +3,0 points.

Le papier suggère que ces gains se produisent parce que STAMP capture des « joyaux cachés » — des étapes qui ont trouvé des preuves utiles même dans des tentatives ratées — que l'ancienne méthode ignorait. En fait, ils ont découvert que dans les tentatives correctes, 83,5 % des étapes ne produisaient aucune preuve utile, tandis que dans les tentatives erronées, 7,0 % des étapes trouvaient des indices utiles. STAMP corrige cela en récompensant les étapes utiles, quel que soit le résultat final.

À quel point en sont-ils sûrs ?
Les auteurs sont confiants dans ces chiffres car ils ont mené des expériences contrôlées où tout était identique, à l'exception de la méthode d'entraînement. Ils ont également réalisé des « études d'ablation » (qui consistent à démonter la machine pour voir quelle pièce fait quoi) et ont constaté que chaque partie de STAMP — le vérificateur, le traçage de la première exposition et la modulation spéciale — a contribué au succès.

Cependant, ils notent une limite : ils n'ont testé cela que sur une taille de modèle spécifique (Qwen3-30B). Ils suggèrent que, bien que cela fonctionne bien pour ce cas, il n'est pas encore prouvé que cette méthode fonctionne aussi bien sur des modèles beaucoup plus grands (comme 70B+). Ainsi, bien que les résultats soient solides pour les tests effectués, le plein potentiel pour des cerveaux plus gros reste une question ouverte.

En résumé, STAMP apprend aux détectives IA à apprécier le voyage, et pas seulement la destination, en accordant du crédit aux mouvements spécifiques qui ont réellement mis au jour la vérité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →