Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning
Search-E1 est une méthode d'auto-évolution qui améliore les agents de raisonnement augmentés par la recherche en utilisant uniquement le GRPO standard et la distillation autonome hors ligne pour atteindre des performances de pointe sur les benchmarks de questions-réponses sans dépendre d'une supervision externe complexe ni de modules auxiliaires.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un étudiant très intelligent mais légèrement maladroit (l'IA) qui tente de répondre à des questions de culture générale piégeuses. Pour trouver la bonne réponse, cet étudiant a le droit d'utiliser une bibliothèque (un moteur de recherche) pour consulter des faits, mais il doit décider quand chercher et quoi demander.
La plupart des méthodes actuelles enseignent à cet étudiant en attendant qu'il termine tout son essai. Si la réponse finale est correcte, le professeur lui donne une étoile dorée. Si elle est incorrecte, le professeur lui met une croix rouge. Le problème ? L'étudiant ne sait pas quelle étape précise a été l'erreur. A-t-il posé la mauvaise question ? A-t-il lu le mauvais paragraphe ? S'est-il laissé distraire ? Il sait seulement que toute la tentative a échoué.
Search-E1 est une nouvelle méthode plus simple pour enseigner à cet étudiant. Elle ne nécessite ni un professeur humain surdoué, ni un robot supplémentaire sophistiqué, ni un système de récompense spécial. Au lieu de cela, elle utilise une technique appelée "Auto-évolution" à travers une danse en deux étapes :
Étape 1 : La phase « Tout essayer » (GRPO)
D'abord, on demande la même question à l'étudiant cinq fois.
- Dans une tentative, il pourrait se promener dans la bibliothèque, poser des questions absurdes et échouer.
- Dans une autre tentative, il pourrait poser les questions parfaites, trouver le bon livre et obtenir la bonne réponse rapidement.
Le système examine ces cinq tentatives et déclare : « D'accord, celle qui a obtenu la bonne réponse est la « référence d'or » pour ce tour. » Mais, comme auparavant, cela ne dit à l'étudiant que « Bon travail sur cet essai complet », et non « Bon travail sur cette question précise ».
Étape 2 : La phase « Rembobiner et apprendre » (Auto-distillation hors ligne)
C'est ici que la magie opère. Le système prend la tentative échouée (l'« Étudiant ») et la tentative réussie (le « Professeur »).
Voici l'astuce ingénieuse :
- Le système donne la question originale à l'Étudiant.
- Le système donne la même question au Professeur, mais il lui remet aussi une triche : le chemin complet réussi que l'étudiant a emprunté dans l'autre tentative.
- Le Professeur lit la triche et dit : « Si je devais répondre à cette question maintenant, en connaissant le bon chemin, voici exactement ce que je dirais ensuite. »
- L'Étudiant est alors contraint d'écouter le Professeur et de tenter de reproduire ses mots, étape par étape.
L'Étudiant n'est pas simplement informé « Vous aviez raison/tort ». On lui montre, token par token (mot par mot), exactement comment mieux réfléchir. « Ah, je vois ! Quand j'ai demandé « Qui est le président ? », le Professeur a demandé « Qui était le président en 1990 ? » C'est la différence ! »
Pourquoi est-ce spécial ?
- Pas de professeurs externes : Habituellement, pour obtenir ce niveau de détail, il faut une IA surdouée (comme un modèle de 72 milliards de paramètres) pour noter chaque étape individuelle. Search-E1 utilise les propres tentatives réussies de l'étudiant comme professeur. C'est comme un étudiant qui étudie sa propre copie après avoir obtenu un A, plutôt que d'attendre qu'un professeur la corrige.
- Pas de machinerie supplémentaire : D'autres méthodes ajoutent des outils complexes pour déterminer quelles étapes étaient bonnes. Search-E1 utilise simplement la boucle standard « essayer et réessayer » et ajoute cette étape « étudiez votre propre succès » entre les deux.
- Les résultats : Lorsqu'ils ont testé cela sur sept défis de culture générale différents, l'étudiant utilisant Search-E1 a obtenu des scores nettement supérieurs à ceux d'autres étudiants utilisant des méthodes plus complexes. Il était particulièrement performant sur les questions « multi-sauts » (où vous devez relier plusieurs points), car ces questions comportent de nombreuses étapes où l'on peut se tromper, et cette méthode corrige les étapes spécifiques qui étaient brisées.
En résumé : Search-E1 apprend à une IA à devenir plus intelligente en lui permettant d'échouer, puis en lui faisant étudier ses propres tentatives réussies comme s'il s'agissait d'un manuel parfait, apprenant exactement quoi dire à chaque instant sans avoir besoin d'aide extérieure.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.