← Derniers articles
💬 NLP

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search introduit un cadre d'auto-distillation rétrospective en ligne qui permet aux agents de raisonnement augmentés par la recherche de générer internement des signaux de supervision au niveau des étapes en entraînant un modèle étudiant à imiter un enseignant conditionné par la rétrospection, surmontant ainsi les limites d'attribution du crédit du renforcement par récompense de résultat sans nécessiter d'enseignants externes ni d'annotations supplémentaires.

Auteurs originaux : Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

Publié 2026-05-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un élève comment résoudre une énigme complexe. L'élève possède une bibliothèque (l'internet) qu'il peut consulter, mais il ne sait pas quoi demander au bibliothécaire.

Dans l'état actuel de la recherche en intelligence artificielle, la plupart des méthodes d'entraînement ressemblent à un enseignant qui ne note l'élève que sur la réponse finale.

  • Le Problème : Si l'élève obtient la bonne réponse, l'enseignant dit : « Excellent travail ! » Mais si l'élève a eu de la chance avec une mauvaise question et une réponse heureuse, l'enseignant dit toujours « Excellent travail ! » L'élève n'apprend jamais que sa question spécifique était en réalité terrible. Il sait simplement que le résultat était bon. Cela s'appelle la « Récompense de résultat ».
  • L'Ancienne Solution : Certains chercheurs ont tenté de résoudre ce problème en engageant un « Détective Maître » surdoué et coûteux (une immense IA externe) pour surveiller l'élève et dire : « C'était une bonne question », ou « C'était une mauvaise ». Cela fonctionne, mais c'est incroyablement coûteux et lent, car vous avez besoin de ce géant Détective Maître pour chaque session d'entraînement.

SD-Search est une nouvelle méthode ingénieuse pour enseigner à l'élève sans avoir besoin du coûteux Détective Maître. Voici comment cela fonctionne, en utilisant une analogie simple :

La Classe « Voyage dans le Temps »

Imaginez que l'élève passe un examen.

  1. L'Élève (Le « Présent ») : L'élève est assis à son bureau, regardant la question. Il doit décider quoi chercher maintenant, sans savoir s'il aura raison ou tort. Il devine en fonction de ce qu'il sait sur le moment.
  2. L'Enseignant (Le « Futur ») : Maintenant, imaginez le même élève, mais cette fois, il possède un carnet magique de voyage dans le temps. Ce carnet contient les résultats de plusieurs tentatives pour la même question. Il indique : « Dans la tentative A, nous avons demandé « Qui est le père ? » et obtenu la bonne réponse. Dans la tentative B, nous avons demandé « Quelle est la couleur du ciel ? » et obtenu une mauvaise réponse. »

SD-Search utilise ce carnet magique pour créer une version « Enseignant » de l'élève.

  • L'Enseignant regarde la question et lit le carnet. Parce que l'Enseignant sait quelles questions ont mené au succès et lesquelles ont mené à l'échec, il peut dire : « Ah, je vois que demander au sujet du père était le bon mouvement. J'aurais posé cette question. »
  • L'Élève (qui n'a pas encore le carnet) est ensuite invité à copier les choix de l'Enseignant. L'objectif est de faire en sorte que les suppositions de l'Élève correspondent à la sagesse « rétrospective » de l'Enseignant.

Fonctionnement en Pratique

L'article appelle cela « Distillation de soi rétrospective sur politique ». Décomposons cela :

  • Distillation de soi : L'IA s'enseigne elle-même. Elle n'a pas besoin d'un expert extérieur. Elle génère un certain nombre de tentatives (déroulements), examine les résultats, puis utilise les modèles « réussis » pour enseigner la version « élève » d'elle-même.
  • Rétrospective : Elle regarde en arrière ce qui s'est passé après que la décision ait été prise pour juger si la décision était bonne.
  • Sur politique : Elle fait cela en utilisant ses propres données actuelles, et non des données provenant d'une autre IA plus grande.

L'Accent sur les « Requêtes de Recherche »

L'article se concentre spécifiquement sur les requêtes de recherche (les questions que l'IA pose au moteur de recherche).

  • Dans les anciennes méthodes, si la réponse finale était correcte, chaque mot écrit par l'IA (y compris les questions de recherche) recevait un autocollant « bien joué », même si la question de recherche était vague ou erronée.
  • Dans SD-Search, l'IA reçoit un signal spécifique « bien joué » ou « mal joué » pour chaque question de recherche spécifique. Si la question de recherche a mené à une impasse, l'Enseignant (avec le carnet de voyage dans le temps) montre à l'Élève une question différente et meilleure. L'Élève apprend à imiter la meilleure question.

Les Résultats (Le « Tableau d'Affichage »)

Les chercheurs ont testé cela sur sept benchmarks différents de questions-réponses (comme un quiz de culture générale).

  • Performance : Leur méthode (SD-Search) a performé aussi bien que les méthodes coûteuses utilisant un immense IA « Détective Maître » de 72 milliards de paramètres, et mieux que les méthodes qui ne regardent que la réponse finale.
  • Efficacité : Ils ont fait cela sans avoir besoin d'aide extérieure, sans API coûteuses et sans étapes d'entraînement supplémentaires. Ils ont simplement utilisé la boucle d'entraînement standard, ajoutant une petite étape de « voyage dans le temps » où l'IA examine ses propres tentatives passées.
  • Mise à l'échelle : À mesure que le modèle d'IA devenait plus grand (de 3 milliards à 7 milliards de paramètres), cette méthode d'auto-enseignement continuait de s'améliorer, tandis que les méthodes dépendant du « Détective Maître » commençaient à perdre leur avantage.

En Bref

SD-Search est comme un élève qui, après avoir passé un examen, a la possibilité de consulter la clé de correction et les notes de ses amis qui ont passé l'examen en même temps. Ils repassent ensuite l'examen, en essayant de poser exactement les mêmes questions que les versions « réussies » d'eux-mêmes. Ils apprennent de leurs propres erreurs et succès passés, devenant plus intelligents sans jamais avoir besoin d'un enseignant humain ou d'un super-ordinateur pour leur dire quoi faire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →