OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning
OPDSearch+ est un nouveau cadre à deux étapes qui permet aux petits modèles de langage d'exceller dans le raisonnement assisté par recherche en distillant d'abord des compétences à partir d'un enseignant prêt à l'emploi gelé via l'apprentissage on-policy, puis en affinant l'étudiant avec l'apprentissage par renforcement, surmontant ainsi les coûts de collecte de données et les plafonds de performance des méthodes antérieures.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle en évolution rapide, les chercheurs tentent constamment d'apprendre aux programmes informatiques à penser davantage comme les humains, surtout lorsqu'il s'agit de trouver des réponses dans un vaste océan d'informations. Pendant des années, l'approche standard a consisté à entraîner des modèles massifs et coûteux qui mémorisent des faits, mais ces systèmes éprouvent souvent des difficultés lorsqu'ils doivent rechercher de nouvelles informations ou relier des points entre différents sujets. Une voie plus prometteuse implique le « raisonnement augmenté par la recherche », où un modèle apprend à poser des questions, à lire les réponses qu'il trouve, puis à synthétiser une réponse finale. Cependant, apprendre à de plus petits modèles, plus efficaces, à faire cela a été un problème persistant. La méthode habituelle nécessite un modèle « enseignant » qui est déjà un expert en recherche, mais entraîner un tel enseignant pour chaque tâche spécifique est incroyablement coûteux et lent. De plus, le simple fait de copier les réponses d'un enseignant échoue souvent car le modèle étudiant se retrouve coincé dans une boucle de ses propres erreurs, incapable d'apprendre de la nature dynamique et en temps réel d'un moteur de recherche en direct.
Une équipe de chercheurs a introduit une nouvelle méthode appelée OPDSearch+ qui résout ces problèmes en changeant la façon dont l'étudiant apprend. Au lieu de s'appuyer sur un enseignant qui a été spécialement entraîné pour une tâche spécifique, ils utilisent un modèle puissant et préexistant qui est maintenu « gelé », ce qui signifie qu'il ne change pas pendant le processus. Cet enseignant agit comme un guide, non pas en donnant la réponse finale, mais en observant l'étudiant lorsqu'il interagit avec un moteur de recherche en direct. À mesure que l'étudiant pose des questions et lit les résultats, l'enseignant fournit un retour immédiat et étape par étape sur chaque mot généré par l'étudiant. Ce feedback aide l'étudiant à comprendre non seulement quelle est la bonne réponse, mais aussi comment décomposer une question complexe, comment formuler une requête de recherche et comment tisser les informations trouvées dans un argument logique.
Le processus se déroule en deux étapes distinctes. Premièrement, le modèle étudiant apprend de la guidance de l'enseignant pendant qu'il recherche activement des informations. Cette étape est cruciale car elle enseigne à l'étudiant les habitudes d'un bon chercheur — comment décomposer un problème et intégrer des preuves — sans que l'étudiant n'ait jamais besoin de voir l'historique de recherche de l'enseignant. Les chercheurs ont découvert que cet entraînement initial remodèle le comportement de l'étudiant, créant une base bien plus solide que de partir de zéro. Dans la seconde étape, l'étudiant est affiné à l'aide d'une technique qui le récompense pour avoir trouvé la bonne réponse finale. Parce que l'étudiant a commencé avec une base aussi solide grâce à la première étape, il est capable d'apprendre beaucoup plus rapidement et d'atteindre un niveau de performance qu'il ne pourrait jamais atteindre seul.
Les résultats de cette approche sont frappants. Lors de tests sur sept benchmarks différents de questions-réponses, la nouvelle méthode a permis à un modèle relativement petit, de seulement trois milliards de paramètres, de surpasser tous les modèles précédents de même taille. Sur des tâches complexes nécessitant de relier plusieurs morceaux d'information, l'amélioration a été particulièrement spectaculaire, le modèle atteignant une augmentation de treize points de précision sur un test majeur et de huit points sur un autre. Les chercheurs ont démontré que cette méthode n'est pas seulement un ajustement mineur, mais un changement fondamental dans la manière dont les petits modèles peuvent apprendre à raisonner avec des outils de recherche. En utilisant un enseignant prêt à l'emploi et gelé pour guider l'étudiant à travers des interactions en temps réel, ils ont créé un système qui est à la fois hautement efficace et remarquablement performant, prouvant qu'un petit modèle peut apprendre à penser profondément et à chercher judicieusement sans avoir besoin d'un entraînement spécifique à la tâche et coûteux.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.