← Derniers articles
💬 NLP

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

Le papier introduit MARS, un nouveau cadre d'apprentissage par renforcement multi-agents qui fait coévoluer deux systèmes cognitifs (intuition rapide et raisonnement délibéré) pour surmonter l'inefficacité des jetons et les limites de connaissances des grands modèles de raisonnement, atteignant des performances de pointe sur des tâches intensives en connaissances sans ajustement fin supervisé.

Auteurs originaux : Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

Publié 2026-02-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xie, Wayne Xin Zhao, Ruihua Song, Fei Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème Majeur : L'« Hyper-Réfléchisseur » et la Bibliothèque « Dépassée »

Imaginez que vous avez un assistant brillant et super intelligent (une IA) qui est excellent pour résoudre des énigmes difficiles. Cependant, cet assistant présente deux défauts majeurs :

  1. L'Hyper-Réfléchisseur : Lorsque vous lui demandez de lire un simple article de presse ou de résumer une page web, il se retrouve parfois bloqué en mode « réflexion profonde ». Il analyse chaque mot, gaspillant temps et énergie pour des choses qui ne nécessitent pas d'analyse approfondie. C'est comme utiliser un marteau-piqueur pour casser une noix.
  2. La Bibliothèque Dépassée : Les connaissances de cet assistant s'arrêtent au jour où il a été entraîné. Si vous lui posez une question sur quelque chose qui s'est passé hier, il est totalement dépassé. Il ne peut pas effectuer de recherches par lui-même sans être confus par le volume massif de nouvelles informations.

La Solution : MARS (L'Équipe des Deux Cerveaux)

Les chercheurs ont créé un nouveau système appelé MARS. Au lieu d'un seul cerveau essayant de tout faire, ils ont construit une équipe de deux « personnalités » distinctes travaillant à l'intérieur de la même IA, inspirées par le fonctionnement du cerveau humain :

  • Système 1 (L'Éclaireur Rapide) : C'est le cerveau « intuitif ». Il est rapide, efficace et doué pour le balayage. Son travail consiste à regarder une montagne de nouvelles informations (comme 10 pages web différentes ou des articles de recherche) et à en extraire rapidement les faits les plus importants. C'est comme un éclaireur qui court en avant, ramasse les fournitures utiles et laisse derrière lui les déchets.
  • Système 2 (Le Penseur Profond) : C'est le cerveau « délibéré ». Il est lent, prudent et excellent pour résoudre des énigmes logiques complexes. Il prend les faits propres et distillés par le Système 1 et les utilise pour résoudre le problème réel.

Le Tour de Magie :
Dans les systèmes précédents, l'« Éclaireur » et le « Penseur » étaient entraînés séparément. L'Éclaireur ne savait pas ce dont le Penseur avait besoin, donc il pouvait résumer des choses dont le Penseur n'avait cure, ou manquer les détails dont le Penseur avait désespérément besoin.

Dans MARS, ils co-évoluent. Ils s'entraînent ensemble. L'Éclaireur apprend exactement quel type d'information aide le Penseur à résoudre l'énigme, et le Penseur apprend à demander à l'Éclaireur les bonnes choses. Ils partagent le même « score » (récompense), de sorte qu'ils forment une équipe parfaite plutôt que deux étrangers.

Comment ils s'entraînent : Le « Jeu de Groupe »

Pour apprendre à ces deux systèmes à travailler ensemble sans enseignant humain (une méthode appelée « Zero RL », signifiant qu'ils partent de zéro sans exemples préécrits), les chercheurs ont utilisé un jeu d'entraînement astucieux basé sur l'Optimisation de Politique Relative de Groupe (GRPO).

Voyez cela comme une équipe de sport s'entraînant pour un championnat :

  1. Le Briefing d'Équipe (Bin-Packing) : Lorsque l'équipe sort pour collecter des informations, elle peut trouver 10 pages web différentes. C'est trop à lire d'un coup. Le système utilise une stratégie de « Bin-Packing » (comme ranger des courses dans des sacs). Il organise ces pages désordonnées de tailles différentes en blocs nets et gérables afin que l'Éclaireur puisse toutes les lire en même temps sans être submergé.
  2. Le Tableau des Scores (Récompenses Partagées) : L'équipe sort et tente de résoudre un problème. S'ils trouvent la bonne réponse, à la fois l'Éclaireur et le Penseur reçoivent un point. S'ils échouent, aucun des deux ne reçoit de point. Cela les force à coopérer.
  3. Le Jeu Équitable (Gradients Découplés) : C'est la partie délicate. Même s'ils partagent le score, les chercheurs se sont assurés que l'Éclaireur reçoive le crédit pour bien résumer et le Penseur pour bien raisonner. C'est comme une course de relais : si l'équipe gagne, les deux coureurs reçoivent une médaille, mais l'entraîneur sait exactement qui a couru la première étape et qui a couru la seconde. Cela garantit que l'Éclaireur apprenne à être un meilleur Éclaireur, et pas seulement un meilleur Penseur.
  4. L'Équilibre de l'Équipe (Échantillonnage Équilibré) : Parfois, l'Éclaireur doit lire 5 pages, et d'autres fois seulement 1. Cela crée un déséquilibre dans les données d'entraînement. Le système utilise une méthode d'échantillonnage spéciale pour s'assurer que l'Éclaireur et le Penseur bénéficient d'un temps de pratique égal, afin que l'un ne domine pas le processus d'apprentissage.

Les Résultats : Une Petite Équipe, de Grandes Victoires

Les chercheurs ont testé MARS sur un examen très difficile appelé HLE (Humanity's Last Exam), qui couvre des sujets avancés en sciences, mathématiques et histoire.

  • L'Underdog : MARS a utilisé un modèle relativement petit (8 milliards de paramètres).
  • Les Géants : Ils l'ont comparé à des modèles beaucoup plus grands (32 ou 72 milliards de paramètres) et même à certains modèles propriétaires de « super-intelligence » coûteux provenant de grandes entreprises technologiques.
  • Le Résultat : MARS a battu les modèles plus grands qui avaient été pré-entraînés avec des exemples humains (Apprentissage Supervisé). Il s'est même approché très près des performances des modèles commerciaux les plus avancés disponibles, malgré un départ avec zéro guidage humain et l'utilisation d'un cerveau beaucoup plus petit.

Pourquoi cela importe (selon l'article)

L'article affirme que la recette secrète n'est pas seulement d'avoir plus d'outils (comme des moteurs de recherche ou des calculatrices) ; c'est le partenariat.

  • Sans l'« Éclaireur » (Système 1), le « Penseur » est submergé par trop de données brutes et commet des erreurs.
  • Sans le « Penseur » (Système 2), l'« Éclaireur » se contente de résumer les choses sans résoudre le problème réel.
  • Ensemble, ils créent un système capable de lire une quantité massive d'informations actualisées et d'utiliser ces informations pour résoudre des problèmes de raisonnement complexes à plusieurs étapes de manière efficace.

En bref, MARS apprend à une IA quand « scanner rapidement » et quand « réfléchir profondément », et comment faire les deux ensemble sans s'embrouiller.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →