← Derniers articles
💬 NLP

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

Cette étude démontre qu'aucun paradigme de raisonnement unique ne domine tous les tâches et propose une approche « sélectionner puis résoudre » utilisant un routeur appris pour choisir dynamiquement le meilleur paradigme par tâche, surpassant ainsi les stratégies fixes et l'auto-choix zéro-shot.

Auteurs originaux : Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zh
Publié 2026-04-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zhenfei Yin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un super-cerveau artificiel (un modèle de langage) capable de résoudre des problèmes. La question que se posent les auteurs de cette étude est la suivante : Est-ce que ce cerveau devient plus intelligent tout seul, ou est-ce que c'est la façon dont on lui demande de réfléchir qui fait toute la différence ?

Pour répondre, ils ont mené une expérience gigantesque, un peu comme un grand tournoi de cuisine.

1. Le Tournoi des 6 Recettes (Les Paradigmes)

Imaginez que votre modèle de langage est un chef cuisinier très doué. Les chercheurs ont testé 6 façons différentes de lui donner ses ordres pour préparer le même plat (résoudre le même problème) :

  1. Direct : "Cuisinez-moi ce plat, vite fait, sans réfléchir." (Le chef utilise son instinct).
  2. CoT (Chain-of-Thought) : "Expliquez-moi chaque étape de votre recette avant de servir." (Le chef doit parler pendant qu'il cuisine).
  3. ReAct : "Pensez, puis agissez (par exemple, allez chercher un ingrédient sur Internet), puis pensez à nouveau." (Le chef va faire des courses en cours de route).
  4. Plan-Execute : "D'abord, écrivez un plan détaillé, puis exécutez-le." (Le chef dessine un schéma avant de toucher aux casseroles).
  5. Reflection : "Cuisinez, puis critiquez votre plat, puis corrigez-le si nécessaire." (Le chef goûte, trouve des défauts, et remodifie).
  6. ReCode : "Écrivez un programme informatique pour cuisiner ce plat." (Le chef utilise un robot pour faire la cuisine).

2. La Grande Surprise : Une recette ne convient pas à tout !

Le résultat le plus fou de l'étude, c'est qu'aucune de ces 6 méthodes n'est la meilleure pour tout le monde. C'est comme si vous utilisiez la même recette pour faire un gâteau, une soupe et un steak. Ça ne marche pas toujours !

  • Quand ça marche : Pour des questions qui demandent de chercher des infos récentes sur Internet (comme "Qui a gagné le match hier ?"), la méthode ReAct (qui va chercher les infos) est un champion. Elle bat la méthode "Direct" de 44 points !
  • Quand ça échoue : Pour des tâches de code informatique, forcer le chef à "expliquer chaque étape" (méthode CoT) le perturbe et il fait plus d'erreurs. Ici, la méthode "Direct" est meilleure.
  • Le coût : Certaines méthodes sont très gourmandes. La méthode "Reflection" (goûter et corriger) consomme presque 10 fois plus d'énergie (de "tokens") que la méthode simple, pour parfois gagner très peu de points.

3. Le Problème du "Chef Unique"

Jusqu'à présent, les entreprises choisissaient une seule méthode et l'appliquaient à tous les problèmes. C'est comme si un restaurant décidait de toujours servir des pâtes, même quand le client veut un steak. C'est inefficace.

Les chercheurs ont calculé un scénario idéal : "Et si on pouvait choisir la meilleure recette pour chaque client individuellement ?"
Résultat : Si on avait un oracle (un magicien) qui choisissait la bonne méthode à chaque fois, la performance aurait bondi de 17 points par rapport à la meilleure méthode fixe. C'est énorme !

4. La Solution : Le "Sommelier" (Le Routeur)

Puisqu'on ne peut pas avoir un magicien, les auteurs ont créé un petit assistant intelligent, qu'ils appellent un "routeur".

Imaginez un sommelier dans un restaurant.

  • Le client arrive avec sa commande (le problème).
  • Le sommelier regarde la commande, sent le parfum du problème, et dit : "Ah, pour ce plat-là, on va utiliser la méthode 'ReAct' car il faut chercher des infos. Mais pour celui-ci, on va faire 'Direct' car c'est simple."
  • Il envoie la tâche au bon "chef" (la bonne méthode).

Les résultats du Sommelier :

  • Il a amélioré la performance moyenne de tous les modèles de 5,5 points.
  • Il a récupéré 37 % du gain qu'aurait eu le magicien (l'oracle).
  • Et le plus beau : il est moins cher que d'utiliser toujours la méthode la plus complexe. Il sait quand ne pas utiliser de méthode compliquée.

5. Pourquoi les modèles ne peuvent pas se choisir eux-mêmes ?

Les chercheurs ont aussi demandé aux modèles de choisir leur propre méthode (sans le sommelier).

  • Le modèle le plus puissant (GPT-5) a réussi à faire un peu mieux tout seul.
  • Les modèles plus faibles ont échoué lamentablement. Ils ont tendance à choisir la méthode la plus "bruyante" (comme celle qui utilise beaucoup d'outils) même quand ce n'est pas nécessaire, comme un élève qui crie pour montrer qu'il travaille, alors qu'il devrait juste écrire la réponse.

En résumé

Cette étude nous apprend que l'intelligence ne vient pas seulement du modèle, mais de la stratégie.

Au lieu de construire un seul robot super-complexe qui essaie de tout faire, il vaut mieux avoir un système intelligent qui sait choisir l'outil adapté à la tâche.

  • Parfois, il faut réfléchir longuement.
  • Parfois, il faut aller chercher des infos.
  • Parfois, il faut juste répondre directement.

Le secret des agents IA les plus performants de demain ne sera pas d'avoir le cerveau le plus gros, mais d'avoir le meilleur chef d'orchestre pour savoir quand utiliser quel instrument.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →