← Derniers articles
💬 NLP

Cross-Domain Hybrid OPD for Generalizable Search Agents

Cet article introduit un cadre d'entraînement hybride pour l'agent de recherche Yuanbao qui utilise la distillation On-Policy d'experts inter-domaines afin d'atteindre des capacités de recherche spécialisées sans sacrifier, et même en améliorant, l'intelligence généraliste, atténuant ainsi la taxe d'alignement typique associée à l'optimisation par apprentissage par renforcement.

Auteurs originaux : Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Publié 2026-08-04
📖 10 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où votre assistant IA préféré est comme un étudiant brillant qui vient d'apprendre à devenir un maître détective. Cet étudiant peut parcourir Internet, relier les points entre différents articles de presse et trouver des faits cachés plus vite que n'importe qui. Mais il y a un piège : en devenant un super-détective, il a commencé à oublier comment écrire un poème drôle, résoudre une énigme mathématique complexe ou simplement discuter normalement de sa journée. C'est le problème de la « spécialisation » dans le monde de l'intelligence artificielle. Les scientifiques appellent le prix que vous payez pour devenir très bon dans une chose spécifique la « taxe d'alignement ». C'est comme si un chef devenait tellement obsédé par la perfection de sa soupe qu'il en oubliait comment faire un gâteau. La grande question pour les chercheurs est la suivante : pouvons-nous entraîner une IA à être un expert de la recherche de classe mondiale sans qu'elle oublie comment être un ami utile et polyvalent ?

C'est exactement ce que l'équipe de Tencent Yuanbao a cherché à résoudre dans son nouveau rapport technique. Ils ont construit un agent IA intelligent conçu pour traquer l'information sur le Web, mais ils craignaient que le fait de l'entraîner à chercher si intensément ne la rende « stupide » pour tout le reste. Pour corriger cela, ils ont inventé une méthode d'entraînement astucieuse en deux étapes. D'abord, ils ont appris à l'IA à être une pro de la recherche grâce à une technique appelée apprentissage par renforcement, qui consiste à laisser l'IA jouer à un jeu où elle gagne des points en trouvant les bonnes réponses. Ensuite, pour empêcher l'IA de perdre son intelligence générale, ils ont utilisé une méthode appelée « Distillation hybride sur politique (On-Policy) inter-domaines ». Voyez cela comme l'embauche de quatre tuteurs géniaux différents — un pour les mathématiques, un pour le codage, un pour la logique et un pour les sciences — pour réapprendre à l'IA experte en recherche à redevenir un étudiant bien équilibré. Le résultat ? Une IA capable de trouver des informations sur le Web aussi bien que la version spécialisée, et bien qu'elle n'est pas devenue un génie des mathématiques sur chaque test, elle a récupéré la majeure partie de son terrain perdu et est même devenue meilleure qu'avant dans plusieurs domaines clés comme le raisonnement logique et le codage. Ils n'ont pas seulement résolu le problème ; ils ont rendu l'IA plus intelligente dans de nombreux domaines en même temps, sans sacrifier ses compétences de recherche.

Le détective qui a oublié comment jongler

Plongeons dans l'histoire de l'agent de recherche Yuanbao. Imaginez que vous avez un robot nommé « Search-Bot ». Vous voulez que Search-Bot soit le meilleur pour trouver des réponses sur Internet. Alors, vous le placez dans une aire de jeux virtuelle où il doit résoudre des mystères en cliquant sur des liens, en lisant des articles et en posant des questions. C'est ce qu'on appelle l'Apprentissage par Renforcement (RL). C'est comme dresser un chien : chaque fois que Search-Bot trouve la bonne information, il reçoit une friandise (une récompense). Chaque fois qu'il se perd, il reçoit un léger « non ».

Après un certain temps, Search-Bot devient incroyable pour trouver des choses. Mais voici la partie étrange : à mesure qu'il devient meilleur en recherche, il commence à devenir moins bon dans d'autres domaines. Il oublie comment résoudre un problème de mathématiques simple ou écrire une histoire créative. Le papier appelle cela la Taxe d'Alignement. C'est comme si vous passiez chaque jour à pratiquer vos coups de pied au football jusqu'à ce que vos jambes soient super fortes, mais que vous oubliiez comment marcher en ligne droite parce que vous ne pratiquiez plus jamais la marche. L'IA est devenue si spécialisée dans la « recherche » qu'elle a perdu sa puissance cérébrale « générale ».

La mission de sauvetage en deux étapes

L'équipe de Tencent a réalisé que simplement apprendre à Search-Bot à chercher plus fort n'était pas la solution. Ils avaient besoin d'un moyen de conserver les compétences de recherche et de ramener l'intelligence générale. Ils ont donc élaboré un plan d'entraînement en deux étapes.

Étape 1 : Le camp d'entraînement de recherche
D'abord, ils ont pris leur modèle d'IA de base (un modèle intelligent appelé Hunyuan3) et l'ont envoyé au « Camp d'entraînement de recherche ». Ici, l'IA ne pratiquait que la recherche. Elle a appris à planifier ses mouvements, à utiliser des outils comme la recherche web et la recherche d'images, et à assembler des informations provenant de différents endroits. Comme prévu, elle est devenue très douée pour la recherche. Mais, comme le prédit le document, elle a commencé à perdre son talent pour les mathématiques, les sciences et la logique. La « Taxe d'Alignement » a frappé fort.

Étape 2 : Le mélange des « Super-Tuteurs »
C'est ici que la magie opère. Au lieu de simplement laisser l'IA échouer en mathématiques, l'équipe a fait appel à quatre Enseignants Experts. Ce n'étaient pas n'importe quels enseignants ; c'étaient des modèles d'IA super spécialisés formés spécifiquement sur :

  1. Les Mathématiques (résoudre des équations complexes)
  2. Le Codage (écrire des programmes informatiques)
  3. La Logique (résoudre des énigmes et raisonner)
  4. Les Sciences (comprendre le monde naturel)

L'équipe a utilisé une technique appelée Distillation sur Politique (On-Policy Distillation - OPD). C'est une façon sophistiquée de dire : « Laissons l'étudiant (Search-Bot) essayer de résoudre un problème, puis demandons à l'Enseignant Expert de regarder et de dire : "Hé, tu l'as fait de cette façon, mais voici une meilleure façon de réfléchir à cela." »

Le truc cool, c'est qu'ils n'ont pas seulement enseigné les mathématiques ou la recherche à l'IA. Ils les ont mélangées ! Dans chaque session d'entraînement, l'IA s'exerçait à chercher un fait, puis pratiquait immédiatement la résolution d'un problème mathématique ou l'écriture d'un code, tout en étant guidée par le bon Enseignant Expert. C'était comme un étudiant qui va à l'entraînement de football le matin et qui va ensuite à ses cours de piano l'après-midi, mais le professeur de piano surveille aussi l'entraînement de football pour s'assurer que l'étudiant reste concentré et discipliné.

Les résultats : Le meilleur des deux mondes

L'équipe a testé leur nouvelle IA « Hybride » contre les anciennes versions. Voici ce qu'ils ont trouvé :

  • Les Compétences de Recherche : La nouvelle IA est aussi douée pour la recherche que celle qui ne pratiquait que la recherche. En fait, sur certains tests de recherche difficiles, elle est même devenue meilleure ! Elle peut toujours trouver des informations sur le web, planifier des recherches complexes et suivre des instructions parfaitement.
  • Les Compétences Générales : C'est la grande victoire. L'IA qui ne pratiquait que la recherche était devenue moins bonne en mathématiques et en logique. Mais l'IA Hybride ? Elle n'a pas seulement retrouvé son niveau normal ; elle a réalisé des progrès significatifs et des améliorations dans de nombreux domaines.
    • Sur les tests de Raisonnement Logique, l'IA Hybride a progressé de manière fulgurante (passant d'un score de 33,95 à 46,90).
    • Sur les tâches de Codage, elle est passée de 67,74 à 74,15, battant même le modèle « de base » original.
    • Sur les problèmes de Mathématiques, elle a récupéré presque tout le terrain perdu et a même surpassé le modèle original sur certains tests difficiles (comme AIME25 et Math IMO AnswerBench). Cependant, sur quelques benchmarks extrêmement exigeants comme Minerva Math et Frontier Science Olympiad, elle est restée légèrement en dessous de la performance du modèle de base original.
    • Sur les benchmarks de Sciences, elle a enregistré de forts gains, atteignant la précision la plus élevée sur GPQA Diamond.

Le document montre que la « Taxe d'Alignement » n'est pas un prix définitif que vous devez payer. En utilisant ces Enseignants Experts pour guider l'IA pendant qu'elle apprend à chercher, ils ont réussi à « annuler » la majeure partie des dégâts. L'IA n'a pas eu à choisir entre être un détective et être un génie ; elle est devenue un détective qui est aussi très doué pour être un étudiant, même si elle n'est pas parfaite sur absolument tous les problèmes mathématiques de l'univers.

Pourquoi cela importe

Vous pourriez vous demander : « Et alors ? Pourquoi est-ce important qu'une IA s'améliore en mathématiques ? » Eh bien, imaginez que vous demandiez à votre assistant IA : « Je visite Paris pendant trois jours. Je veux voir la Tour Eiffel et Disneyland, mais je ne veux pas passer plus de 30 minutes à voyager entre les lieux. »

Si l'IA n'avait reçu que l'entraînement « Recherche Uniquement », elle pourrait trouver les lieux mais vous donner un itinéraire terrible qui n'a aucun sens, ou elle pourrait oublier de calculer correctement le temps de trajet parce qu'elle s'est trop concentrée sur la simple recherche des noms de lieux.

Mais avec l'entraînement Hybride, l'IA peut :

  1. Chercher les lieux et les temps de trajet (en utilisant ses compétences de recherche).
  2. Raisonner sur la géographie et calculer si le plan respecte votre règle des 30 minutes (en utilisant sa logique et ses mathématiques).
  3. Écrire un itinéraire clair, amical et détendu pour vous (en utilisant ses compétences linguistiques générales).

Le document suggère que cette approche « Hybride » est la clé pour construire des agents d'IA qui sont véritablement utiles dans le monde réel. Ils doivent pouvoir trouver des informations, certes, mais ils doivent aussi être assez intelligents pour utiliser ces informations pour résoudre des problèmes, écrire des histoires et nous aider dans notre vie quotidienne sans perdre la tête dans le processus.

La recette secrète : Comment ils ont fait

L'équipe n'a pas simplement tout jeté dans un mixeur. Ils ont été très prudents quant à la manière dont ils enseignaient aux Enseignants Experts. Ils ont utilisé une stratégie d'« Apprentissage par Curriculum ». Cela signifie qu'ils n'ont pas commencé par donner aux enseignants les problèmes mathématiques les plus difficiles et les plus impossibles. Au lieu de cela, ils ont commencé par des problèmes de difficulté moyenne pour construire une base solide, puis ont introduit progressivement les sujets les plus complexes.

Ils ont découvert que s'ils sautaient cette étape et jetaient simplement les problèmes les plus durs aux enseignants, les enseignants (et l'IA étudiante) n'apprenaient pas aussi bien. Le « Curriculum » a aidé les enseignants à mieux expliquer les choses, ce qui a permis à l'IA étudiante d'apprendre plus vite et plus intelligemment.

L'essentiel à retenir

L'équipe de Tencent Yuanbao nous a montré que vous n'avez pas à sacrifier l'intelligence générale pour obtenir un agent de recherche spécialisé. En mélangeant l'Apprentissage par Renforcement (pour la recherche) avec la Distillation sur Politique (l'apprentissage auprès de tuteurs experts), ils ont créé une IA qui est à la fois un maître détective et un brillant étudiant polyvalent.

Ils ont prouvé que la « Taxe d'Alignement » peut être évitée. L'IA ne s'est pas contentée de ne plus empirer ; elle est même devenue meilleure dans la plupart des domaines, récupérant ses compétences perdues et surpassant même son moi original dans des domaines comme le codage et le raisonnement logique. Bien qu'elle n'ait pas remporté tous les concours de mathématiques, elle est devenue un assistant beaucoup plus capable et polyvalent dans l'ensemble. C'est un peu comme trouver un moyen d'entraîner un super-héros à voler sans lui faire oublier comment marcher. Et dans un monde où nous voulons que notre IA soit utile, intelligente et polyvalente, c'est une très grande avancée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →