← Derniers articles
💬 NLP

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

L'article présente l'optimisation de politique vectorielle (VPO), un algorithme d'apprentissage par renforcement qui entraîne des modèles de langage à générer des solutions diversifiées en exploitant des récompenses à valeur vectorielle, améliorant ainsi considérablement leurs performances dans les procédures de recherche au moment du test par rapport à l'optimisation standard des récompenses scalaires.

Auteurs originaux : Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

Publié 2026-05-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un chef formant un nouvel apprenti pour cuisiner pour un critique culinaire très exigeant. Le critique ne veut pas simplement « un bon repas » ; il a un menu complexe de désirs spécifiques : peut-être veut-il le steak saignant, la sauce épicée, les légumes croquants et la présentation artistique.

L'Ancienne Méthode : Le Chef « Taille Unique »

Dans le passé, lors de la formation des IA (comme les grands modèles de langage), nous utilisions une méthode appelée Optimisation de Récompense Scalaire (représentée dans l'article par GRPO).

Pensez-y comme si vous disiez à l'apprenti : « Votre objectif est d'obtenir le score le plus élevé possible basé sur un seul chiffre : 50 % de qualité de steak + 50 % de qualité de sauce. »

L'apprenti réalise rapidement que pour obtenir le score le plus élevé, il doit arrêter d'expérimenter. Il cuisinera exactement la même combinaison « parfaite » de steak-sauce encore et encore. Il devient un maître d'un plat spécifique.

  • Le Problème : Lorsque le critique arrive réellement, il pourrait dire : « En fait, aujourd'hui, je veux le steak à point et la sauce sucrée. » L'apprenti, n'ayant pratiqué qu'une seule recette spécifique, ne sait pas quoi faire. Il n'a qu'une seule réponse, et c'est la mauvaise pour l'humeur spécifique du jour.

La Nouvelle Méthode : Optimisation de Politique Vectorielle (VPO)

L'article propose une nouvelle méthode de formation appelée Optimisation de Politique Vectorielle (VPO).

Au lieu de donner à l'apprenti un seul score, le formateur dit : « Je vais vous donner une liste d'objectifs différents. Parfois, je veux que vous vous concentriez sur le steak, parfois sur la sauce, parfois sur les légumes. Je veux que vous cuisiniez un plateau de plats différents en une seule fois, où chaque plat est un chef-d'œuvre d'une combinaison différente. »

L'apprenti apprend à créer un ensemble diversifié de solutions :

  1. Plat A : Steak parfait, sauce simple.
  2. Plat B : Steak doux, sauce épicée complexe.
  3. Plat C : Légumes croustillants, présentation artistique.

Ils ne cherchent pas à trouver le seul meilleur plat. Ils tentent de couvrir toute la « carte » des combinaisons délicieuses possibles (ce que l'article appelle la Frontière de Pareto).

La « Recherche au Moment du Test » (Le Critique Arrive)

C'est ici que la magie opère. L'article soutient que dans les systèmes d'IA modernes, l'IA ne se contente pas de cracher une réponse et d'espérer le meilleur. Au contraire, le système agit comme un moteur de recherche au moment de l'utilisation (inférence).

Lorsque le critique arrive avec sa demande spécifique et unique (par exemple, « Je veux le steak saignant mais la sauce sucrée »), le système ne demande pas à l'IA de cuisiner un nouveau plat à partir de zéro. Au lieu de cela, il examine le plateau de plats divers que l'apprenti a préparés pendant la formation.

  • Le Vieux Chef (GRPO) : Le critique examine le plateau. Il est rempli de 100 plats identiques « Steak-Sauce #1 ». Le critique ne peut pas trouver ce qu'il veut.
  • Le Chef VPO : Le critique examine le plateau. Il y a un plat avec un steak saignant et une sauce sucrée ! Le système choisit celui-là.

Pourquoi Cela Compte

L'article a testé cela sur quatre « cuisines » différentes (tâches telles que résoudre des énigmes logiques, naviguer dans des labyrinthes et écrire du code).

  1. Plus de Candidats = Meilleurs Résultats : À mesure que le système avait la possibilité d'examiner plus de plats (un « budget de recherche » plus large), le chef VPO continuait de s'améliorer pour trouver l'adéquation parfaite. La performance du vieux chef a atteint un mur car il n'avait qu'un seul type de plat à offrir.
  2. Résoudre l'Impossible : Dans un défi de codage très difficile (LiveCodeBench), le vieux chef ne pouvait pas résoudre le problème du tout, peu importe le nombre de tentatives. Le chef VPO, en revanche, disposait d'un ensemble diversifié de « tentatives » qui, combinées à un outil de recherche, ont réussi à résoudre le problème.
  3. Le « Piège de la Diversité » : L'article note que si les objectifs sont tous fondamentalement les mêmes (par exemple, « rends-le rouge » et « rends-le bleu » où le rouge et le bleu sont la même chose), la VPO n'aide pas. Elle ne brille que lorsque les objectifs sont vraiment différents et nécessitent des compromis.

La Conclusion

L'article affirme que si vous prévoyez d'utiliser une IA dans un système qui recherche parmi de nombreuses options pour trouver la meilleure, vous ne devriez pas entraîner l'IA à être un « spécialiste » d'une seule réponse parfaite. Au lieu de cela, vous devriez l'entraîner à être un généraliste produisant un portefeuille diversifié d'options de haute qualité.

En permettant à l'IA d'explorer différentes « saveurs » de solutions pendant l'entraînement, vous offrez au système de recherche au moment du test un menu beaucoup plus riche à choisir, conduisant à des résultats plus intelligents et plus adaptables.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →