← Derniers articles
💬 NLP

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

Cet article introduit l'Optimisation de Politique de Séquence sans Biais de Longueur (LUSPO), un nouvel algorithme qui analyse et rectifie théoriquement le biais de longueur dans l'Optimisation de Politique de Séquence de Groupe (GSPO) afin de prévenir l'effondrement de la longueur des réponses, atteignant ainsi des performances de pointe dans les tâches de raisonnement mathématique et multimodal.

Auteurs originaux : Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

Publié 2026-02-06
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous formez un étudiant brillant (un modèle d'IA) pour résoudre des énigmes complexes de mathématiques et de logique. Pour l'aider à apprendre, vous utilisez une méthode appelée Apprentissage par Renforcement avec Récompenses Vérifiables (RLVR). Considérez cela comme un entraîneur qui donne un problème à l'étudiant, le laisse essayer de le résoudre, puis vérifie la réponse. Si la réponse est correcte, il reçoit une étoile d'or ; si elle est fausse, il reçoit un doux « réessaie ».

Au fil du temps, l'étudiant apprend à réfléchir plus longtemps et plus profondément, en décomposant les grands problèmes en petites étapes. Ce processus de « pensée à voix haute » est crucial pour résoudre des tâches difficiles.

Cependant, les auteurs de cet article ont découvert une faille cachée dans la façon dont les méthodes d'entraînement actuelles (plus précisément les algorithmes appelés GRPO et GSPO) évaluent les étudiants.

Le Problème : Le Piège de la « Réponse Courte »

Imaginez que l'entraîneur corrige un examen.

  • La Faille : Le système de notation actuel punit accidentellement les étudiants qui écrivent des explications longues et détaillées, même si ces explications sont correctes. C'est comme un professeur qui donnerait une note inférieure à un élève qui écrit une dissertation parfaite de 5 pages par rapport à un élève qui écrit une dissertation de 1 page, simplement parce que les mathématiques de la formule de notation favorisent le papier le plus court.
  • Le Résultat : Les étudiants (modèles d'IA) réalisent rapidement que pour obtenir le meilleur score, ils doivent arrêter de réfléchir profondément et simplement donner des réponses courtes et rapides.
  • L'Effondrement : Dans les expériences de l'article, l'une des méthodes populaires (GSPO) a provoqué un « effondrement » des réponses de l'IA. L'IA a commencé à donner des réponses très brèves et paresseuses, perdant sa capacité à raisonner sur des problèmes complexes. C'était comme un coureur de marathon qui décide soudainement de marcher parce que la ligne d'arrivée est déplacée plus près à chaque fois qu'il fait une grande foulée.

La Solution : LUSPO (L'Entraîneur Équitable)

Les auteurs, Fanfan Liu et son équipe de Meituan, ont proposé une nouvelle méthode appelée Optimisation de la Politique de Séquence Non-Biaisée par la Longueur (LUSPO).

Considérez LUSPO comme un nouvel entraîneur plus équitable qui corrige la formule de notation.

  • La Correction : Le nouvel entraîneur dit : « Peu importe que votre réponse fasse 10 mots ou 1 000 mots. Si le raisonnement est correct, vous obtenez le plein crédit. » Ils ajustent les mathématiques pour que la longueur de la réponse ne booste pas ou ne diminue pas injustement le score.
  • L'Analogie : Si l'ancienne méthode était comme juger un discours en fonction du nombre de mots utilisés, LUSPO est comme juger sur la qualité de la communication des idées, qu'on ait parlé pendant 5 minutes ou 30 minutes.

Qu'est-ce qui s'est passé quand ils l'ont testé ?

L'équipe a testé ce nouvel « entraîneur équitable » sur différents types de modèles d'IA (certains qui ne font que lire du texte, et d'autres qui peuvent aussi regarder des images et des graphiques).

  1. L'IA a commencé à réfléchir plus longtemps : Au lieu de raccourcir leurs réponses, les modèles ont commencé à écrire des explications plus longues et plus détaillées. Ils étaient prêts à prendre le temps de « réfléchir » au problème.
  2. De meilleurs scores : Parce que les modèles réfléchissaient plus profondément, ils sont devenus meilleurs pour résoudre des énigmes mathématiques et logiques difficiles. Dans les tests, les modèles entraînés avec LUSPO ont obtenu des scores plus élevés que ceux entraînés avec les anciennes méthodes.
    • Par exemple, sur un test de mathématiques difficile (AIME24), la nouvelle méthode a amélioré les scores jusqu'à 6,9 % sur un modèle et 2,9 % sur un autre.
    • Sur les puzzles visuels (regarder des graphiques et des diagrammes), elle a également battu les meilleures méthodes précédentes.
  3. Stabilité : Le processus d'entraînement est devenu beaucoup plus stable. Les modèles ne se sont pas emmêlés les pinceaux et n'ont pas commencé à donner des réponses paresseuses ; ils ont amélioré de manière constante leur capacité de raisonnement.

L'Essentiel

L'article montre que la façon dont nous entraînons actuellement l'IA à « réfléchir » comporte un bug caché qui les pousse à être paresseux et concis. En corrigeant ce bug avec LUSPO, l'IA devient un étudiant plus assidu, prêt à écrire des solutions longues, détaillées et précises à des problèmes complexes. C'est un changement simple dans les mathématiques qui mène à un comportement d'IA beaucoup plus intelligent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →