← Derniers articles
🤖 AI

Autoregressive Direct Preference Optimization

Cet article propose l'Autoregressive Direct Preference Optimization (ADPO), une nouvelle variante qui reformule l'objectif DPO en appliquant explicitement des hypothèses autorégressives avant le modèle de Bradley-Terry, ce qui entraîne une fonction de perte décalée et l'identification de mesures distinctes de la longueur des jetons et du feedback pour une optimisation des préférences améliorée.

Auteurs originaux : Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

Publié 2026-06-11
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : Apprendre à un robot à mieux écrire

Imaginez que vous enseignez à un robot à écrire des histoires. Vous avez un livre « Standard d'Or » (le modèle de référence) et un robot « Étudiant » (le modèle apprenant). Vous voulez que l'Étudiant écrive des histoires que les humains préfèrent par rapport aux histoires du Standard d'Or.

Pendant longtemps, la meilleure façon de faire cela était le DPO (Direct Preference Optimization). Considérez le DPO comme un professeur qui lit l'histoire entière écrite par l'étudiant, la compare à l'histoire du Standard d'Or, et donne une seule note : « Bon » ou « Mauvais ».

Le Problème :
L'article soutient que ce système de notation « tout ou rien » est un peu inefficace. Les grands modèles de langage (LLM) n'écrivent pas des histoires en un seul bond géant ; ils écrivent mot par mot (ou jeton par jeton), comme une personne qui tape une phrase. Cependant, l'ancienne méthode DPO attend la toute fin pour donner un retour. C'est comme un entraîneur qui attendrait la fin d'un marathon pour dire à un coureur : « Tu as bien couru », sans jamais corriger sa forme pendant qu'il courait.

La Solution : L'ADPO (DPO Autorégressif)

Les auteurs proposent une nouvelle méthode appelée ADPO. Au lieu d'attendre que l'histoire soit terminée pour donner une note, l'ADPO donne un retour étape par étape pendant que l'histoire est en train d'être écrite.

L'analogie du « Film vs la Photo »

  • Ancien DPO (La Photo) : Imaginez prendre une photo d'une peinture terminée. Vous regardez l'image entière et vous dites : « Ceci est meilleur que cela. » Vous ne savez pas quels coups de pinceau l'ont rendu meilleur.
  • Nouvel ADPO (Le Film) : Imaginez regarder l'artiste peindre le tableau en temps réel. L'ADPO regarde le premier coup de pinceau, puis le deuxième, puis le troisième. Il demande : « Ce coup de pinceau spécifique était-il bon ? Le suivant était-il meilleur ? » Il apprend à préférer le processus d'écriture, et pas seulement le résultat final.

Les deux règles de « Longueur »

L'une des découvertes les plus intéressantes de l'article est qu'il existe en réalité deux façons différentes de mesurer la longueur lorsque l'on enseigne à ces modèles, et l'ancienne méthode les confondait.

  1. Longueur en jetons (Le nombre de mots) : C'est le nombre de mots que le modèle tape réellement. (ex : « Le chat est assis » = 4 mots).
  2. Longueur de feedback (Les unités de notation) : C'est le nombre de blocs que l'enseignant décide de noter à la fois.

L'Ancienne Façon : Le professeur notait toujours l'histoire entière comme un seul bloc (Longueur de Feedback = 1), quel que soit le nombre de mots présents.
La Nouvelle Façon (ADPO) : Le professeur peut choisir de noter l'histoire en blocs. Il peut noter chaque mot (Longueur de Feedback = Nombre de mots), ou chaque 10 mots, ou chaque paragraphe.

L'article montre qu'en découpant l'histoire en plus petits blocs (en faisant correspondre la « Longueur de Feedback » à la « Longueur de Jetons »), le modèle apprend plus vite et écrit mieux.

Comment ça marche (Les « Maths » simplifiées)

Dans l'ancienne méthode, les maths ressemblaient à ceci :

Prendre toute l'histoire, calculer la différence, puis appliquer une « sigmoïde » (une fonction de lissage) pour obtenir un score.

Dans la nouvelle méthode ADPO, les maths inversent l'ordre :

Calculer la différence pour chaque étape, appliquer la « sigmoïde » à chaque étape, et ensuite les additionner toutes.

L'Analogie :

  • Ancienne Façon : Vous mélangez tous les ingrédients pour un gâteau, vous le faites cuire, vous goûtez le gâteau entier, et ensuite vous décidez si vous avez besoin de plus de sucre. (Trop tard pour corriger la pâte).
  • Nouvelle Façon : Vous goûtez la pâte après avoir ajouté la farine, puis après avoir ajouté les œufs, puis après avoir ajouté le sucre. Vous ajustez la recette au fur et à mesure.

Les Résultats : Est-ce que ça marche ?

Les auteurs ont testé cette nouvelle méthode sur deux types de tâches :

  1. Problèmes de Mathématiques : Ils ont demandé aux modèles de résoudre des problèmes mathématiques complexes.
  2. Conversations : Ils ont demandé aux modèles de discuter avec des humains.

Les Constats :

  • Meilleures Notes : Dans presque tous les tests, les modèles entraînés avec ADPO ont obtenu des scores plus élevés que ceux entraînés avec l'ancienne méthode DPO.
  • Plus c'est fin, mieux c'est : Les modèles ont obtenu les meilleures performances lorsque la « Longueur de Feedback » était très petite (en vérifiant chaque mot). Cela prouve que les modèles bénéficient d'un feedback constant et granulaire.
  • Pas de coût supplémentaire : Même si vérifier chaque mot semble demander plus de temps, les auteurs ont constaté que le temps supplémentaire requis était négligeable (moins de 6 % plus lent).

Résumé

L'article présente l'ADPO, une manière plus intelligente d'entraîner les modèles d'IA. Au lieu d'attendre que l'IA termine une tâche pour lui donner une note, l'ADPO donne un retour à chaque étape du processus. En traitant l'écriture de l'IA comme une séquence de petites étapes plutôt que comme un seul gros bloc, les modèles apprennent à faire de meilleurs choix tout au long du processus de génération, ce qui se traduit par un raisonnement mathématique plus performant et de meilleures conversations.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →