← Derniers articles
🤖 machine learning

Compute Aligned Training: Optimizing for Test Time Inference

Ce papier présente l'« Entraînement Aligné au Calcul », un cadre novateur qui aligne les objectifs d'entraînement des grands modèles de langage avec les stratégies d'inférence au moment du test en dérivant de nouvelles fonctions de perte, améliorant ainsi considérablement l'évolution des performances par rapport aux approches SFT et RL standard.

Auteurs originaux : Adam Ousherovitch, Ambuj Tewari

Publié 2026-04-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Adam Ousherovitch, Ambuj Tewari

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous formiez un étudiant pour un type d'examen final très spécifique.

L'Ancienne Méthode (Entraînement Standard) :
Traditionnellement, lorsque nous enseignons aux modèles d'IA (comme ceux qui rédigent des essais ou résolvent des problèmes de mathématiques), nous agissons comme un enseignant strict qui note chaque devoir individuellement. Si l'étudiant répond correctement à une question, nous disons « Bien joué ! » et s'il se trompe, nous disons « Réessayez ». Nous voulons que l'étudiant soit parfait pour obtenir la première réponse juste à chaque fois.

Le problème est que cela ne les prépare pas au véritable examen. Dans le monde réel, nous ne demandons pas au modèle une seule réponse. Nous lui demandons de générer de nombreuses réponses différentes (comme demander à un étudiant de rédiger 10 brouillons différents d'un essai), puis nous choisissons la meilleure, ou nous votons pour la plus courante.

Si vous formez un étudiant à être parfait dès le premier brouillon, il pourrait devenir trop confiant et cesser d'explorer de nouvelles idées. Il pourrait rester coincé dans une façon de penser « sûre ». Lorsque vous lui demandez de générer 10 brouillons plus tard, il pourrait simplement écrire 10 versions légèrement différentes de la même réponse « sûre », et aucune d'elles ne pourrait être la solution brillante et créative dont vous aviez besoin.

La Nouvelle Méthode (Entraînement Aligné sur le Calcul - CAT) :
Les auteurs de cet article proposent une nouvelle méthode d'entraînement appelée Entraînement Aligné sur le Calcul (CAT). Au lieu de noter l'étudiant sur un seul devoir, ils le notent en fonction de la façon dont il se comporterait dans le format de l'examen réel.

Voici comment cela fonctionne, en utilisant quelques analogies :

1. L'Analogie du « Pass@N » (Le Ticket de Loto)

Imaginez que l'examen vous permet d'acheter N tickets de loto (disons 64 tickets) pour une seule question. Vous gagnez si l'un quelconque de vos 64 tickets est le numéro gagnant.

  • Entraînement Standard : Si l'étudiant a déjà 50 % de chances de gagner avec un ticket, l'enseignant continue de le pousser pour atteindre 90 % ou 99 %. Mais dans un loto à 64 tickets, une fois que vous avez 50 % de chances, acheter plus de tickets garantit une victoire de toute façon. L'enseignant gaspille de l'énergie à essayer de rendre un étudiant « bon » « parfait » sur une question facile, tout en ignorant les questions difficiles où l'étudiant n'a qu'1 % de chances.
  • Entraînement CAT : L'enseignant réalise : « Hé, cet étudiant a déjà de fortes chances de gagner avec 64 tickets. Je vais arrêter de noter cette question facile avec autant d'insistance. » Au lieu de cela, il concentre toute son énergie sur les questions difficiles où l'étudiant échoue actuellement. Il apprend à l'étudiant à répartir ses chances, garantissant que au moins un des 64 tickets est un gagnant, plutôt que d'essayer de rendre un ticket spécifique parfait.

2. L'Analogie du « Vote Majoritaire » (L'Élection)

Imaginez que l'examen demande au modèle de générer 10 réponses, et que la classe vote pour la plus populaire.

  • Entraînement Standard : L'enseignant essaie de faire en sorte que la première réponse de l'étudiant soit absolument la plus populaire, même si elle gagne déjà par un large écart. C'est comme un candidat qui remporte déjà 90 % des voix ; l'enseignant continue de lui dire de faire campagne plus fort, ce qui est une perte de temps.
  • Entraînement CAT : L'enseignant regarde le « point de bascule ». Si la réponse de l'étudiant perd actuellement de justesse, l'enseignant lui donne un énorme coup de pouce pour l'aider à franchir la ligne d'arrivée. Si l'étudiant gagne déjà confortablement, l'enseignant arrête de lui donner des points supplémentaires. Cela force le modèle à se concentrer sur les questions « de champ de bataille » où un peu d'effort supplémentaire peut inverser le vote.

3. L'Analogie du « Meilleur des N » (Le Concours de Talent)

Imaginez que le modèle génère 10 chansons, et que vous ne gardez que la seule meilleure.

  • Entraînement Standard : L'enseignant essaie de faire en sorte que la chanson moyenne sonne bien. Cela conduit à une musique sûre, ennuyeuse, « moyenne », qui n'est jamais mauvaise, mais jamais étonnante non plus.
  • Entraînement CAT : L'enseignant dit au modèle : « Ce n'est pas grave si 9 de tes chansons sont terribles, tant que la 10e est un chef-d'œuvre. » Cela encourage le modèle à prendre des risques et à essayer des idées étranges et à forte variance. Il apprend à produire une grande variété de sorties, sachant que le processus de « recherche » (choisir la meilleure) filtrera les échecs et gardera le gagnant.

Qu'ont-ils réellement fait ?

Les chercheurs ont testé cette idée de trois manières spécifiques :

  1. Problèmes de Mathématiques : Ils ont entraîné des modèles d'IA à résoudre des problèmes de mathématiques. Lorsqu'ils ont utilisé le CAT pour préparer les modèles au « Pass@N » (générer de nombreuses réponses et choisir la bonne), les modèles sont devenus significativement meilleurs pour résoudre des problèmes difficiles par rapport à la méthode standard.
  2. Vote : Ils ont entraîné des modèles à générer des réponses pour un « Vote Majoritaire ». Là encore, les modèles CAT ont mieux performé lorsque la stratégie de vote a été appliquée.
  3. Conception de Protéines : Ils ont même testé cela sur un type d'IA complètement différent qui conçoit des protéines (les blocs de construction de la vie). Dans un scénario où l'IA devait trouver une structure protéique rare et de haute qualité parmi beaucoup de mauvaises, les modèles entraînés avec le CAT étaient bien meilleurs pour trouver la protéine « jackpot » que les modèles standard.

La Conclusion

L'article soutient que la façon dont vous entraînez un modèle doit correspondre à la façon dont vous l'utilisez.

Si vous prévoyez d'utiliser le modèle pour générer de nombreuses options et choisir la meilleure, vous ne devriez pas l'entraîner à être parfait du premier coup. Vous devriez l'entraîner à être bon pour créer un ensemble d'options où la meilleure a de fortes chances d'être trouvée.

Ils appellent cela « Entraînement Aligné sur le Calcul » car il aligne le processus d'entraînement sur le « calcul » (la puissance de réflexion supplémentaire) utilisé au moment du test. C'est un moyen d'obtenir de meilleurs résultats sans avoir besoin d'ordinateurs plus puissants ou de plus de temps d'entraînement ; vous changez simplement les règles du jeu pour correspondre à la réalité de la façon dont le modèle sera utilisé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →