← Derniers articles
🤖 machine learning

Compositional Generalization in Autoregressive Models via Logit Composition

Ce papier introduit une stratégie de composition de logits fondée sur des principes pour les modèles autorégressifs, inspirée des méthodes de diffusion, qui assure un contrôle projectif sur les sous-espaces de sortie et préserve la généralisation en longueur sous des hypothèses de conditionnels factorisés.

Auteurs originaux : Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

Publié 2026-05-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez une équipe de trois chefs très spécifiques travaillant dans une cuisine.

  • Chef Base (L'arrière-plan) : Ce chef est excellent pour suivre la recette exactement telle qu'elle est écrite. Si vous demandez un sandwich ordinaire, il prépare un sandwich ordinaire parfait. Il n'ajoute rien de supplémentaire.
  • Chef Math : Ce chef est un wizard pour ajouter du fromage et des épices, mais seulement si la recette l'exige. Si la recette dit « ajoutez du fromage », il le fait parfaitement. Si ce n'est pas le cas, il laisse le sandwich tel quel.
  • Chef Code : Ce chef est un expert pour ajouter de la laitue et des tomates, mais seulement lorsque la recette le demande.

Le Problème :
Habituellement, si vous voulez un sandwich avec à la fois du fromage et de la laitue, vous devez engager un seul chef géant qui sait tout faire en même temps. Ou bien, vous essayez de mélanger les trois chefs en fusionnant leurs tabliers (poids) ou en leur demandant de se relayer (routage). Mais souvent, cela provoque le chaos : Chef Math pourrait essayer d'ajouter du fromage alors que Chef Code essaie d'ajouter de la laitue, ou ils pourraient se disputer sur la façon de finir le sandwich, résultant en un tas de nourriture sale et immangeable.

La Solution du Papier : « Composition des Logits »
Les auteurs de ce papier proposent une nouvelle façon de combiner ces chefs. Au lieu de fusionner leurs tabliers ou de les faire se relayer, ils laissent les trois chefs crier leurs suggestions pour le prochain ingrédient en même temps, mais avec une règle spéciale :

  1. La Règle : Ils prennent la suggestion de Chef Math, ajoutent la suggestion de Chef Code, puis soustraient la suggestion de Chef Base.
  2. La Magie : Parce que Chef Base est juste la version « ordinaire », soustraire sa voix annule le bruit.
    • Quand la recette a besoin de fromage, Chef Math est fort, Chef Code est silencieux (car il ne connaît pas le fromage), et Chef Base est neutre. Le calcul aboutit à ce que la décision finale soit « Ajouter du fromage ».
    • Quand la recette a besoin de laitue, Chef Code est fort, Chef Math est silencieux, et Chef Base est neutre. La décision finale est « Ajouter de la laitue ».
    • Quand la recette n'a besoin de rien de spécial, tout le monde est silencieux, et le sandwich reste ordinaire.

Pourquoi Cela Fonctionne (Le Secret « Disjoint »)
Le papier soutient que cela ne fonctionne parfaitement que si les chefs ont des tâches disjointes.

  • Chef Math ne touche que les « étapes fromage ».
  • Chef Code ne touche que les « étapes laitue ».
  • Ils n'essaient jamais de faire le travail de l'autre en même temps.

Si Chef Math essaie d'ajouter du fromage pendant que Chef Code ajoute de la laitue, ils pourraient entrer en collision. Mais s'ils savent exactement quand agir (par exemple : « J'agis seulement à l'étape 3, vous agissez seulement à l'étape 5 »), ils peuvent travailler ensemble de manière fluide sans se battre. Le papier appelle cela « Conditionnels Factorisés ».

La Garantie « Projective »
Le papier prouve que si les chefs respectent leurs zones spécifiques, le sandwich final (la sortie) sera exactement ce que vous obtiendriez si vous aviez engagé un super-chef qui maîtrisait parfaitement les deux compétences.

  • La partie « Fromage » du sandwich provient à 100 % de Chef Math.
  • La partie « Laitue » provient à 100 % de Chef Code.
  • La partie « Pain » provient à 100 % de Chef Base.

Ils ne s'interfèrent pas. C'est comme une projection : si vous regardez uniquement la partie fromage, elle ressemble exactement à ce que Chef Math a fait. Si vous regardez la laitue, elle ressemble exactement à ce que Chef Code a fait.

Cela fonctionne-t-il pour de longues recettes ? (Généralisation de la Longueur)
Le papier a également vérifié si cela fonctionne pour des recettes très longues (comme un livre de cuisine de 100 pages) que les chefs n'ont jamais vues auparavant. Ils ont constaté que tant que les chefs connaissent leurs « zones » spécifiques (par exemple : « Je gère les étapes 10 à 20 ») et que la recette suit le même modèle, l'équipe combinée peut gérer la longue recette aussi bien que la courte. Ils ne se confondent pas simplement parce que le livre est plus épais.

Test du Monde Réel
Les auteurs ont testé cela avec de vrais modèles d'IA (Grands Modèles de Langage) :

  • Ils ont pris un modèle de base (Gemma 2).
  • Ils ont pris une version affinée pour les Mathématiques.
  • Ils ont pris une version affinée pour le Code.
  • Ils les ont combinés en utilisant leur règle de « cri ».

Le Résultat :
Le nouveau modèle combiné est devenu meilleur en code que l'expert en code seul, et il a conservé presque toutes les compétences de l'expert en mathématiques. Il n'a pas perdu sa capacité en mathématiques simplement parce qu'il a appris à coder. C'était une situation « le meilleur des deux mondes » sans avoir besoin de réentraîner toute l'équipe depuis zéro.

La Mise en Garde
Le papier admet que cela fonctionne mieux lorsque les tâches sont clairement séparées. Si vous essayez de combiner trop d'experts (comme ajouter un chef « Poésie » et un chef « Histoire » au mélange), l'équipe pourrait se confondre sur le moment d'arrêter de parler, conduisant à du charabia. Mais pour des compétences claires et séparées, cette « Composition des Logits » est une méthode puissante et fondée sur des principes pour construire des systèmes d'IA modulaires.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →