← Derniers articles
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

Le document présente Deco-G, un cadre de décodage qui améliore les performances des grands modèles de langage sur des tâches complexes en découplant la résolution de problèmes des exigences de formatage rigides grâce à un module d'estimation de format dédié qui assure la conformité sans entraver le raisonnement.

Auteurs originaux : Haikang Deng, Po-Nien Kung, Nanyun Peng

Publié 2026-07-13
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Haikang Deng, Po-Nien Kung, Nanyun Peng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous demandiez à un robot super intelligent de résoudre un problème de mathématiques difficile, mais que vous exigez également qu'il écrive la réponse dans un format très spécifique et rigide, comme « La réponse finale est 42. » Habituellement, quand vous mélangez la partie « réfléchir intensément » avec la partie « écrire parfaitement » dans une seule grande instruction, le robot s'embrouille. C'est comme essayer de jongler tout en marchant sur une corde raide ; il finit souvent par lâcher la balle (les mathématiques) ou par trébucher sur la corde (le format).

Le papier de Haikang Deng et de ses collègues introduit un nouveau système appelé DECO-G pour corriger cela. Voyez DECO-G comme l'union de deux spécialistes : un Résolveur de Problèmes et un Agent de Police du Format.

Le Problème : Le désordre « Enchevêtré »

Dans l'ancienne méthode, vous donniez au robot une instruction géante : « Résous ce problème de mathématiques ET assure-toi d'écrire la réponse dans une boîte JSON. » Le papier soutient que cet « enchevêtrement » nuit au cerveau du robot. Il suggère que lorsque le robot essaie de faire les deux à la fois, il commence à commettre des erreurs dans les mathématiques simplement pour satisfaire les règles de formatage.

Les auteurs argumentent explicitement contre l'idée que le simple fait de dire au robot de « faire attention » ou d'utiliser des modèles pré-établis rigides (comme le forcer à suivre un schéma JSON strict étape par étape) soit la meilleure solution. Ils ont découvert que ces méthodes rigides coupent souvent le fil de la pensée du robot, menant à des réponses incohérentes ou à des calculs faux, même si le format semble parfait.

La Solution : La stratégie des deux équipes

DECO-G sépare le travail.

  1. Le Résolveur de Problèmes (l'LLM) : C'est le robot principal. Il ne reçoit que le problème de mathématiques. Il ne se soucie pas du tout du format. Il réfléchit, raisonne et résout le problème librement.
  2. L'Agent de Police du Format (le FEM) : C'est un module auxiliaire séparé, plus petit. Il ne résout pas les mathématiques. Son seul travail est de surveiller la production du robot et de lui murmurer : « Hé, tu approches de la fin, mais tu dois dire 'La réponse finale est' avant de donner le nombre. »

La magie opère dans la manière dont ils communiquent. L'Agent de Police utilise un « lookahead probabiliste » spécial (une façon sophistiquée de jeter un coup d'œil dans le futur) pour deviner : « Si le robot dit 'La' en ce moment, quelles sont les chances qu'il termine la phrase correctement ? » Si les chances sont faibles, l'Agent de Police pousse doucement le choix du mot suivant du robot pour le ramener sur la bonne voie sans l'empêcher de réfléchir.

Les Armes Secrètes

Pour que cette collaboration soit rapide et ne ralentisse pas l'ordinateur, les auteurs ont introduit trois astuces géniales :

  • Distillation Sensible aux Instructions : Au lieu d'entraîner l'Agent de Police sur des discussions aléatoires et ennuyeuses, ils l'ont entraîné spécifiquement sur la manière dont le robot se comporte lorsqu'il essaie réellement de résoudre des problèmes. Cela rend l'Agent de Police bien plus intelligent pour savoir ce que le robot est susceptible de faire ensuite.
  • Construction de Trie Flexible : Imaginez une carte de toutes les façons possibles dont la réponse pourrait apparaître. Habituellement, ces cartes deviennent énormes et désordonnées si la longueur de la réponse peut varier. Les auteurs ont construit une carte « flexible » qui fusionne les chemins, afin que l'ordinateur ne soit pas submergé par la vérification de chaque possibilité.
  • Élagage d'État HMM : L'Agent de Police possède un cerveau massif avec des milliers d'états cachés. Les auteurs ont réalisé que la plupart du temps, le robot ne se soucie que d'un petit groupe d'états. Ils ont donc dit à l'Agent de Police d'ignorer le reste, réduisant le travail de calcul d'environ 13 fois (passant d'environ 1,08 GFLOPs à 0,08 GFLOPs par étape) tout en conservant une précision quasi identique.

Ce que disent les chiffres

L'équipe a testé cela sur trois défis différents :

  1. Problèmes de Mathématiques (GSM8k) : En résolvant des problèmes de mathématiques de niveau primaire, DECO-G a systématiquement battu les autres méthodes. Par exemple, sur le modèle Llama-3.1-8B, il a obtenu 85,2 % de bonnes réponses tout en maintenant 100 % de conformité au format. En revanche, une méthode rigide appelée « Outlines » n'a obtenu que 81,3 % de bonnes réponses, et une approche classique de type « Prompt-Only » a obtenu 82,3 % mais a échoué sur le format la plupart du temps.
  2. Extraction d'Événements : Lorsqu'on demandait au robot d'extraire des détails spécifiques d'articles de presse, DECO-G a amélioré les scores d'identification de qui a fait quoi (la métrique « Argument Id » est montée à 39,4 pour Llama).
  3. LLM-as-a-Judge : Lorsque le robot devait noter des résumés, DECO-G l'a aidé à mieux s'aligner avec les juges humains, atteignant les scores de corrélation moyenne les plus élevés (comme 0,418 pour la Cohérence sur Llama).

Le Verdict

Le papier suggère qu'en séparant la « réflexion » du « formatage », nous pouvons obtenir le meilleur des deux mondes : des réponses qui sont mathématiquement correctes et parfaitement formatées. Les auteurs ont mesuré cela sur des jeux de données réels et ont constaté que DECO-G surpasse systématiquement le fait de vouloir tout faire en une seule fois ou d'utiliser des contraintes rigides imposées.

Cependant, ils notent quelques nuances. Ce système n'est pas une baguette magique qui fonctionne instantanément sur n'importe quel robot ; vous devez entraîner un nouvel « Agent de Police du Format » pour chaque modèle de robot que vous utilisez. De plus, pour certains modèles (comme la série Qwen), le cerveau du robot est si concentré qu'il faut pousser l'Agent de Police plus fort (en utilisant un facteur de contrôle de γ=2) pour qu'il l'écoute.

En bref, DECO-G suggère que si vous voulez qu'un robot soit un génie des mathématiques et un perfectionniste du formatage, vous ne devriez pas lui demander de faire les deux en même temps. Donnez-lui un partenaire pour gérer les règles, et regardez-le briller.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →