LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints
Cet article introduit RealInstruct, un benchmark pour évaluer les LLM sur des instructions réelles à contraintes multiples, et propose DeCRIM, un pipeline d'auto-correction qui permet aux modèles open-source de surpasser GPT-4 en décomposant les instructions, en critiquant les réponses et en affinant les résultats.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : Auto-correction de LLM avec DECRIM
Énoncé du Problème
Bien que les grands modèles de langage (LLM) aient démontré des capacités impressionnantes de suivi d'instructions, des études récentes indiquent qu'ils éprouvent des difficultés significatives face à des instructions contenant des contraintes multiples et simultanées (par exemple, un ton spécifique, une longueur donnée et des contraintes négatives comme « sans hashtags »). Les benchmarks existants pour évaluer cette capacité reposent largement sur des données synthétiques, qui peuvent échouer à capturer la complexité, la nuance et la difficulté artificielle des requêtes réelles des utilisateurs. De plus, les approches d'auto-correction actuelles supposent souvent l'indépendance des contraintes ou se concentrent sur des types de contraintes spécifiques, ce qui limite leur applicabilité aux scénarios ouverts et multi-contraints. Il existe également un manque de méthodes d'évaluation fiables et rentables pour ces instructions complexes, car l'évaluation basée sur des règles est souvent irréalisable pour des tâches ouvertes.
Méthodologie
1. Benchmark REALINSTRUCT
Pour remédier à la dépendance aux données synthétiques, les auteurs introduisent REALINSTRUCT, le premier benchmark conçu pour évaluer les LLM sur des instructions multi-contraintes issues du monde réel.
- Source de données : Dérivée de véritables requêtes d'utilisateurs adressées à des assistants IA (sourcées de ShareGPT), filtrées pour ne conserver que les instructions en anglais contenant des contraintes.
- Structure : Chaque instruction est décomposée en une Tâche (objectif principal), un Contexte et une liste de Contraintes granulaires.
- Échelle : Le jeu de test contient 302 instructions avec 1 055 contraintes ; le jeu de validation contient 842 instructions avec 2 500 contraintes.
- Protocole d'évaluation : En raison de la nature ouverte des données, le benchmark utilise une approche de type LLM-as-a-Judge (le LLM comme juge). Les contraintes sont évaluées individuellement, et les résultats sont agrégés en une métrique de précision par instruction.
2. Validation par LLM-as-a-Judge
Les auteurs étudient la fiabilité de l'utilisation de LLM pour évaluer la satisfaction des contraintes, en comparant des modèles propriétaires (GPT-4, GPT-4-Turbo, GPT-3.5-Turbo) et des modèles open-source (Mistral, Vicuna, Zephyr) par rapport à des annotations humaines.
- Dataset EvalJudge : Un jeu de test de 1 000 triplets instruction-contrainte-réponse avec des étiquettes de vérité terrain vérifiées par des humains.
- Stratégies : Diverses stratégies d'adaptation ont été testées, notamment l'apprentissage en contexte (ICL) avec un prompting de type Chaîne de Pensée (CoT) et le fine-tuning faiblement supervisé pour les modèles open-source.
- Constat : GPT-4-Turbo avec le prompting CoT s'est imposé comme l'évaluateur le plus rentable et le plus fiable, surpassant significativement les modèles open-source dans la détection des contraintes non satisfaites.
3. Pipeline DECRIM (Décomposition, Critique et Raffinement)
Pour combler l'écart de performance entre les modèles open-source et propriétaires, les auteurs proposent DECRIM, un pipeline d'auto-correction basé sur des approches de Système 2. Il fonctionne sans supposer l'indépendance des contraintes et se compose de quatre étapes itératives :
- Réponse Initiale : Le LLM génère une réponse à l'instruction originale.
- Décomposition : Un modèle de Décomposition décompose l'instruction originale en une liste de contraintes granulaires à respecter.
- Critique : Un modèle de Critique évalue la réponse par rapport à chaque contrainte. Si toutes sont satisfaites, le processus s'arrête. Sinon, le Critique fournit un feedback en langage naturel précisant quelles contraintes ont été violées.
- Raffinement : Le LLM sous-jacent utilise le feedback, l'instruction originale et la réponse précédente pour générer une sortie améliorée.
Ce cycle se répète jusqu'à ce que les contraintes soient respectées ou qu'un nombre maximal d'itérations () soit atteint.
Contributions Clés
- REALINSTRUCT : Un nouveau benchmark comprenant de réelles requêtes d'utilisateurs adressées aux assistants IA, offrant une évaluation plus réaliste du suivi d'instructions multi-contraintes par rapport aux jeux de données synthétiques.
- Pipeline DECRIM : Un cadre d'auto-correction qui décompose les instructions, critique les réponses via un modèle de Critique dédié, et raffine les sorties. C'est la première approche de Système 2 pour les instructions contraintes qui fonctionne sans supposer l'indépendance des contraintes.
- Analyse systématique de LLM-as-a-Judge : La première évaluation systématique des modèles open-source et propriétaires en tant que juges de la satisfaction des contraintes, identifiant GPT-4-Turbo avec CoT comme une alternative fiable et rentable à l'annotation humaine.
Résultats
Performance des Benchmarks (REALINSTRUCT & IFEval)
- Limites des bases de référence : Même le modèle propriétaire GPT-4 échoue à respecter au moins une contrainte dans plus de 21 % des instructions sur REALINSTRUCT. Les modèles open-source (ex. Mistral 7B) sont généralement moins performants que GPT-4, bien qu'ils surpassent GPT-3.5.
- Efficacité de DECRIM :
- Feedback Faible : L'utilisation d'un Mistral faiblement supervisé comme Critique (sans données externes), DECRIM a amélioré la performance de niveau instruction de Mistral de 7,3 % sur REALINSTRUCT et de 8,0 % sur IFEval par rapport à une base de référence « Make sure ».
- Feedback Fort : Lorsqu'ils sont fournis avec un feedback fort (Oracle Critic ou GPT-4), les LLM open-source dotés de DECRIM surpassent GPT-4 sur les deux benchmarks. Spécifiquement, avec un Oracle Critic, Mistral a atteint une précision d'instruction de 93,7 % sur REALINSTRUCT (contre 78,8 % pour GPT-4) et 80,4 % sur IFEval (contre 79,3 % pour GPT-4).
- Limites de l'auto-correction : Le raffinement standard (utiliser le modèle comme son propre critique) n'a produit que des gains minimes ou des baisses de performance, soulignant la nécessité d'un modèle de Critique externe ou distinct.
Fiabilité de l'Évaluation
- GPT-4-Turbo : Avec le prompting CoT, il a réduit les coûts d'évaluation de 57 % par rapport à GPT-4 tout en améliant le Macro F1 de 7,0 % et le F1 Négatif (détection des violations) de 19,0 %.
- Juges Open-Source : Les modèles open-source classiques étaient des juges peu fiables, faisant souvent preuve de complaisance ou de comportement aléatoire. Cependant, le fine-tuning faiblement supervisé sur les traces de raisonnement de GPT-4 a considérablement amélioré leur capacité à détecter les contraintes non satisfaites.
Signification et Revendications
L'article affirme que le respect des instructions multi-contraintes du monde réel reste un défi majeur pour les modèles de pointe, même pour GPT-4 qui échoue fréquemment. Les auteurs postulent que le pipeline DECRIM répond efficacement à ce problème en découplant la génération de la réponse du processus d'évaluation et de raffinement.
Le travail démontre que :
- Les données réelles sont distinctes : Les benchmarks synthétiques ne capturent pas pleinement les défis des contraintes réelles des utilisateurs, nécessitant des benchmarks comme REALINSTRUCT.
- La qualité du feedback est primordiale : Le succès de l'auto-correction dépend fortement de la qualité du feedback du Critique. Bien que les modèles open-source peinent à s'auto-corriger, ils peuvent atteindre des performances supérieures aux modèles propriétaires lorsqu'ils sont dotés d'un feedback externe de haute qualité.
- Viabilité du Système 2 : L'approche DECRIM valide l'utilité des techniques de Système 2 (décomposition et raffinement itératif) pour le suivi d'instructions complexes, suggérant que les modèles open-source peuvent être compétitifs avec leurs homologues propriétaires s'ils sont équipés de pipelines de correction robustes.
Les auteurs concluent que, bien que DECRIM introduise une surcharge de calcul, il offre une voie viable pour améliorer les capacités de suivi d'instructions, particulièrement lorsque des mécanismes de feedback forts sont disponibles. Des travaux futurs sont suggérés pour affiner les composants du pipeline et intégrer DECRIM à d'autres approches de Système 2 comme la cohérence de soi (self-consistency).
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.