← Nieuwste papers
💬 NLP

LLM Self-Correction with DeCRIM: Decompose, Critique, and Refine for Enhanced Following of Instructions with Multiple Constraints

Dit artikel introduceert RealInstruct, een benchmark voor het evalueren van LLM's op real-world instructies met meerdere beperkingen, en stelt DeCRIM voor, een self-correction pipeline die open-source modellen in staat stelt om GPT-4 te overtreffen door instructies te deconstrueren, responsen te bekritiseren en outputs te verfijnen.

Oorspronkelijke auteurs: Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

Gepubliceerd 2026-07-31
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Thomas Palmeira Ferraz, Kartik Mehta, Yu-Hsiang Lin, Haw-Shiuan Chang, Shereen Oraby, Sijia Liu, Vivek Subramanian, Tagyoung Chung, Mohit Bansal, Nanyun Peng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: LLM Zelfcorrectie met DECRIM

Probleemstelling

Hoewel Large Language Models (LLM's) indrukwekkende capaciteiten hebben getoond in het opvolgen van instructies, wijzen recente studies uit dat ze aanzienlijk moeite hebben met instructies die meerdere, gelijktijdige beperkingen bevatten (bijv. specifieke toon, lengte en negatieve beperkingen zoals "geen hashtags"). Bestaande benchmarks voor het evalueren van deze capaciteit vertrouwen grotendeels op synthetische data, wat de complexiteit, nuance en kunstmatige moeilijkheidsgraad van echte gebruikersverzoeken mogelijk niet goed vangt. Bovendien gaan huidige zelfcorrectie-benaderingen vaak uit van onafhankelijke beperkingen of richten ze zich op specifieke typen beperkingen, wat hun toepasbaarheid in open eind, multi-constrained scenario's beperkt. Er is ook een gebrek aan betrouwbare, kosteneffectieve evaluatiemethoden voor deze complexe instructies, aangezien regelgebaseerde evaluatie vaak onhaalbaar is voor open eind taken.

Methodologie

1. REALINSTRUCT Benchmark

Om de afhankelijkheid van synthetische data aan te pakken, introduceren de auteurs REALINSTRUCT, de eerste benchmark die ontworpen is om LLM's te evalueren op basis van real-world, multi-constrained instructies.

  • Databron: Afgeleid van echte gebruikersvragen aan AI-assistenten (afkomstig van ShareGPT), gefilterd om alleen Engelse instructies te behouden die beperkingen bevatten.
  • Structuur: Elke instructie wordt gedecomposed in een Taak (hoofddoel), Context, en een lijst met granulaire Beperkingen (Constraints).
  • Schaal: De testset bevat 302 instructies met 1.055 beperkingen; de validatieset bevat 842 instructies met 2.500 beperkingen.
  • Evaluatieprotocol: Vanwege het open eind karakter van de data, maakt de benchmark gebruik van een LLM-as-a-Judge benadering. Beperkingen worden individueel geëvalueerd, en resultaten worden geaggregeerd tot een instructie-niveau nauwkeurigheidsmetriek.

2. LLM-as-a-Judge Validatie

De auteurs onderzoeken de betrouwbaarheid van het gebruik van LLM's om het voldoen aan beperkingen te evalueren, waarbij zij propriëtaire modellen (GPT-4, GPT-4-Turbo, GPT-3.5-Turbo) en open-source modellen (Mistral, Vicuna, Zephyr) vergelijken met menselijke annotaties.

  • EvalJudge Dataset: Een testset van 1.000 instructie-beperking-respons triples met door mensen geverifieerde grondwaarheid-labels.
  • Strategieën: Verschillende adaptatiestrategieën werden getest, waaronder In-Context Learning (ICL) met Chain-of-Thought (CoT) prompting en zwak gesuperviseerde fine-tuning voor open-source modellen.
  • Bevinding: GPT-4-Turbo met CoT prompting kwam naar voren als de meest kosteneffectieve en betrouwbare evaluator, die open-source modellen aanzienlijk overtrof in het detecteren van niet-voldane beperkingen.

3. DECRIM Pipeline (Decompose, Critique, and Refine)

Om de prestatiekloof tussen open-source en propriëtaire modellen te overbruggen, stellen de auteurs DECRIM voor, een zelfcorrectie-pipeline gebaseerd op System 2 benaderingen. Het werkt zonder aannames over de onafhankelijkheid van beperkingen en bestaat uit vier iteratieve stappen:

  1. Initial Response: De LLM genereert een respons op de oorspronkelijke instructie.
  2. Decompose: Een Decomposer-model breekt de oorspronkelijke instructie af in een lijst met granulaire beperkingen die gevolgd moeten worden.
  3. Critique: Een Critic-model evalueert de respons tegenover elke beperking. Als alle beperkingen zijn voldaan, stopt het proces. Zo niet, dan geeft de Critic natuurlijke taalfeedback die specificeert welke beperkingen zijn geschonden.
  4. Refine: Het onderliggende LLM gebruikt de feedback, de oorspronkelijke instructie en de vorige respons om een verbeterde output te genereren.

Deze cyclus herhaalt zich totdat de beperkingen zijn behaald of een maximaal aantal iteraties (NmaxN_{max}) is bereikt.

Belangrijkste Bijdragen

  1. REALINSTRUCT: Een nieuwe benchmark bestaande uit echte gebruikersverzoeken aan AI-assistenten, die een realistischere evaluatie biedt van het opvolgen van multi-constrained instructies vergeleken met synthetische datasets.
  2. DECRIM Pipeline: Een zelfcorrectie-framework dat instructies de-composeert, responsen bekritiseert via een toegewijde Critic-model, en outputs verfijnt. Het is de eerste System 2 benadering voor constrained instructies die werkt zonder uit te gaan van de onafhankelijkheid van beperkingen.
  3. Systematische Analyse van LLM-as-a-Judge: De eerste systematische evaluatie van open-source en propriëtaire modellen als judges voor het voldoen aan beperkingen, waarbij GPT-4-Turbo met CoT wordt geïdentificeerd als een betrouwbaar, kosteneffectief alternatief voor menselijke annotatie.

Resultaten

Benchmark Prestaties (REALINSTRUCT & IFEval)

  • Baseline Beperkingen: Zelfs het propriëtaire GPT-4 model voldoet in meer dan 21% van de instructies op REALINSTRUCT niet aan ten minste één beperking. Open-source modellen (bijv. Mistral 7B) presteren over het algemeen minder goed dan GPT-4, hoewel ze beter presteren dan GPT-3.5.
  • DECRIM Effectiviteit:
    • Zwakke Feedback: Het gebruik van een zwak gesuperviseerde Mistral als de Critic (zonder externe data), verbeterde de instructie-niveau prestatie van Mistral met 7,3% op REALINSTRUCT en 8,0% op IFEval vergeleken met een "Make sure" baseline.
    • Sterke Feedback: Wanneer voorzien wordt van sterke feedback (Oracle Critic of GPT-4), overtroffen open-source LLM's met DECRIM GPT-4 op beide benchmarks. Specifiek, met een Oracle Critic, bereikte Mistral een instructie-nauwkeurigheid van 93,7% op REALINSTRUCT (vs. GPT-4's 78,8%) en 80,4% op IFEval (vs. GPT-4's 79,3%).
  • Zelfcorrectie Limieten: Standaard zelf-verfijning (het model gebruiken als zijn eigen criticus) leverde minimale winst of prestatieverlies op, wat het belang van een externe of onderscheidende Critic-model benadrukt.

Evaluatie Betrouwbaarheid

  • GPT-4-Turbo: Met CoT prompting verminderde het de evaluatiekosten met 57% vergeleken met GPT-4, terwijl de Macro F1 met 7,0% verbeterde en F1 Negative (detectie van schendingen) met 19,0%.
  • Open-Source Judges: Vanilla open-source modellen waren onbetrouwbare judges en vertoonden vaak laksheid of willekeurig gedrag. Echter, zwak gesuperviseerde fine-tuning op de redeneerpaden van GPT-4 verbeterde hun vermogen om niet-voldane beperkingen te detecteren aanzienlijk.

Betekenis en Claims

Het artikel claimt dat het opvolgen van real-world, multi-constrained instructies een significante uitdaging blijft voor state-of-the-art modellen, waarbij zelfs GPT-4 regelmatig faalt. De auteurs stellen dat de DECRIM pipeline dit effectief aanpakt door de generatie van de respons te ontkoppelen van het evaluatie- en verfijningsproces.

Het werk demonstreert dat:

  1. Real-world data is onderscheidend: Synthetische benchmarks vatten de uitdagingen van echte gebruikersbeperkingen niet volledig, wat benchmarks zoals REALINSTRUCT noodzakelijk maakt.
  2. Kwaliteit van feedback is essentieel: Het succes van zelfcorrectie is sterk afhankelijk van de kwaliteit van de feedback van de Critic. Hoewel open-source modellen moeite hebben met zelfcorrectie, kunnen ze prestaties bereiken die die van propriëtaire modellen overtreffen wanneer ze worden voorzien van hoogwaardige, externe feedback.
  3. System 2 Haalbaarheid: De DECRIM benadering valideert het nut van System 2 technieken (decompositie en iteratieve verfijning) voor complex instructie-opvolgen, wat suggereert dat open-source modellen competitief kunnen zijn met propriëtaire tegenhangers als ze zijn uitgerust met robuuste correctie-pipelines.

De auteurs concluderen dat hoewel DECRIM computationele overhead introduceert, het een levensvatbaar pad biedt om de instructie-opvolgende capaciteiten te verbeteren, vooral wanneer sterke feedbackmechanismen beschikbaar zijn. Toekomstig werk wordt gesuggereerd om pipeline-componenten te verfijnen en DECRIM te integreren met andere System 2 benaderingen zoals self-consistency.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →