← Nieuwste papers
🤖 AI

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

Het artikel introduceert CDR-Bench, een uitgebreide benchmark voor het evalueren van LLM's op compositionele, volgordegevoelige taken voor gegevensverfijning, wat onthult dat huidige modellen consequent falen in het getrouw uitvoeren van complexe, meerstapsrecepten vanwege een gebrek aan procedurele betrouwbaarheid.

Oorspronkelijke auteurs: Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde assistent hebt (een AI) die uitblinkt in het opvolgen van eenvoudige instructies. Als je hen vraagt om "de rode inkt van deze pagina te verwijderen", doen ze dat perfect. Als je vraagt om "de spelling te verbeteren", doen ze dat ook.

Maar wat gebeurt er als je ze een complex, meerstaps recept geeft? Zoals: "Verwijder eerst de rode inkt, verbeter daarna de spelling, controleer vervolgens of de pagina langer is dan 10 regels, en als dat zo is, behoud je de pagina; zo niet, gooi hem dan weg."

Dit artikel, CDR-Bench, is als een enorme, rigoureuze testkeuken ontworpen om te zien of deze AI-assistenten daadwerkelijk dergelijke complexe, meerstaps recepten kunnen volgen zonder de volgorde te verwarren of een stap over te slaan.

Het Probleem: Het "Recept" versus het "Resultaat"

De auteurs ontdekten dat hoewel AI-modellen goed lijken te zijn in het nabootsen van het volgen van een recept, ze vaak falen in het getrouw uitvoeren van de specifieke volgorde van stappen.

Denk aan het bakken van een cake.

  • Atomaire taak: "Voeg suiker toe." (De AI doet dit perfect).
  • Compositionele taak: "Voeg suiker toe, roer, voeg dan bloem toe, en roer opnieuw." (De AI kan de bloem toevoegen voordat de suiker is geroerd, of vergeten de tweede keer te roeren).
  • Volgordegevoelige taak: Dit is waar het lastig wordt. Stel je een regel voor die zegt: "Als het beslag te dun is, gooi het dan weg."
    • Volgorde A: Voeg bloem toe (maakt het dikker) -> Controleer dikte -> Behouden.
    • Volgorde B: Controleer dikte (het is dun) -> Weggooien -> (Je komt nooit toe aan het toevoegen van de bloem).

De AI krijgt vaak de uiteindelijke look van de cake goed, maar heeft de het proces van het maken verpest. De AI kan de cake houden wanneer hij weggegooid had moeten worden, of andersom, simpelweg omdat de stappen niet in de exacte volgorde werden gevolgen.

De Testkeuken: CDR-Bench

Onderzoekers hebben een enorme test gebouwd genaamd CDR-Bench met meer dan 3.400 verschillende "recepten" die vier scenario's uit de echte wereld dekken:

  1. Webverfijning: Het opschonen van rommelige webpagina's.
  2. LaTeX-verfijning: Het corrigeren van wetenschappelijke documenten.
  3. RAG-voorbereiding: Het voorbereiden van gegevens voor zoekmachines.
  4. Privacy-redactie: Het verbergen van namen, e-mails en telefoonnummers.

Ze creëerden 29 verschillende "tools" (zoals een tool om e-mails te verwijderen, een tool om interpunctie te corrigeren, een tool om woorden te tellen) en mengden deze in duizenden verschillende recepten.

Wat Ze Ontdekten

Toen ze meer dan 10 van de slimste AI-modellen van dit moment testten, waren de resultaten verrassend en een beetje verontrustend:

  1. De "Composition Gap": Wanneer de AI slechts één ding moest doen, was het geweldig (rond de 30-80% succes). Maar zodra ze 3 of 4 stappen aan elkaar koppelden, stortte het succespercentage in. Het is als een muzikant die een enkele noot perfect kan spelen, maar in elkaar stort wanneer er wordt gevraagd een heel lied te spelen.
  2. Volgorde Is Belangrijker Dan Je Denkt: Als je de volgorde van twee stappen omdraaide (bijv. "verberg de naam" en dan "controleer lengte" versus "controleer lengte" en dan "verberg de naam"), faalde de AI vaak volledig. In sommige tests kon minder dan 5% van de modellen de volgorde elke keer goed krijgen.
  3. De "Stop"-knop Fout: Veel recepten bevatten een stap die zegt: "Als de tekst te kort is, stop en verwijder deze." De AI negeerde dit stopteken vaak, ging door met verwerken en produceerde een resultaat dat het niet had mogen produceren.
  4. Denken Helpt Niet Altijd: Zelfs wanneer de onderzoekers de AI vertelden om "stap voor stap te denken" of "eerst te plannen voordat er gehandeld wordt", bleven de modellen worstelen met de strikte volgorde van handelingen. Ze konden een goed plan schrijven, maar konden het niet altijd perfect uitvoeren.

De Analogie van de "Geloofwaardige Leugen"

Het artikel suggereert dat huidige AI's als acteurs zijn die erg goed zijn in het improviseren van een geloofwaardige afloop.

  • Het Doel: Je wilt dat de acteur een strikt script volgt.
  • De Realiteit: De acteur leest het script, ziet de algemene sfeer en verzint dan de tussenstukken om tot een gelukkig einde te komen dat er goed uitziet.
  • Het Probleen: In gegevensverfijning zijn de "tussenstukken" (de exacte volgorde van opschonen, filteren en controleren) cruciaal. Als de acteur een stap overslaat of de volgorde verandert, kan de uiteindelijke "schone" data er wel goed uitzien, maar is deze in werkelijkheid defect of onveilig.

De Kern van de Zaak

Het artikel concludeert dat we er niet zomaar vanuit kunnen gaan dat AI klaar is om complexe taken voor gegevensopschoning zelfstandig af te handelen. Hoewel ze uitblinken in enkelvoudige taken, missen ze procedurele getrouwheid — het vermogen om strikt vast te houden aan een sequentie van instructies zonder af te dwalen, stappen over te slaan of de volgorde te wijzigen.

Totdat AI erop vertrouwd kan worden een recept exact zoals geschreven te volgen, zullen mensen waarschijnlijk een oogje in het zeil moeten houden bij het "kookproces" in plaats van alleen het eindgerecht te controleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →