Counsel: A Meta-Evaluation Dataset for Agentic Tasks
Dit artikel introduceert Counsel, de eerste publieke dataset van door mensen geverifieerde meta-evaluaties voor LLM-as-a-judge-kritieken op agentische taken, die de kalibratie en verbetering van geautomatiseerde evaluatoren mogelijk maakt door hun afstemming met menselijke oordelen over foutlocatie en redeneerkwaliteit te analyseren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van AI-assistenten (agenten) bouwt om complexe taken uit te voeren, zoals het beheren van een parfumbestelling van een klant of het schrijven van computercode. Naarmate deze taken moeilijker worden, wordt het controleren of de AI zijn werk goed doet een enorme hoofdpijn.
Het Probleem: De "Menselijke Flessenhals"
Beschouw een AI-agent als een student die een lang, meerstaps examen maakt. Om het examen perfect te beoordelen, moest een menselijke docent vroeger elke individuele stap die de student zette, lezen.
- De Realiteit: Voor complexe taken kost dit uren. Als je 1.000 examens hebt, heb je een klein leger aan docenten nodig die wekenlang doorwerken.
- De Afkorting: Om tijd te besparen, zijn bedrijven begonnen met het gebruiken van "AI-docenten" (genaamd LLM-as-a-Judge) om de examens automatisch te beoordelen. Deze AI-docenten schrijven opmerkingen zoals: "Je bent vergeten eerst de ID van de gebruiker te controleren!" of "Goed gedaan, je hebt het bestand gevonden!"
Het Nieuwe Probleem: Zijn de AI-docenten betrouwbaar?
Hier zit de crux: we zijn begonnen met het vertrouwen op deze AI-docenten zonder te controleren of zij wel goed waren in hun specifieke taak van het schrijven van kritieken.
- Soms ziet een AI-docent een echte fout en legt deze perfect uit.
- Soms ziet het een fout die eigenlijk geen fout is (een vals alarm).
- Soms ziet het een echte fout, maar geeft het een verwarrende of onjuiste uitleg over waarom het een fout is.
Tot nu toe hadden we geen manier om te meten hoe goed deze AI-docenten waren in hun specifieke taak van het schrijven van kritieken. We wisten alleen of ze de uiteindelijke "Geslaagd/Gezakt"-score goed hadden, maar niet of hun redenering wel klopte.
De Oplossing: "Counsel"
De auteurs hebben een nieuwe dataset ontwikkeld genaamd Counsel. Beschouw dit als een "Docent van de Docent"-dataset.
- De Opzet: Ze namen twee realistische scenario's:
- Klantenservice: Een AI die probeert een klant te helpen bij het ruilen van een parfum.
- Coderen: Een AI die probeert financiële databestanden te analyseren.
- De Actoren:
- De Student: Een AI-agent die de taak probeert uit te voeren.
- De AI-Docent (Judge): Een AI die de student observeert en een kritiek schrijft (bijv. "Fout! Je hebt een stap overgeslagen").
- De Menselijke Expert (Meta-Evaluator): Een echte mens die de kritiek van de AI-docent leest en beslist:
- "Spot on": Je hebt de juiste fout gevonden en hebt het perfect uitgelegd. ✅
- "Correcte locatie, zwakke redenering": Je hebt de juiste fout gevonden, maar je uitleg was zwak of onjuist. ⚠️
- "Zou niet gemarkeerd moeten zijn": Je dacht dat er een fout was, maar de student deed het eigenlijk goed. ❌
Wat ze vonden
Door mensen de AI-docenten te laten beoordelen, ontdekten ze:
- Slimmer is Beter: Krachtigere AI-modellen maken betere docenten.
- Dieper Denken Helpt: Wanneer de AI-docent wordt gedwongen om langer en dieper na te denken voordat hij beoordeelt, maakt hij minder fouten.
- De Beste Docent: De sterkste AI-docent die ze testten, was in 88% van de gevallen het eens met menselijke experts over waar de fout zat en in 65% van de gevallen over de redenering.
Waarom dit ertoe doet
Deze dataset is als een "gebruiksaanwijzing" voor het bouwen van betere AI-docenten. In plaats van alleen maar te hopen dat een AI goed is in het beoordelen, kunnen we deze data nu gebruiken om:
- Te testen hoe goed een nieuwe AI-docent is.
- AI-docenten te trainen om betere, nauwkeurigere kritieken te schrijven.
- Slechte kritieken te filteren, zodat ontwikkelaars alleen de hoogwaardige kritieken te zien krijgen.
In een Notendop
Dit paper introduceert een manier om de beoordelaars te beoordelen. Net zoals je niet zou aannemen dat een docent die niet kan uitleggen waarom een student een vraag fout had, heeft de AI-gemeenschap een manier nodig om te garanderen dat zijn geautomatiseerde evaluatoren ook daadwerkelijk nuttige feedback geven. Counsel biedt de eerste publieke bibliotheek van deze "cijfers op cijfers" om betrouwbaardere AI-systemen te bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.