← Nieuwste papers
🤖 AI

NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

NeuroState-Bench is een mens-gekalibreerde benchmark die LLM-agentprofielen evalueert met behulp van side-query-probes om toezeggingsintegriteit te meten, en onthult dat taaksucces en integriteit vaak uiteenlopen en dat integriteitsrangschikkingen onder afleidingsperturbaties stabieler zijn dan traditionele succesmetrieken.

Oorspronkelijke auteurs: Jia Xiao

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jia Xiao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een persoonlijke assistent inhuurt om een complexe, meerdaagse reis te plannen. Je geeft hen een lijst met regels: "Boek het hotel met uitzicht op de oceaan," "Geef niet meer dan 200 dollar uit aan het diner," en "Vergeet niet dat ik allergisch ben voor pinda's."

De Oude Manier (Alleen Resultaatbeoordeling):
In het verleden keken we alleen naar het eindresultaat. Als de assistent terugkwam met een perfecte reisplanning die een hotel met oceaanuitzicht, een goedkoop diner en geen pinda's bevatte, gaven we hen een "A". Het maakte niet uit hoe ze daar kwamen. Misschien vergaten ze halverwege de pinda-allergie, raakten ze in paniek en losten het op het allerlaatste moment op. Misschien hadden ze per ongeluk het verkeerde hotel geboekt, maar wisselden ze het uit omdat ze geluk hadden. Zolang het eindverslag er goed uitzag, was het werk klaar.

Het Nieuwe Probleem:
De auteurs van dit artikel, NeuroState-Bench, stellen dat dit systeem van "eindcijfer" gevaarlijk is. In de echte wereld moeten we weten of de assistent de regels consistent heeft onthouden tijdens het hele proces. Hielden ze rekening met de pinda-allergie tijdens het bestellen van de lunch? Hielden ze zich aan het budget, zelfs wanneer ze werden verleid door een chique restaurant? Als ze halverwege de regels vergaten en het pas aan het einde rechtzetten, maken ze misschien een fout op een andere reis waar ze geen tweede kans krijgen.

De Nieuwe Oplossing: De "Bijvraag"-test
Het artikel introduceert een nieuwe manier om AI-agenten (slimme computerprogramma's) te testen, genaamd NeuroState-Bench. In plaats van alleen te wachten op het eindantwoord, stelt dit benchmark AI's onderweg "bijvragen".

Stel je voor dat het een leraar is die tijdens een toets door een klaslokaal loopt.

  • De Taak: "Schrijf een essay over de geschiedenis van Rome."
  • De Bijvraag: "Hé, voordat je klaar bent, wat was de naam van de eerste keizer die je noemde?"

Als de student een geweldig essay schrijft, maar de naam van de keizer niet kan herinneren wanneer erom gevraagd wordt, heeft hij misschien alleen het einde geraden of het ergens vandaan gekopieerd. Ze hebben de "toezegging" aan de feiten waarover ze schreven niet echt "vastgehouden".

Hoe de Benchmark Werkt:

  1. De Opzet: De onderzoekers creëerden 144 verschillende "scenario's" (zoals het reisplanning-voorbeeld) met 8 verschillende soorten mentale uitdagingen (zoals het onthouden van een regel, het negeren van een afleiding, of het oplossen van een fout).
  2. De Probes: Voor elk scenario voegden ze 306 specifieke "bijvragen" (probes) toe, ontworpen om te controleren of de AI nog steeds de oorspronkelijke regels volgt.
  3. De Menselijke Check: Mensen beoordeelden deze tests om ervoor te zorgen dat de vragen eerlijk waren en de moeilijkheidsgraden accuraat. Ze ontdekten dat mensen en de AI het zeer sterk eens waren over wat "moeilijk" en wat "gemakkelijk" was.
  4. De Score: Ze berekenden een nieuwe score genaamd HCCIS-CORE. Deze score meet "Toezeggingsintegriteit". Het vraagt: Bleef de AI trouw aan de regels die hij beloofde te volgen, zelfs toen de dingen verwarrend werden?

De Verassende Resultaten:
Toen ze 32 verschillende AI-modellen testten (sommige klein, sommige zeer groot en krachtig), vonden ze iets schokkends:

  • De "Beste" Student is niet de "Meest Eerlijke" Student: De AI die de meeste juiste eindantwoorden gaf, was niet degene die het meest consistent de regels volgde.
  • Ranking Omgekeerd: Als je de AI-modellen rangschikte op basis van hun eindantwoorden, ging de eerste plaats naar één model. Maar als je ze rangschikte op basis van hun "Toezeggingsintegriteit" (hoe goed ze zich aan de regels hielden), zakte datzelfde model naar beneden en nam een ander model de eerste plaats over. Sterker nog, 31 van de 32 modellen veranderden van rangorde toen je overschakelde van het beoordelen van het "eindantwoord" naar het beoordelen van de "toezegging".
  • Afleningen: Toen de onderzoekers "afleidingen" (verwarrende extra informatie) toevoegden, vielen de modellen die goed waren in het krijgen van het juiste eindantwoord uit elkaar. Echter, de modellen met een hoge "Toezeggingsintegriteit" bleven stabiel. Ze waren beter in het negeren van het ruis en het vasthouden aan het plan.

Wat Dit Betekent (Volgens het Artikel):
Het artikel concludeert dat het krijgen van het juiste antwoord aan het einde niet genoeg bewijs is dat een AI betrouwbaar is. Een AI kan per ongeluk het juiste antwoord krijgen terwijl ze halverwege de regels volledig uit het oog verliest.

De auteurs hebben deze benchmark gebouwd als een "stress-test" voor AI-ehrlijkheid en consistentie. Ze claimen niet dat ze een nieuwe AI hebben gebouwd die slimmer is; ze hebben een betere liniaal gebouwd om te meten of een AI eigenlijk doet wat hij zegt dat hij doet.

Wat Ze NIET Claimden:

  • Ze claimden niet dat dit een medisch hulpmiddel is of een manier om menselijke hersenproblemen te diagnosticeren (ondanks de "Neuro" in de naam, gaat het om AI-"mentale toestanden", niet om menselijke biologie).
  • Ze claimden niet dat hun nieuwe scoremethode perfect is of dat het altijd de toekomst zal voorspellen.
  • Ze gaven expliciet aan dat hun "neurale" (hersenen-achtige) toevoegingen de score niet echt veel beter maakten, dus besloten ze te blijven bij de eenvoudigere, door mensen gekalibreerde versie.

In het Kort:
NeuroState-Bench is een nieuw rapportcijfer voor AI. Het stopt met alleen kijken naar het eindcijfer en begint de huiswerknotities te controleren om te zien of de student eigenlijk de hele tijd aandacht had. Het blijkt dat de AI met het beste eindcijfer vaak niet degene was die het meest aandacht had.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →