← Nieuwste papers
💬 NLP

ORCA-bench: How Ready Are Language Model Agents for Oncall?

Het artikel introduceert ORCA-bench, een benchmark met productietrouw voor het evalueren van taalmodelagenten bij on-call oorzaakanalyse-taken, wat onthult dat zelfs de meest geavanceerde frontiermodellen momenteel een lage nauwkeurigheid bereiken (25,3% bij gemiddelde moeilijkheidsgraad) en worstelen met hallucinaties, wat wijst op een aanzienlijke kloof voordat ze veilig kunnen worden toevertrouwd met de betrouwbaarheid van echte productieomgevingen.

Oorspronkelijke auteurs: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

Gepubliceerd 2026-07-31
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kapitein bent van een enorm, hoogtechnologisch ruimteschip dat door de melkweg kruist. Plotseling begint de computer van het schip vreemd te doen: de lichten flikkeren, de zwaartekracht is weg en het koffiezetapparaat spuugt vonken uit. Je weet niet precies wat er mis is, maar je weet wel dat het schip in de problemen zit. In de echte wereld zijn deze ruimteschepen de websites en apps die we elke dag gebruiken, en de "kapiteins" zijn speciale ingenieurs genaamd Site Reliability Engineers (SRE's). Hun taak is om uit te zoeken waarom dingen kapot zijn gegaan, vaak beginnend met een vage klacht zoals "de checkout-knop werkt niet" of "de site is traag". Ze moeten zich een weg banen door bergen digitale aanwijzingen—zoals verkeerslogs, foutmeldingen en code—om dat ene kapotte onderdeel te vinden voordat het hele schip neerstort.

Lange tijd hebben mensen geprobeerd om computers dit detectivewerk te leren met behulp van Kunstmatige Intelligentie (AI), specifiek Large Language Models (LLM's). Dit zijn dezelfde slimme computers die verhalen kunnen schrijven, vragen kunnen beantwoorden en zelfs kunnen helpen bij het schrijven van code. De grote vraag die iedereen stelt is: "Zijn deze AI-detectives klaar om het stuur over te nemen en onze echte systemen te repareren wanneer er iets misgaat?" Het is een spel met hoge inzet, want als een AI een verkeerde gok doet, kan een kleine glitch veranderen in een enorme ramp.

Dit artikel, getiteld ORCA-BENCH, creëert een gigantische, realistische trainingsgrond om precies dat te testen. De onderzoekers bouwden een neppe maar ongelooflijk gedetailleerde webshop (genaamd de "Astronomy Shop") die zes dagen lang draait en een enorme hoeveelheid digitale ruis genereert, net als een echte drukke website. Vervolgens creëerden ze 1.079 verschillende "mysterieus incidenten" waarbij ze stiekem dingen in het systeem kapot maakten en vijf van de slimste beschikbare AI-agenten vroegen de zaak op te lossen. Ze gaven de AI dezelfde hulpmiddelen als een menselijke ingenieur zou gebruiken: toegang tot de live datastromen, de broncode en een vage gebruikersklacht.

De resultaten? De AI-detectives zijn nog volop in training. Zelfs de beste AI-modellen konden slechts ongeveer 25% van de gevallen met een "gemiddelde moeilijkheidsgraad" correct oplossen, en ze haalden slechts 10% op de moeilijkste gevallen. Om dat in perspectief te plaatsen: als een menselijke ingenieur een score van 10% op een test zou halen, zou hij ontslagen worden; voor deze AI's is dat de huidige stand van de techniek. Het onderzoek toonde aan dat wanneer de AI geen toegang had tot de broncode, hun prestaties nog slechter werden. Misschien nog wel het meest verontrustende: de AI "hallucineerde" vaak, wat betekent dat ze vol vertrouwen nepredenen verzonnen voor de problemen die helemaal niet bestonden. In één geval gaf een AI de schuld aan een browsercrash in een testtool voor het falen van de winkelwagen van een gebruiker, waardoor de echte boosdoener volledig werd gemist.

De auteurs concluderen dat hoewel deze AI-agenten indrukwekkend zijn in het schrijven van code, ze nog niet klaar zijn om het vertrouwen te krijgen over de veiligheid van echte, live systemen. De kloof tussen wat de AI kan in een gecontroleerde test en wat nodig is om het internet veilig te houden, is nog steeds enorm. Het artikel suggelt dat voordat we AI de "on-call" dienst laten overnemen, we veel meer engineeringwerk moeten verrichten om ze betrouwbaar te maken, want op dit moment zijn ze eerder geneigd een verkeerde gok te maken dan het mysterie op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →