← Nieuwste papers
💻 computer science

TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

Het artikel introduceert TerminalWorld, een schaalbare data-engine die automatisch 1.530 hoogwaardige terminaltaken reverse-engineert uit 80.870 real-world opnames om AI-agenten te benchmarken, en onthult dat huidige frontier-modellen moeite hebben met authentieke workflows en slecht presteren in vergelijking met bestaande door experts samengestelde benchmarks.

Oorspronkelijke auteurs: Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica Sarro, He Ye

Gepubliceerd 2026-05-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica Sarro, He Ye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren hoe je een computer's "command line" gebruikt—dat zwarte scherm waar programmeurs tekstcommando's intypen in plaats van op pictogrammen te klikken. Lange tijd was de manier waarop we deze robots testten als het geven van een puzzel die door een strenge leraar was bedacht. De leraar zou zeggen: "Hier is een lastig raadsel; los het op!" Als de robot het raadsel oploste, dachten we dat het slim was.

Maar de auteurs van dit artikel, TERMINALWORLD, realiseerden zich dat er een probleem is: Het echte leven is geen raadsel. Het echte leven is rommelig, onvoorspelbaar en vol met specifieke tools die mensen daadwerkelijk elke dag gebruiken. Een robot die een raadsel kan oplossen, kan nog steeds falen wanneer het wordt gevraagd om daadwerkelijk een server te repareren of bestanden te organiseren in een echt kantoor.

Hier is hoe ze dit hebben opgelost, eenvoudig uitgelegd:

1. De "Vlieg aan de Muur"-benadering

In plaats van nep-taken te verzinnen, gingen de onderzoekers naar een openbare website genaamd asciinema. Dit is als een YouTube-kanaal, maar voor computerschermen. Ontwikkelaars laden vrijwillig opnames van hun echte werksessies op.

  • De Analogie: Stel je voor dat je een student wilt leren koken. In plaats van een kookboek van scratch te schrijven (wat te perfect of raar zou kunnen zijn), ga je naar een keuken, neem je 80.000 uur op van echte koks die echte maaltijden bereiden, en vraag je dan: "Oké, wat hebben ze net gedaan?"
  • Het Resultaat: Ze verzamelden 80.870 echte opnames van ontwikkelaars aan het werk.

2. De "Robot-kok"-motor

Ruw opgenomen materiaal is rommelig. Het bevat typefouten, mislukte pogingen en lange lijsten met systeemberichten die er niet toe doen. De onderzoekers bouwden een speciale "data-engine" (een slim softwaresysteem) om dit op te schonen.

  • Stap 1: Het doel begrijpen. De engine bekijkt een rommelige opname en vraagt een superslimme AI: "Wat probeerde deze persoon eigenlijk te bereiken?" Het zet een rommelig logboek om in een duidelijke instructie: "Blokkeer deze slechte IP-adressen en sla de lijst op in dit bestand."
  • Stap 2: De keuken bouwen. De opname vertelt je niet welke tools de kok had. De engine moet raden welke software en bestanden nodig waren, een perfecte digitale kopie maken van die computeromgeving (met behulp van iets dat een "Docker-container" heet), en ervoor zorgen dat de originele commando's daar echt zouden werken.
  • Stap 3: Het veiligheidsnet. Omdat er geen leraar is om het werk te beoordelen, creëert de engine zijn eigen "test". Het voert de oplossing uit en controleert: "Verscheen het bestand? Is de lijst correct?" Als de test faalt, repareert het de test totdat deze perfect is.

3. Het nieuwe "Real World"-examen

Vanuit die 80.000 opnames creëerden ze een enorme nieuwe testbank genaamd TERMINALWORLD.

  • Het bevat 1.530 gevalideerde taken.
  • Het dekt 18 verschillende soorten echte banen, van het opzetten van cloud-servers tot het repareren van databasefouten.
  • Het gebruikt 1.280 verschillende computercommando's, waarvan 91% nooit eerder in eerdere tests was gezien.

Ze creëerden ook een kleinere, super-moeilijke versie genaamd TERMINALWORLD-VERIFIED (200 taken) die door mensen dubbelgecontroleerd werd om ervoor te zorgen dat deze 100% accuraat is.

4. De schokkende resultaten

Ze zetten 's werelds slimste AI-modellen (zoals de nieuwste versies van Claude, GPT en Gemini) en hun "agent"-frameworks (de software die de AI helpt de computer te gebruiken) door deze nieuwe test.

Hier is wat ze ontdekten:

  • De "Efficiëntie-paradox": Hoe slimmer de AI, hoe meer het soms worstelt. De beste AI slaagde slechts voor 62,5% van de taken. Wanneer ze faalden, gaven ze niet op; ze bleven proberen, waardoor enorme hoeveelheden tijd en geld werden verspild aan het verkennen van de verkeerde paden. Het is als een student die dezelfde verwarrende alinea keer op keer opnieuw leest in plaats om hulp te vragen.
  • De "Puzzel versus Realiteit"-kloof: Er was bijna geen connectie tussen hoe goed een AI presteerde op de oude "raadsel"-tests (Terminal-Bench) en hoe goed het presteerde op deze nieuwe "real life"-test.
    • Analogie: Een AI kan een kampioen zijn in het oplossen van Sudoku-puzzels (de oude test), maar volledig falen bij het daadwerkelijk rijden met een auto in het verkeer (de nieuwe test). De oude tests waren gewoon te verschillend van echt werk.
  • Agents versus Mensen: Wanneer de AI een taak oploste, deed het dit zelden op dezelfde manier als de mens in de opname. Ze namen verschillende paden om naar dezelfde bestemming te komen. Dit is eigenlijk goed! Het betekent dat de AI niet gewoon kopieert; het bedenkt zijn eigen manier, zelfs als die manier langer is dan die van de mens.

De Conclusie

Het artikel stelt dat we niet langer tests kunnen vertrouwen die door experts in een lab zijn bedacht. Om te weten of een AI echt klaar is om in de echte wereld te werken, moeten we het testen op echte menselijke workflows die rommelig, complex en voortdurend veranderend zijn.

TERMINALWORLD is een tool die automatisch echt menselijk werk omzet in een test, waardoor wordt gegarandeerd dat naarmate ontwikkelaars veranderen hoe ze werken, onze tests voor AI er direct naast evolueren. Het is een verschuiving van het testen van "kun je een puzzel oplossen?" naar "kun je de baan doen?".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →