← Nieuwste papers
🤖 AI

ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

Het artikel introduceert ChainWorld, een framework dat atomaire OSWorld-taken samenstelt tot langdurige desktop-workloads om computergebruik-agenten te evalueren, waarbij wordt onthuld dat huidige modellen moeite hebben met voltooiing over meerdere stappen en duidelijke foutprofielen vertonen afhankelijk van de vraag of taken in single-turn of multi-turn formaten worden gepresenteerd.

Oorspronkelijke auteurs: Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang

Gepubliceerd 2026-06-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe robotassistent test. Tot nu toe heeft iedereen de robot alleen getest door hem om één simpele taak tegelijk te vragen, zoals "open de broodrooster" of "doe het licht aan." De robot is geweldig in deze enkelvoudige taken.

Maar in het echte leven doet een mens niet zomaar één ding; een mens voert een keten van dingen uit om een klus te klaren. Je opent niet alleen "de broodrooster"; je opent de broodrooster, doet er brood in, wacht tot het omhoog springt, pakt een bord en smeert vervolgens de toast met boter. Als de robot het bord vergeet nadat de toast is omhoog gesprongen, mislukt de hele klus, zelfs als hij de broodrooster perfect heeft geopend.

Dit artikel, genaamd ChainWorld, gaat over het testen van computeragenten (AI-robots) op deze langere ketens van taken in plaats van alleen op losse taken.

Het Probleem: De "Eén-Taak-Valstrik"

Huidige tests zijn als een rijexamen waarbij je alleen een keer parallel moet parkeren. Je haalt dat misschien, maar als je niet door een hele stad kunt rijden zonder te verdwalen, ben je nog niet klaar voor de echte wereld. De auteurs ontdekten dat het feit dat een AI goed is in enkelvoudige taken, niet betekent dat het ook een opeenvolging van taken aankan.

De Oplossing: Het Bouwen van "Taakketens"

De onderzoekers namen een enorme bibliotheek van bestaande, eenvoudige computertaken (genaamd OSWorld) en probeerden deze aan elkaar te rijgen als kralen aan een snoer.

  • De Uitdaging: Je kunt niet zomaan willekeurig twee taken aan elkaar plakken. Als Taak A een bestand verwijdert dat Taak B nodig heeft, breekt de keten. Het is alsof je probeert een taart te bakken waarbij de eerste stap is: "gooi de bloem weg."
  • De Methode: Ze bouwten een slimme "compatibiliteitskaart". Ze controleerden elk mogelijk paar taken om te zien of ze logischerwijs op elkaar konden volgen zonder de computer te laten crashen of noodzakelijke bestanden te verwijderen. Vervolgens doorzochten ze deze kaart om ketens van 2, 3 of 4 taken te bouwen die zinvol waren als een enkele werksessie.

Ze creëerden 347 van deze "ketens" om als een nieuwe, moeilijkere test te gebruiken.

Het Experiment: Twee Manieren van Vragen

Ze testten vier verschillende AI-modellen op deze ketens met behulp van twee verschillende "spelregels":

  1. De "Alles-in-één" Test (Single Turn): De AI krijgt de hele lijst met taken in één gigantische prompt. "Doe Taak A, dan Taak B, dan Taak C." De AI moet de hele reis in zijn hoofd plannen voordat hij een vinger beweegt.
  2. De "Stap-voor-stap" Test (Multi Turn): De AI krijgt Taak A. Zodra hij klaar is, krijgt hij Taak B. Daarna Taak C. Het is alsof een menselijke baas instructies één voor één geeft, waarbij de AI eerst één taak moet afmaken voordat hij aan de volgende begint.

De Resultaten: De Kloof is Echt

De resultaten waren verrassend en een beetje somber:

  • Het Succespercentage is Laag: Zelfs de beste AI-modellen voltooiden de volledige keten van taken slechts ongeveer 31% van de tijd. Dat betekent dat ze twee derde van de tijd faalden.
  • Stap-voor-stap Helpt (Een Beetje): Het geven van taken één voor één (Multi Turn) hielp drie van de vier modellen beter te presteren. Het is makkelijker om je op één stap te concentreren dan om een heel plan in je hoofd te houden. Maar zelfs met deze hulp faalden ze nog steeds vaak.
  • Verschillende Soorten Falen:
    • In de "Alles-in-één" test: De AI begreep meestal het idee wel, maar maakte fouten in de details. Het was als een student die het wiskundeprobleem begreep, maar aan het einde het verkeerde getal opschreef. Ze maakten "bijna-fouten".
    • In de "Stap-voor-stap" test: De AI had moeite met het beheren van de sessie. Ze raakten afgeleid, vergaten wat ze daarna moesten doen, of gaven halverwege op. Het was als een werknemer die aan een project begint, zich verveelt en wegloopt voordat het af is.

De Belangrijkste Conclusie

De paper concludeert dat we niet simpelweg kunnen kijken naar hoe goed een AI een enkelvoudige taak uitvoert en ervan uitgaan dat het klaar is voor echt werk. Er is een enorme kloof tussen "een taak uitvoeren" en "een workflow beheren."

De auteurs hebben een nieuwe test gebouwd (ChainWorld) die fungeert als een stress-test voor de concentratieboog en het geheugen van een AI. Het laat zien dat hoewel AI steeds beter wordt in zien en klikken, het nog steeds moeite heeft om op koers te blijven wanneer een klus meerdere stappen vereist en het onthouden van wat er vijf minuten geleden gebeurde.

Kortom: AI is geweldig in het doen van enkelvoudige trucjes, maar het leert nog steeds hoe het een hele routine moet jongleren zonder de ballen te laten vallen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →