World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems
Dit paper introduceert "World of Workflows" (WoW), een nieuwe benchmark die aantoont dat huidige AI-modellen tekortschieten in complexe bedrijfsomgevingen omdat ze de onzichtbare, opeenvolgende effecten van hun acties op verborgen workflows niet kunnen voorspellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een nieuwe baan krijgt bij een gigantisch, hypermodern bedrijf. Alles lijkt perfect: je hebt een computer, een bureau en een lijst met taken. Maar er is één probleem: het bedrijf werkt met een onzichtbaar, magisch web van regels.
Als jij een pen bestelt, kan het zijn dat de computer automatisch een melding stuurt naar de manager, die vervolgens besluit dat je budget voor koffie deze maand lager wordt. Of als je een dossier verplaatst, kan een onzichtbare robot plotseling besluiten dat je geen toegang meer hebt tot de kantine. Je ziet de actie (de pen bestellen), maar je ziet de "rimpel in de vijver" (het lagere koffiebudget) niet.
Dit is precies waar dit wetenschappelijke onderzoek over gaat. Hier is de uitleg in gewone mensentaal:
Het Probleem: De "Blinde" Digitale Assistent
Tegenwoordig hebben we slimme AI-assistenten (zoals ChatGPT). Ze zijn geweldig in het schrijven van gedichten of het beantwoorden van vragen. Maar als je ze in een echt groot bedrijf zet om taken uit te voeren, gaat het mis.
Waarom? Omdat grote bedrijven werken met "Workflows". Dit zijn verborgen kettingreacties. In het onderzoek noemen ze dit de "Dynamics Blindness" (dynamische blindheid). De AI ziet alleen wat hij direct doet, maar hij begrijpt niet de onzichtbare gevolgen die drie stappen verderop in het systeem gebeuren.
De metafoor: Het is alsof je een AI een dominosteen laat omgooien. De AI denkt: "Klaar! Ik heb de steen omgegooid, taak volbracht!", terwijl hij niet ziet dat die ene steen een kettingreactie heeft veroorzaakt die een hele rij andere stenen omverwerpt en uiteindelijk een vaas van de tafel laat vallen.
De Oplossing: "World of Workflows" (WoW)
De onderzoekers hebben een soort "digitale speeltuin" gebouwd, genaamd WoW. Dit is een nagebootste bedrijfsomgeving (gebaseerd op een echt systeem genaamd ServiceNow) die vol zit met duizenden verborgen regels en 55 complexe kettingreacties.
Ze hebben een test ontwikkeld (WoW-bench) om te kijken hoe slim de AI echt is. Ze testen niet alleen of de AI de taak kan uitvoeren, maar ook of de AI kan voorspellen wat er gebeurt als hij iets doet.
De Grote Ontdekking: De AI is een "Greedy Planner"
De resultaten waren een wake-up call. De onderzoekers ontdekten drie grote fouten die de AI maakt:
- De Identiteitsverwarring: De AI ziet namen, maar begrijpt de codes niet. Als de AI een gebruiker moet zoeken, zoekt hij op "Jan Jansen", terwijl het systeem eigenlijk een ingewikkelde code zoals
XJ-992nodig heeft. Het is alsof je iemand zoekt in een bibliotheek op basis van zijn kleding in plaats van zijn paspoortnummer. - De Voorspellingsfout: De AI kan niet "vooruitkijken". Hij begrijpt de "wetten van de natuurkunde" van het bedrijf niet. Hij weet niet dat actie A automatisch leidt tot gevolg B.
- De Causaliteitskloof: Dit is de gevaarlijkste. De AI voert een actie uit die op het eerste gezicht prima lijkt, maar die een verborgen regel triggert waardoor hij later in het proces een fout maakt. Hij is een "Greedy Planner": hij kijkt alleen naar de directe winst van de volgende stap, zonder te zien dat hij zichzelf in een hoek aan het drijven is.
Wat betekent dit voor de toekomst?
De onderzoekers zeggen: we moeten stoppen met AI te trainen om alleen maar "braaf instructies op te volgen". We moeten AI leren om een "World Model" te bouwen.
In plaats van een assistent die alleen maar knoppen indrukt, hebben we een assistent nodig die in zijn hoofd een simulatie draait: "Als ik deze knop nu indruk, wat gebeurt er dan over tien minuten in de boekhouding?"
Kortom: We willen geen AI die alleen maar kan praten, we willen een AI die begrijpt hoe de wereld (en het bedrijf) echt in elkaar steekt, inclusief alle onzichtbare rimpelingen die een actie veroorzaakt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.