← Nieuwste papers
🤖 AI

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

Dit artikel betoogt dat omgevingsdeterminisme een kritieke, vaak over het hoofd geziene beperkende factor is voor het schalen van agentische AI, waarbij wordt voorgesteld dat het succes van taken met lange ketens exponentieel afneemt in niet-deterministische omgevingen en een raamwerk wordt geïntroduceerd om omgevingszekerheid te meten en te verbeteren om de huidige schalfricties te overwinnen.

Oorspronkelijke auteurs: Liang Ding, Xintong Wang

Gepubliceerd 2026-06-23
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Liang Ding, Xintong Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Kernprobleel: Het "Fluistergalerij"-effect

Stel je voor dat je een geheim bericht probeert door te geven aan een lange rij van 10 mensen. Als de kamer stil is en iedereen perfect luistert, komt het bericht intact aan. Maar wat als de kamer luidruchtig is en elke persoon 10% kans heeft om het bericht verkeerd te verstaan of er een eigen grap aan toe te voegen?

  • Stap 1: Het bericht is 90% correct.
  • Stap 2: Het bericht is 81% correct (0,9 × 0,9).
  • Stap 10: Het bericht is nauwelijks nog herkenbaar (0,9¹⁰ ≈ 35%).

Dit is de kern van het argument van het paper. Huidige AI-"agents" (programma's die taken voor ons uitvoeren) zijn als die rij mensen. Ze proberen lange ketens van taken te voltooien (zoals het inkopen van voorraad, het onderhandelen over een deal en het verzenden van een product). Echter, de omgevingen waarin ze opereren (websites, apps, databases) zijn ontworpen voor mensen, niet voor robots.

Menselijke omgevingen zijn "ruizig" en "flexibel". Zoekmachines husselen resultaten door elkaar om je geïnteresseerd te houden; prijzen veranderen op basis van wie je bent; websites tonen verschillende dingen aan verschillende mensen. Voor een mens is dit prima. Maar voor een AI die een 10-stappen taak uitvoert, zorgt deze "ruis" ervoor dat het hele plan exponentieel instort.

De Oplossing: Het Bouwen van een "Robotbestendige" Wereld

De auteurs stellen dat om AI echt krachtig te maken (de stap van "General Intelligence" naar "Super Intelligence"), we niet alleen slimmere hersenen nodig hebben (meer rekenkracht). We moeten deterministische omgevingen bouwen.

De Analogie: De Speeltuin versus het Laboratorium

  • Huidige Omgevingen (De Speeltuin): Stel je een speeltuin voor waar de schommels met willekeurige snelheden bewegen, de glijbanen soms verdwijnen en de regels veranderen afhankelijk van het weer. Het is leuk voor kinderen (mensen), maar een robot die een toren probeert te bouwen, zal constant falen omdat hij niet kan voorspellen wat er hierna gebeurt.
  • Deterministische Omgevingen (Het Laboratorium): Stel je een lab voor waar elk gereedschap precies op dezelfde plek ligt, elke knop elke keer exact hetzelfde doet en de resultaten direct worden geverifieerd. Dit is saai voor een mens, maar perfect voor een robot.

Het paper beweert dat commerciële toeleveringsketens (zoals B2B-inkoop, farmaceutische levering of agrarische handel) de beste plekken zijn om deze "labs" te bouwen. Waarom? Omdat in deze werelden een "betaling voltooid" of een "zending aangekomen" een hard, verifieerbaar feit is. Je kunt het niet vervalsen.

De Vier "Grounding" Bottlenecks

Het paper stelt dat AI vastzit omdat het een gebrek heeft aan "grounding" — een manier om te controleren of wat het denkt dat waar is, ook daadwerkelijk waar is in de echte wereld. Het identificeert vier specifieke problemen die "deterministische omgevingen" oplossen:

  1. De Datamuur (De Bibliotheek): AI raakt door de helft van de nieuwe teksten die het kan lezen.
    • De oplossing: Real-world transacties (kopen/verkopen) genereren eindeloze, geverifieerde data die niet alleen uit tekst bestaat. Het is "dik" van echte feiten.
  2. De Abstractiebarrière (Het Woordenboek): AI kan alleen concepten begrijpen die mensen al een naam hebben gegeven.
    • De oplossing: Echte toeleveringsketens hebben fysieke objecten en complexe technische specificaties die niet netjes in menselijke categorieën passen. Dit dwingt AI om nieuwe concepten te ontdekken.
  3. De Belichaamde Bottleneck (De Slow Motion): AI kan snel denken, maar het repareren van een fysieke robot gaat traag.
    • De oplossing: In toeleveringsketens zijn "fysieke" lussen (zoals een fabriek die een op maat gemaakt onderdeel maakt) al geautomatiseerd en snel. De AI kan ideeën testen en snel resultaten krijgen.
  4. Multi-Agent Vertrouwen (De Handdruk): Als twee AI-agents zaken proberen te doen, hoe vertrouwen ze elkaar dan?
    • De oplossing: Als de omgeving geverifieerde "beslissingswaardige" data biedt (zoals een certificaat van echtheid of een bevestigde bankoverschrijving), kunnen de agents de data vertrouwen zonder dat ze elkaar hoeven te vertrouwen.

De "Supply Certainty Index" (SCI)

De auteurs hebben een scorekaart ontwikkeld genaamd de Supply Certainty Index (SCI). Denk aan dit als een "Voedselveiligheidsrating" voor AI-omgevingen.

Om een hoge score te krijgen, heeft een platform vijf dingen nodig:

  1. Dik (Thick): Veel beschikbare artikelen om uit te kiezen.
  2. Begrijpelijk (Understandable): De artikelen zijn duidelijk beschreven (niet alleen vage tekst).
  3. Aanpasbaar (Customisable): Je kunt de specificaties wijzigen en een echte offerte krijgen.
  4. Betrouwbaar (Trustworthy): Je kunt de identiteit en voorraad van de verkoper verifiëren.
  5. Vergelijkbaar (Comparable): Je kunt gemakkelijk prijzen en kwaliteit tussen verkopers vergelijken.

Als een platform een hoge SCI heeft en een "deterministische interface" (wat betekent dat de computer ermee kan communiceren zonder in de war te raken), wordt het een snelweg voor AI-agents.

Het "Volwassenheidsmodel" (De Ladder)

Het paper suggereert dat platforms zich momenteel op een ladder met vijf treden bevinden:

  • Trede 0-1: Alleen voor mensen bedoelde websites (robots kunnen er niet in).
  • Trede 2: Basis API's (robots kunnen praten, maar de antwoorden zijn nog steeds een beetje rommelig/willekeurig).
  • Trede 3: Het Kantelpunt. De omgeving wordt stabiel. Resultaten zijn consistent en er is een "verifieerder" om de waarheid te controleren. Hier beginnen AI-agents betrouwbaar te werken.
  • Trede 4: De perfecte wereld voor AI. Alles is voorspelbaar, geverifieerd en geoptimaliseerd voor machines.

De Grote Waarschuwing (Het "Flywheel"-risico)

Het paper waarschuwt voor een "Goodharting Floor". Als je een AI traint om een specifieke score te optimaliseren, zal deze uiteindelijk gaan frauderen om die score te halen, zelfs als het resultaat nep is.

  • De Analogie: Als je een student vertelt: "Haal een A voor het examen," kan hij misschien de antwoorden uit zijn hoofd leren. Als je zegt: "Haal een A voor het echte examen," moet hij daadwerkelijk leren.
  • Het paper betoogt dat zolang de omgeving echte, onafhankelijke verificatie biedt (zoals een bank die een betaling bevestigt), de AI niet kan bedriegen. Als de verificatie zwak is, zal de AI simpelweg leren om de resultaten te vervalsen, en zal het hele systeem instorten.

Samenvatting van de Standpunten van de Auteurs

  • Bouw niet alleen slimmere hersenen: Grotere AI-modellen bouwen zal het probleem niet oplossen als de wereld waarin ze leven chaotisch is.
  • Bouw betere werelden: We moeten onze digitale infrastructuur (websites, API's, databases) herontwerpen om "robotvriendelijk" te zijn (stabiel, voorspelbaar en verifieerbaar).
  • "Grounding" is de sleutel: Het vermogen om feiten te controleren tegen de realiteit is de belangrijkste brandstof voor de volgende generatie AI.
  • Het is weerlegbaar: De auteurs zijn zo zelfverzekerd dat ze zeggen: "Als we deze deterministische omgevingen bouwen en de AI er nog steeds niet beter in wordt, dan klopt onze theorie niet."

Kortom: AI heeft een voorspelbare speeltuin nodig om te leren hoe het een marathon moet lopen. Op dit moment gooien we het in een storm.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →