← Nieuwste papers
🤖 AI

Scaffold Effects on GAIA: A Controlled Comparison

Deze vooraf geregistreerde gecontroleerde studie toont aan dat de keuze van het scaffold een significante impact heeft op de prestaties van agenten op GAIA-benchmarks, wat onthult dat gemeten capaciteitsscores sterk scaffold-conditioneel zijn en dat de verwachte afname van scaffold-gevoeligheid naarmate modellen verbeteren niet standhoudt, waarbij gestructureerde multi-agent ontwerpen vaak substantiële nauwkeurigheidswinsten opleveren ten opzichte van standaard ReAct-benaderingen.

Oorspronkelijke auteurs: Jason Starace

Gepubliceerd 2026-06-09
📖 2 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jason Starace

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te beoordelen hoe goed een chef-kok is in het bereiden van een complex gerecht. Je hebt drie verschillende keukens (scaffolds) om de chef in te testen:

  1. De Solo Chef (ReAct): De chef denkt, pakt een ingrediënt, kookt, denkt opnieuw en pakt het volgende ingrediënt, alles in één continue stroom.
  2. Het Keukenteam (Planner-Actor-Rater): Een manager schrijft een recept, een kok voert de stappen uit, en een criticus proeft het gerecht na elke stap om te controleren of het goed is voordat er wordt doorgegaan.
  3. Het Blauwdruk & Bouwer Systeem (Planner-then-Executor): Eerst schrijft een planner een gedetailleerde, stap-voor-stap blauwdruk zonder gereedschap. Daarna neemt een bouwer die blauwdruk en bouwt het gerecht.

Deze studie vroeg een simpele vraag: Verandert de keuken waarin je de chef plaatst hoe goed ze lijken te zijn?

Het antwoord is een volmondig ja. Sterker nog, de "keuken" is net zo belangrijk als het werkelijke talent van de chef.

De Grote Ontdekking: De "Keuken" Doet Er Meer Toe Dan Je Denkt

De onderzoekers testten vijf verschillende "chefs" (AI-modellen van Anthropic, Google en OpenAI) op een reeks moeilijke puzzels (genaamd GAIA). Ze ontdekten dat het simpelweg wisselen van de keukenopstelling het score van een model met 28 procentpunt kon veranderen.

Om dit in perspectief te plaatsen: Als je een model test in een "Solo Chef"-keuken en het haalt een score van 56%, maar je plaatst datzelfde model vervolgens in een "Keukenteam"-opstelling, dan kan het plotseling een score van 84% halen. De chef is niet veranderd; de manier waarop ze mochten werken, deed dat wel.

Dit betekent dat wanneer we koppen zien zoals "Model X is 80% slim", dat getal niet alleen over het model gaat. Het is een mix van het brein van het model plus de specifieke instructies en tools die het heeft gekregen. Als je twee modellen vergelijkt die in verschillende keukens zijn getest, vergelijk je niet hun breinen; je vergelijkt hun keukens.

Mythe Doorbreken: "Slimmere" Modellen Hebben Niet Minder Hulp Nodig

De onderzoekers hadden een vermoeden (hypothese) dat de meest krachtige, "frontier"-modellen zo slim zouden zijn dat ze niet veel zouden geven om de keukenopstelling. Ze dachten dat een superbrein een rommelige keuken net zo goed zou kunnen afhandelen als een schone keuken.

Ze zaten ernaast.

Sterker nog, het krachtigste model dat ze testten (Anth

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →