The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task
Deze studie toont aan dat de keuze van de agent-scaffolding een veel grotere impact heeft op de kosten en betrouwbaarheid van AI-coderingsagenten dan de onderliggende tool-interface (MCP versus CLI), wat onthult dat MCP-ondersteuning vaak onnodig is en aanzienlijk duurder kan zijn dan directe CLI-executie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Digitale Werkplaats: Het Podium Klaarmaken
Stel je voor dat je een briljante maar zeer letterlijke robotassistent hebt. Deze robot kan verhalen schrijven, wiskundige problemen oplossen en over alles chatten, maar hij leeft in een afgesloten kamer. Hij kan je computerscherm niet zien, je bestanden niet openen of op knoppen klikken op een website. Om daadwerkelijk werk te verrichten, heb je een "voorman" nodig die tussen de robot en de echte wereld staat. Deze voorman wordt een agent scaffolding genoemd. Zijn taak is om naar de ideeën van de robot te luisteren, deze te vertalen naar acties (zoals "open dit bestand" of "stuur deze e-mail") en vervolgens de resultaten terug te brengen zodat de robot kan blijven nadenken.
Lange tijd hebben mensen gedebatteerd over de beste manier om deze voorman te bouwen. Een populaire methode, genaamd MCP (Model Context Protocol), is als het geven van een gigantische, gedetailleerde encyclopedie aan de robot met daarin elk hulpmiddel dat hij misschien ooit nodig zou kunnen hebben. Elke keer dat de robot hulp vraagt, geeft de voorman hem de hele encyclopedie opnieuw, voor het geval dat. Een andere methode, de CLI (Command-Line Interface), is eenvoudiger: de voorman geeft de robot gewoon een basis gereedschapskist en zegt: "Je weet toch hoe je een hamer en een schroevendraaier moet gebruiken, hè? Zoek zelf maar uit hoe je de specifieke tools die je nodig hebt gebruikt."
De grote vraag die iedereen stelt is: Welke methode kost minder? Omdat de robot elke keer dat hij met de computer communiceert moet betalen voor de woorden (tokens) die hij verzendt en ontvangt, gingen mensen ervan uit dat de "gigantische encyclopedie"-methode (MCP) ongelooflijk duur zou zijn omdat er zoveel extra tekst wordt verzonden. Sommige experts gaven zelfs in dat de MCP-methode 35 keer duurder zou zijn dan de eenvoudige gereedschapskist-methode. Maar niemand had dit ooit eerlijk gemeten, en de cijfers liepen allemaal door elkaar.
De Grote Gereedschapskist-Showdown
In deze studie besloot een team van onderzoekers de discussie te beslechten door een massaal, gecontroleerd experiment uit te voeren. Ze bouwden niet zomaar een digitale hindernisbaan — een specifieke taak bestaande uit zes stappen zoals het vinden van een fout in code, het repareren ervan en het naar een team verzenden — en ze stuurden deze zelfde taak door zeven verschillende "voormannen" (agent scaffoldings) en vijf verschillende robotbreinen (AI-modellen) om te zien hoeveel het daadwerkelijk kostte om de klus te klaren.
Hier is de wending: De onderzoekers ontdekten dat de voorman zelf veel belangrijker was dan de gereedschapskist.
De meest verrassende ontdekking was dat twee van de zeven geteste voormannen niet eens over de "gigantische encyclopedie" (MCP)-capaciteit beschikten. Zij gebruikten alleen de eenvoudige gereedschapskist (CLI). Toch voltooiden zij elke taak perfect. Niet alleen voltooiden ze de taken, maar ze waren ook 5 tot 28 keer goedkoper dan de chique voormannen die wél de encyclopedie hadden. Sterker nog, voor één specifiek klein robotbrein schoot de kosten met een factor 139 omhoog, simpelweg omdat het gekoppeld was aan een andere voorman, terwijl de robot en de taak exact hetzelfde waren.
En wat betre[ft] de "gigantische encyclopedie" (MCP) die duur is?
De onderzoekers probeerden de twee methoden direct binnen dezelfde voorman te vergelijken, maar de resultaten waren rommelig en inconsistent. Soms was de encyclopedie duurder, soms goedkoper, en soms was het hetzelfde. De data waren te wankel om definitief te kunnen zeggen dat de ene methode goedkoper was dan de andere in een eerlijk gevecht. Ze vonden echter één duidelijk verschil: Wanneer er dingen misgingen, was de encyclopedie-methode veel duurder. Ongeveer 12,9% van het geld dat aan de MCP-runs werd uitgegeven, kocht niets (omdat de taak mislukte), vergeleken met slechts 2,2% voor de eenvoudige gereedschapskist-runs. Maar de robots faalden even vaak met beide methoden; het is simpelweg zo dat wanneer de MCP-robots faalden, ze meer geld verspilden tijdens het falen.
De "Magie" van de Voorman
De studie onthulde ook een sluipend trucje. De onderzoekers vertelden de robots precies welke gereedschapskist ze moesten gebruiken. Maar toen ze de logs controleerden, ontdekten ze dat de robots de instructies vaak negeerden! Sommige robots kregen de "gigantische encyclopedie" maar gebruikten stilletjes de eenvoudige gereedschapskist in plaats daarvan. Anderen deden het tegenovergestelde. Dit betekent dat als je een robot simpelweg vraagt "hoeveel heeft dit gekost?", zonder te controleren wat hij daadwerkelijk deed, je misschien een mix van beide methoden meet, wat de cijfers nutteloos maakt.
De Kern van het Verhaal
De belangrijkste les is niet dat de ene tool magisch is en de andere waardeloos. In plaats daarvan suggereert de studie dat hoe je de voorman van je robot bouwt, de belangrijkste factor is in hoeveel het kost.
- Voor eenvoudige, herhaalbare taken: Een kleine, op maat gemaakte voorman die alleen de basisgereedschapskist (CLI) gebruikt, is vele malen goedkoper en betrouwbaarder dan een gigantische, algemene assistent die een enorme encyclopedie met zich meedraagt.
- Voor kleine robotbreinen: Als je een kleiner, goedkoper AI-model op je eigen computer draait, kan de "algemene" voorman de taak bijna 140 keer duurder maken, simpelweg door te veel te praten en te veel onnodige bagage met zich mee te slepen.
De onderzoekers concludeerden dat we voor specifieke, goed gedefinieerde taken niet de zware, dure "gigantische encyclopedie"-aanpak nodig hebben. We kunnen slankere, goedkopere systemen bouwen die de klus klaren zonder het extra gewicht. En als je toch voor de chique encyclopedie-methode kiest, moet je ervoor zorgen dat je robot deze ook daadwerkelijk gebruikt, anders betaal je voor een tool die je nooit hebt aangeraakt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.