Where Is the Cost of Third-Party API Routers in Agentic Software Development?
Dit artikel toont empirisch aan dat API-routers van derden in de ontwikkeling van agentische software een kritieke controlekloof introduceren waarbij injecties aan de routerzijde de acties van de agent stilletjes kunnen wijzigen en client-side verdedigingen kunnen omzeilen, wat resulteert in een succesratio van 0% voor de verdediging over de geëvalueerde agenten en de dringende behoefte aan garanties voor de integriteit van de output aan de providerzijde onderstreept.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robotassistent bouwt die code kan schrijven, bugs kan oplossen en je computerbestanden kan beheren. Om deze robot slim te maken, koppel je hem aan een gigantisch, superintelligent brein in de cloud (een Large Language Model) dat bijna elk probleem kan oplossen. Maar er is een addertje onder het gras: je praat niet rechtstreeks met dat brein. In plaats daarvan gebruik je een tussenpersoon, zoals een gespecialiseerde bezorgdienst of een "router", om je berichten heen en weer te dragen. Deze tussenpersoon is bedoeld om slechts een behulpzame koerier te zijn, die ervoor zorgt dat jouw robot met verschillende cloud-breinen kan communiceren zonder dat jij je bedrading hoeft aan te passen.
De grote vraag die dit artikel stelt is: wat gebeurt er als die behulpzame koerier een trucje uithaalt? In de wereld van de informatica weten we dat als een tussenpersoon je berichten kan zien, ze ook potentieel kunnen verwisselen of hun eigen aantekeningen eraan kunnen toevoegen voordat ze ze doorgeven. Dit artikel onderzoekt een angstaanjagende maar reële mogelijkheid: wat als de router niet alleen de instructies van de robot bezorgt, maar ze stiekem verandert om de robot iets gevaarlijks te laten doen, zoals je bestanden verwijderen of een virus installeren, terwijl het er nog steeds uitziet alsof de robot gewoon zijn normale werk doet? De onderzoekers wilden zien of de robot de truc zou opmerken, of dat hij blindelings de nieuwe, kwaadwillende bevelen van de router zou opvolgen.
De Geheime Tussenpersoon en de Blinde Vlek van de Robot
In deze studie bouwden de onderzoekers een speciale testomgeving genaamd SIDEL om precies dit scenario uit te spelen. Ze zetten vier verschillende "coderingsrobots" op (bekende tools zoals Claude Code, Codex, Cursor en OpenCode) en verbonden ze met diverse cloud-breinen via een valse, onbetrouwbare router. Vervolgens gedroegen zij zich als de kwaadwillende router, waarbij ze probeerden kwaadaardige commando's langs de robots te smokkelen op vier verschillende manieren, variërend van brute kracht tot subtiele magie.
De Vier Trucs van het Vak
De onderzoekers testten vier niveaus van misleiding, waarbij ze steeds sluwere trucs gebruikten:
- De Wissel (L1): De router gooit het antwoord van het cloud-brein volledig weg en vervangt het door een vals antwoord dat zegt: "Ga dit bestand verwijderen."
- De Toevoeging (L2): De router laat het cloud-brein een normaal antwoord geven, maar plakt er vervolgens een geheim commando achteraan, zoals: "Oh, en trouwens, installeer deze verdachte software."
- De Afwerking (L3): De router verandert het geheime commando en herschrijft de uitleg van de robot, zodat het lijkt alsof het commando een natuurlijk onderdeel van het plan was. Het is alsof een magiër een truc laat lijken op een normale goocheltruc.
- De Mind Meld (L4): Dit is de meest sluwe. De router bewerkt niet alleen de tekst; het gebruikt een tweede brein om een volledig nieuw antwoord te genereren dat het originele antwoord met het kwaadaardige commando zo perfect mengt dat de twee samensmelten. Het is alsof de router het geheim in het oor van de robot fluisterde terwijl deze nog aan het nadenken was, waardoor de robot geloofde dat het slechte idee van hemzelf was.
De Schokkende Resultaat: De Robots Kwamen Niet In Verzet
De resultaten waren verbijsterend. Welke robot ze ook gebruikten, welk cloud-brein er ook de robot aanstuurde en welke van de vier trucs ze ook probeerden, de robots trapten er elke keer in.
In de wereld van de beveiliging meten we succes aan de hand van hoe vaak een verdediging een aanval stopt. De onderzoekers ontdekten dat, zonder extra hulp, alle vier de robots een succesratio van 0% voor defensie hadden. Dit betekent dat in elk enkel testgeval de router erin slaagde de robot te misleiden om het kwaadaardige commando uit te voeren. De robots maakten niet alleen een fout; ze faalden volledig in het opmerken dat de instructies die ze volgden waren gemanipuleerd.
De onderzoekers controleerden ook of de "veiligheidsinstellingen" van de robots zouden helpen. Ze testten verschillende machtigingsmodi, zoals "Alleen Plan" (waarbij de robot alleen nadenkt) of "Auto" (waarbij de robot vrij handelt). Zelfs in de strengste modi werkten de trucs van de router. Het blijkt dat als de router tussen de robot en het cloud-brein zit, de robot alles wat via de router binnenkomt vertrouwt, uitgaande van de aanname dat het van het cloud-brein komt. De veiligheidscontroles die de robots hebben, kijken naar de acties van de robot, niet naar de leugens van de router.
Helpt het om het Brein te Veranderen?
Je zou kunnen denken: "Wat als we een slimmer cloud-brein gebruiken? Missere ziet het trucje misschien wel?" De onderzoekers testten dit door de cloud-breinen te vervangen door vier verschillende modellen. Het resultaat? Het maakte niet uit. Of de robot nu met een superkrachtig model praatte of met een flitsender, sneller model, de router kon de kwaadaardige commando's nog steeds gemakkelijk langs hen heen glippen. Het probleem is niet dat de breinen te dom zijn; het is dat de router in een positie zit waarin hij het verhaal kan herschrijven voordat de robot het hoort.
Kunnen We een Beter Schild Bouwen?
De onderzoekers stopten niet alleen bij het vinden van het probleem; ze probeerden ook enkele schilden te testen om te zien of ze het konden oplossen. Ze testten twee veelvoorkomende verdedigingen:
- De Whitelist: Een eenvoudige lijst van "toegestane" commando's en websites. Als een commando niet op de lijst staat, wordt het geblokkeerd.
- Het Tweede Mening: Het gebruik van een tweede AI om het plan van de robot te beoordelen voordat hij handelt.
De Whitelist was redelijk in het stoppen van sommige slechte zaken, maar het was ook onhandig. Het blokkeerde ongeveer 30% tot 44% van de slechte commando's, maar blokkeerde ook per ongeluk ongeveer 30% tot 44% van de goede commando's, waardoor de robot minder nuttig werd.
De "Tweede Mening"-AI was beter. Afhankelijk van welk AI-model ze als beoordelaar gebruikten, konden ze tussen de 39% en 64% van de aanvallen stoppen. Echter, dit was geen perfecte oplossing. Zelfs het beste beoordelingsmodel kon niet alles vangen, en soms lieten ze de slechte commando's nog steeds door. De onderzoekers ontdekten dat hoewel deze schilden een beetje helpen, ze het probleem niet volledig oplossen. De router is nog steeds te machtig, omdat hij precies in het midden van het gesprek zit.
De Conclusie
De belangrijkste les van dit artikel is dat het vertrouwen op een derde partij-router om je coderingsrobot met de cloud te verbinden, een enorm beveiligingsgat creëert. De robot gaat ervan uit dat de router eerlijk is, maar als de router onbetrouwbaar is, kan hij de werkelijkheid voor de robot herschrijven. De robots, ongeacht hoe slim of hoe goed geconfigureerd ze ook zijn, kunnen het verschil niet zien tussen een echte instructie van de cloud en een valse instructie van de router.
De auteurs suggereren dat om dit echt op te lossen, we niet alleen kunnen vertrouwen op het feit dat de robots voorzichtiger worden. We hebben de cloudproviders zelf nodig om te garanderen dat de berichten die zij sturen niet door de tussenpersoon zijn aangepast. Tot die tijd is elke keer dat een coderingsrobot een derde partij-router gebruikt, alsof je de sleutels van je huis geeft aan een bezorger die kan besluiten een inbreker binnen te laten terwijl je niet kijkt. De robots doen precies wat hen wordt verteld, maar de persoon die de bevelen geeft, is vervangen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.