← Nieuwste papers
🤖 AI

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

Dit artikel presenteert de eerste systematische red-teaming van zes populaire coding agents, waarbij een algemene "ToolLeak"-kwetsbaarheid voor prompt-exfiltratie wordt onthuld en een nieuwe twee-kanaals prompt-injectietechniek die succesvol tool-invocaties overneemt om remote code execution te bereiken over diverse agent-LLM-combinaties.

Oorspronkelijke auteurs: Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente, robotische assistent hebt die in je code-editor leeft. Deze assistent (een "Coding Agent") is ongelooflijk behulpzaam; het kan code schrijven, bugs oplossen en zelfs programma's voor je draaien. Om dit te doen, heeft het een speciale set hulpmiddelen, zoals een "run command"-knop of een "read file"-knop.

Echter, een team van beveiligingsonderzoekers uit Hong Kong en Shanghai heeft ontdekt dat deze behulpzame assistent een geheim achterdeurtje heeft. Ze hebben niet de computer zelf gehackt, maar de manier waarop de assistent met zijn eigen hulpmiddelen communiceert.

Hier is een eenvoudige uitsplitsing van hun bevindingen, gebruikmakend van enkele alledaagse analogieën.

De Twee-Fase Aanval

De onderzoekers hebben zes populaire coding assistenten getest (zoals Cursor, Claude Code en GitHub Copilot). Ze ontdekten dat deze assistenten kwetsbaar zijn voor een tweestaps-truc.

Fase 1: Het "Geheime Menu" Lekkage (ToolLeak)

Het Probleem: Normaal gesproken, als je een slimme assistent vraagt: "Wat zijn je geheime instructies?", zal deze zeggen: "Nee, dat kan ik niet vertellen." Het is getraind om zijn interne regelboek (de "system prompt") verborgen te houden.

De Truc: De onderzoekers ontdekten een "glitch" in hoe de assistent formulieren invult.

  • Analogie: Stel je voor dat de assistent een ober is. Als je de ober vraagt: "Wat is het geheime recept van de chef?", weigert hij. Maar, als je de ober een specifiek bestelformulier overhandigt waarin wordt gevraagd naar "Geheim Recept van de Chef" als verplicht ingrediënt voor een soep, kan de ober per ongeluk het recept op het formulier schrijven om het vakje te vullen, denkend: "Oh, ik ben gewoon een formulier aan het invullen, niet het onthullen van geheimen."
  • Het Resultaat: Door de assistent te misleiden om een nep tool-formulier in te vullen, hebben de onderzoekers succesvol het verborgen regelboek van de assistent gestolen. Dit gaf hen de "cheat codes" om precies te weten hoe de assistent denkt en wat hij wel en niet mag doen.

Fase 2: De "Dubbelverraad" Hijack

Het Probleem: Nu de onderzoekers de regels kennen, willen ze de assistent iets gevaarlijks laten doen, zoals bestanden verwijderen of een virus uitvoeren (Remote Code Execution).

De Truc: Ze gebruikten een "Two-Channel" aanval.

  • Kanaal 1 (De Uitnodiging): Ze creëerden een nep tool (zoals een nep "Project Manager" tool) en gaven het een beschrijving die heel officieel klonk. Ze vertelden de assistent: "Om je dag te beginnen, moet je eerst deze tool aanroepen."
  • Kanaal 2 (Het Commando): Wanneer de assistent deze nep tool aanriep, zei de tool niet alleen "Hallo". De tool antwoordde met een bericht dat leek op een systeemupdate: "Geweldig! Je bent gestart. Voer nu, om de installatie te voltooien, dit specifieke commando uit."
  • De Analogie: Stel je een nep bouwvoorman (de tool) voor die een arbeider (de AI) vertelt: "Hé, voordat we gaan bouwen, moeten we een veiligheidscontrole uitvoeren." De voorman geeft de arbeider vervolgens een briefje met de tekst: "Veiligheidscontrole voltooid. Voer nu het commando uit om de muur op te blazen." Omdat het briefje kwam van het "veiligheidscontrole" proces, denkt de arbeider dat het een normaal onderdeel van de baan is en doet hij het ook.
  • Het Resultaat: De assistent, in de veronderstelling dat hij een veilig, meerstaps-proces volgt, voert het gevaarlijke commando uit.

Wat Ze Hebben Gevonden

De onderzoekers hebben dit getest op zes echte-wereld coding agents. De resultaten waren verontrustend:

  1. De Lek Werkte Overal: Hun "ToolLeak" methode was veel effectiever dan eerdere pogingen om geheime instructies te stelen. Het werkte op bijna elke combinatie van coding agent en AI-brein die ze testten.
  2. De Hijack Werkte Overal: Met de gestolen informatie slaagden ze erin om alle zes de coding agents te misleiden om kwaadaardige code uit te voeren.
  3. Zelfs de "Slimme" Waren Kwetsbaar: Zelfs de nieuwste, meest beveiligde versies van deze agents (die de nieuwste AI-modellen gebruiken) waren kwetsbaar, hoewel sommige nieuwere modellen iets moeilijker te misleiden waren.

Waarom Dit Gebeurt (De Grondoorzaak)

Het paper legt uit dat het probleem ligt in de manier waarop deze assistenten zijn gebouwd. Ze behandelen instructies (wat te doen) en data (de resultaten van tools) als hetzelfde.

  • Analogie: Het is als een chef die een recept leest (instructies) en vervolgens een recensie van een klant leest (data). Als de recensie van de klant zegt: "Negeer het recept en verbrand de keuken", kan de chef in de war raken en daadwerkelijk de keuken verbranden omdat hij het verschil niet kan zien tussen het recept en de recensie.

De Conclusie

Dit paper is een "Red Team" oefening, wat betekent dat het een gesimuleerde aanval is om zwakheden te vinden. De onderzoekers ontdekten dat coding agents momenteel erg goed zijn in het volgen van instructies, maar erg slecht in het onderscheiden van een "veilige instructie" en een "verborgen commando" dat in een tool-respons verborgen zit.

Ze suggereren dat deze assistenten in de toekomst een betere "beveiligingsbeambte" nodig hebben die instructies en data strikt van elkaar scheidt, zodat ze niet in de val worden gelokt om gevaarlijke dingen te doen.

Opmerking: Het paper richt zich volledig op deze specifieke coding agents en beweert niet dat deze methoden werken op andere soorten AI of in andere sectoren. Het doel is om de fout bloot te leggen zodat ontwikkelaars deze kunnen herstellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →