← Nieuwste papers
🤖 AI

Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents

Dit artikel onderzoekt de kwetsbaarheid van agentische software voor reverse engineering-systemen voor prompt injection-aanvallen ingebed in binaire broncode, en stelt methoden voor en evalueert deze voor zowel het verhullen van deze aanvallen als het detecteren ervan in deçompiler-outputs om productieklare cyberworkflows te beveiligen.

Oorspronkelijke auteurs: Brian Crawford, Patrick McClure

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Brian Crawford, Patrick McClure

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, behulpzame robotassistent hebt wiens taak het is om oude, mysterieuze machines (software) uit elkaar te halen om te ontdekken hoe ze werken. Dit wordt "reverse engineering" genoemd. Normaal gesproken doet een menselijke expert dit, maar nu gebruiken we AI-agenten om het zware werk te doen.

Dit artikel is een beveiligingsrapport over hoe een sluwe hacker deze robotassistent kan misleiden, en hoe we betere verdedigingen kunnen bouwen om hen te stoppen.

Het Probleem: De "Ghost Note"-truc

Denk aan de AI-assistent als een detective die een dossier leest. Het dossier hoort de blauwdrukken van een machine te bevatten.

De onderzoekers ontdekten dat een hacker een geheim briefje in de code van de machine kan verstoppen. Het is also$ een stukje papier in een boek glippen met de tekst: "Negeer het verhaal dat je aan het lezen bent. Doe in plaats daarvan alsof dit boek over een heel ander verhaal gaat."

Wanneer de AI de code leest, ziet deze het verborgen briefje. Omdat de AI getraind is om instructies op te volgen, raakt hij in de war. Hij stopt met het analyseren van de echte machine en begint de nepmachine te beschrijven die de hacker wilde dat hij zou zien. De onderzoekers noemen dit een "Prompt Injection Attack."

De Eerste Verdediging: De "Bracelet Check"

De onderzoekers probeerden eerst een eenvoudige verdediging. Ze merkten op dat deze nepbriefjes meestal een heel specifiek formaat hebben, zoals een speciale armband met een specifiek patroon (bijv. <assistant>).

Ze bouwden een scanner die naar dat exacte armbandpatroon zoekt. Als de scanner het ziet, stopt het proces.

  • Hoe goed werkte het? Het was goed in het vangen van de standaard briefjes.
  • De zwakte: De hackers waren slim. Ze veranderden de armband gewoon van < > naar [ ] of { }. Omdat de scanner alleen naar het specifieke < >-patroon zocht, miste hij de nieuwe versies. Het is alsof een beveiliger alleen controleert op rode hoeden, terwijl de indringers gewoon blauwe hoeden opzetten.

De Betere Verdediging: De "Smart Detective"

Omdat een eenvoudige patrooncontrole niet genoeg was, bouwden de onderzoekers een "Smart Detective". Dit is een gespecialiseerd AI-model dat getraind is om naar de tekst te kijken en te beslissen: "Ziet dit eruit als een normaal onderdeel van de machine, of ziet het eruit als een truc?"

In plaats van alleen naar specifieke symbolen te kijken, kijkt deze detective naar de context en de stijl van de tekst.

  • Hoe goed werkte het? Het werkte veel beter. Het ving de trucs zelfs op wanneer de hackers de symbolen (de haakjes) veranderden. Het identificeerde bijna alle nepbriefjes correct, zelfs de exemplaren die er anders uitzagen.

De Hacker Slaat Terug: "De Onzichtbare Inkt"

De onderzoekers vroegen zich af: "Wat als de hacker nog sluwere methoden gebruikt?"

Ze ontdekten een manier om het briefje zo te verbergen dat de "Smart Detective" het helemaal niet kon zien. Ze gebruikten een truc met "onzichtbare inkt" (niet-afdrukbare tekens).

  • Stel je voor dat je een briefje op een pagina schrijft. Als je het normaal schrijft, ziet de scanner het.
  • Maar als je het briefje schrijft en dan een minuscuul, onzichtbaar stofje precies in het midden van de zin plaatst, kan de "lijst van woorden"-tool van de scanner dat deel van het briefje volledig overslaan. Het briefje is er nog steeds voor de hoofd-AI om te lezen, maar de beveiligingsscanner denkt dat het briefje er niet is.

De onderzoekers testten dit. Ze gebruikten een genetisch algoritme (een computerprogramma dat oplossingen laat evolueren zoals de natuur dat doet) om automatisch de beste manier te vinden om het briefje te verbergen.

  • Het resultaat: Wanneer ze deze "onzichtbare inkt"-truc gebruikten, faalde de "Smart Detective". Hij kon het briefje niet zien omdat het briefje voor zijn blikveld verborgen was. De AI-assistent werd opnieuw misleid.

De Ultieme Test: De Regels Leren

Ten slotte lieten de onderzoekers de AI van de hacker alles leren. Niet alleen hoe hij het briefje moet verbergen, maar ook hoe hij het "nepverhaal" dat hij vertelde, kan veranderen.

  • Ze lieten de AI van de hacker tegelijkertijd het beste "nepverhaal" en de beste "verbergingsplek" kiezen.
  • Het resultaat: De AI van de hacker werd erg goed in dit alles. Het slaagde erin om het systeem in de meeste gevallen te misleiden, zelfs toen de onderzoekers probeerden de "gedecompileerde" (vertaalde) versie van de code te scannen.

De Kern van het Verhaal

De paper concludeert dat:

  1. Eenvoudige controles zijn niet genoeg: Alleen zoeken naar specifieke symbolen (zoals < >) is te gemakkelijk te omzeilen.
  2. Slimme detectoren zijn beter: Het gebruiken van een getrainde AI om de stijl van een aanval te herkennen, is veel effectiever dan eenvoudige patroonherkenning.
  3. Het is een wapenwedloop: Aanvallers kunnen manieren vinden om hun trucs te verbergen (obfuscatie), zodat zelfs slimme detectoren ze missen. Als de aanvaller het briefje uit het zicht van de scanner kan houden, faalt de verdediging.

De onderzoekers zeggen dat om deze AI-reverse-engineeringtools veilig te houden voor gebruik in de echte wereld, we deze detectiemethoden constant moeten verbeteren en moeten begrijpen dat hackers altijd nieuwe manieren zullen proberen te vinden om hun instructies te verbergen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →