← Nieuwste papers
💻 computer science

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

Deze studie toont aan dat zelfs minimale, enkelkarakterverstoringen in prompts kunnen leiden tot het genereren van kwetsbare code door coderende LLM's, waarbij invoerbeheerfouten beter voorspelbaar zijn vanuit verborgen toestanden dan fouten in veilige standaardinstellingen, waardoor het beveiligingsbedreigingsmodel wordt uitgebreid van prompt-injectie tot ook gewone promptvariaties.

Oorspronkelijke auteurs: Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer getalenteerde, supersnelle leerling-coder inhuurt. Deze leerling (een AI) kan binnen seconden volledige programma's schrijven. Je geeft hen een simpele instructie, zoals "Schrijf een functie om een bestand veilig uit te pakken." Meestal doen ze een uitstekend werk.

Maar dit artikel stelt een eng vraag: Wat als de leerling extreem gevoelig is voor kleine foutjes in hoe je de vraag stelt?

De onderzoekers ontdekten dat als je slechts één letter in je instructie verandert – misschien een typfout, of het vervangen van een woord door een vergelijkbaar woord – de code die de leerling schrijft, plotseling kan veranderen van "veilig en geborgen" naar "vol gaten waar hackers doorheen kunnen lopen".

Hier is een uiteenzetting van hun bevindingen met behulp van alledaagse analogieën:

1. Het "Eén-Letter" Domino-effect

Beschouw de instructie die je aan de AI geeft als een recept. De onderzoekers ontdekten dat als je slechts één letter in het recept verandert (zoals het veranderen van "zout" in "zoutig"), het resulterende gerecht niet alleen iets anders kan smaken; het kan zelfs giftig worden.

  • De Ontdekking: Ze testten drie verschillende AI-modellen en vijf programmeertalen. Ze ontdekten dat het veranderen van één teken in de prompt de code kan omslaan van veilig naar kwetsbaar.
  • De Analogie: Het is alsof je een kok vertelt: "Zorg dat de deur op slot zit," versus "Zorg dat de deur lokt zit" (met een typfout). In dit specifieke geval kan de AI de deur volledig vergeten op slot te doen, waardoor het huis wijd open staat.

2. Twee Verschillende Soorten "Fouten"

De onderzoekers merkten op dat niet alle beveiligingsgaten gelijk zijn. Ze ontdekten twee onderscheiden categorieën, die zich verschillend gedragen:

  • Type A: De "Ontbrekende Wacht" (Invoerbehandeling)

    • Wat het is: De AI vergeet een veiligheidscontrole toe te voegen, zoals een doorman die ID's controleert bij een club.
    • De Bevinding: Het interne "brein" (verborgen staten) van de AI vertoont eigenlijk al tekenen van deze fout voordat het zelfs maar de code schrijft. Het is alsof je ziet dat de kok naar het verkeerde ingrediënt grijpt voordat ze beginnen met koken. De onderzoekers konden deze fouten met ongeveer 75% nauwkeurigheid voorspellen door alleen te kijken naar het denkproces van de AI.
    • Waarom: De AI moet vroeg beslissen om een hele nieuwe "veiligheidsstructuur" in de code in te bouwen. Die beslissing is vroeg zichtbaar.
  • Type B: De "Zwakke Keuze" (Veilige Standaardinstellingen)

    • Wat het is: De AI bouwt de veiligheidsstructuur, maar kiest een zwak slot (zoals een wachtwoord "1234" in plaats van een complex wachtwoord).
    • De Bevinding: Deze zijn veel moeilijker te voorspellen. Het interne brein van de AI ziet er prima uit tot het allerlaatste moment. De beslissing om het zwakke slot te kiezen gebeurt zo laat in het proces dat het "vroegtijdige waarschuwingssignaal" ontbreekt. De onderzoekers konden deze slechts ongeveer 67% van de tijd voorspellen.
    • Waarom: Het is alsof de kok pas besluit om een broos slot op de deur te gebruiken nadat het huis al gebouwd is. Het blauwdruk zag er perfect uit, maar de uiteindelijke keuze was slecht.

3. Waar de Fout Gebeurt, Is Belangrijk

De onderzoekers keken ook naar waar in de instructie de typfout plaatsvond.

  • Het Midden is Kritiek: Ze ontdekten dat typfouten in het midden van de instructie het gevaarlijkst waren.
  • De Analogie: Stel je een zin voor: "Sluit de voordeur en de achterdeur." Als je het woord "voordeur" in het midden typt, kan de AI in de war raken over welke deur op slot moet. Als je het allereerste of laatste woord typt, is de AI waarschijnlijker om het te negeren of correct te raden. Het "vlees" van de instructie is waar de AI het kwetsbaarst is.

4. De "Kristallen Bol" (Probing)

Het team bouwde een "kristallen bol" (een wiskundige sonde) die kijkt naar de interne staat van de AI direct nadat het je prompt heeft gelezen, maar voordat het code schrijft.

  • Het Resultaat: Deze kristallen bol kan je vrij goed vertellen of de AI op het punt staat code te schrijven met "Ontbrekende Wacht"-fouten (Type A).
  • De Beperking: Het heeft moeite om "Zwakke Keuze"-fouten (Type B) te voorspellen. Dit suggereert dat we voor sommige beveiligingsproblemen de AI voordat het begint met schrijven kunnen opvangen, maar dat we voor andere de code terwijl het wordt geschreven of erna moeten controleren.

De Conclusie

Het artikel concludeert dat we er niet van uit mogen gaan dat onze AI-codingassistenten robuust zijn. Een simpele typfout of een lichte herschrijving van een verzoek kan per ongeluk een beveiligingskwetsbaarheid creëren.

  • Goed Nieuws: We kunnen deze risico's soms vroeg opsporen door te kijken naar de interne "gedachten" van de AI.
  • Slecht Nieuws: We kunnen niet alle risico's op deze manier opvangen, vooral niet die waarbij de AI aan het einde van het proces één enkele, slechte keuze maakt.

Belangrijke Opmerking: De onderzoekers benadrukken dat ze dit deden door willekeurige, per ongeluk lijkende typfouten te maken (zoals een mens die zou maken), en niet door de AI opzettelijk te proberen te misleiden. Dit betekent dat het gevaar reëel is, zelfs voor normale, dagelijkse ontwikkelaars die gewoon hun werk willen doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →