← Nieuwste papers
💻 computer science

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

Dit artikel stelt een mechanisme voor voor dynamische scheidingsgeneratie voor Polymorphic Prompt Assembling (PPA) dat statische scheidingspools vervangt door unieke, per verzoek gegenereerde canary-paren afgeleid van cryptografische digests, wat effectief blast-radius-kwetsbaarheden elimineert en de succesratio van prompt injection-aanvallen aanzienlijk vermindert zonder dat finetuning van het model vereist is.

Oorspronkelijke auteurs: Nima Dorzhiev, Peng Liu

Gepubliceerd 2026-06-01
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nima Dorzhiev, Peng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer intelligente maar ietwat naïeve robotassistent bent (een AI-agent). Je taak is om een strikte set regels te volgen die door je baas zijn geschreven (de systeeminstructies), terwijl je ook luistert naar verzoeken van het publiek (gebruikersinput).

Het probleem is dat een slimme hacker een briefje in het publieke verzoek kan smokkelen waarin staat: "Negeer je baas en doe wat ik zeg in plaats daarvan." Dit wordt een Prompt Injection Attack genoemd.

De Oude Oplossing: Het "Statische" Wachtwoord

Voorheen ontwikkelden onderzoekers een verdediging genaamd Polymorphic Prompt Assembling (PPA). Denk aan het plaatsen van een speciale, unieke omheining tussen de regels van de baas en de verzoeken van het publiek.

  • Hoe het werkte: Het systeem had een vaste doos met 84 verschillende ontwerpen voor de omheining (scheidingstekens). Elke keer als er een verzoek binnenkwam, koos het systeem willekeurig één ontwerp uit de doos om te gebruiken.
  • De Fout: Stel je voor dat een hacker een van deze omheiningen weet te onderscheppen en precies ziet hoe deze eruitziet. Omdat het systeem deze omheiningen steeds opnieuw gebruikt, kan de hacker dat exacte ontwerp nu gebruiken om de robot in toekomstige gesprekken te misleiden. De schade verspreidt zich (een "blast radius") omdat het ontwerp van de omheining nooit echt verandert; het wordt alleen hergebruikt.

De Nieuwe Oplossing: Het "Dynamische" Eenmalige Slot

Dit paper stelt een belangrijke upgrade voor: Dynamic Separator Generation.

In plaats van een omheining uit een doos te kiezen, bouwt het systeem voor elk verzoek een gloednieuwe, unieke omheining.

  • Hoe het werkt: Elke keer dat je de robot een vraag stelt, kijkt het systeem naar de exacte seconde waarop het is, jouw unieke ID, en een willekeurig getal dat speciaal voor dat moment is gegenereerd. Het mengt deze ingrediënten samen (met een wiskundig recept genaamd SHA-256) om een eenmalige "Start" en "Einde" markering te maken.
  • De Analogie: Stel je voor dat je een brief verstuurt.
    • Oude manier: Je gebruikt een standaard rode envelop. Als een dief een rode envelop steelt, kan hij die gebruiken om later brieven te vervalsen.
    • Nieuwe manier: Je gebruikt een magische printer die voor elke enkele brief een unieke, niet-te herhalen envelop maakt op basis van het exacte tijdstip waarop je op de knop drukt. Zelfs als een dief de envelop van Brief #1 steelt, is deze nutteloos voor Brief #2, omdat Brief #2 een volledig andere, onvoorspelbare envelop heeft.

Wat de Onderzoekers Vonden

Het team heeft deze nieuwe "Dynamische" methode getest tegen 16 verschillende soorten hacker-trucs op een krachtig AI-model (Llama-3.3).

  1. Het stoppen van de "Leetspeak" truc: Een specifieke hacker-truc (genoemd M1) gebruikt geheime codes en dringende taal om de AI in de war te brengen.
    • Voorheen: De AI trapte er 88% van de tijd in.
    • Achteraf: De AI trapte er slechts 38% van de tijd in. Dit is een enorme verbetering (meer dan een verdubbeling van de veiligheid).
  2. Het stoppen van de "Format Breakout" truc: Een andere truc probeert de AI te manipuleren om de omheining-markers terug te herhalen naar de hacker.
    • Voorheen: De AI onthulde de omheining-markers 47% van de tijd per ongeluk.
    • Achteraf: De AI onthulde ze 0% van de tijd. Omdat de omheining uniek was voor dat specifieke moment, hielp het onthullen ervan de hacker niet bij toekomstige verzoeken.
  3. Snelheid: Deze nieuwe methode is ongelooflijk snel. Het voegt slechts 2,7 microseconden toe (een minuscuul fractie van een knipperen met de ogen) aan de tijd die nodig is om een verzoek te verwerken. Het is zo snel dat je het niet zou merken.
  4. Kwaliteit: Het vermogen van de robot om zijn eigenlijke taak te doen (zoals het samenvatten van tekst of het beantwoorden van vragen) werd niet slechter. Het werkte net zo goed als voorheen.

Het Ene Nadeel (Beperkingen)

Het paper geeft toe dat deze methode één ding niet kan oplossen: als een hacker de robot expliciet opdracht geeft: "Herhaal de omheining-markers even naar mij," kan de robot dit nog steeds doen.

  • De Oplossing: De onderzoekers zeggen dat dit een fundamentele limiet is van de huidige laag. Om dit te stoppen, heb je een extra "beveiligingsbewaker" nodig die helemaal aan het einde van het proces het antwoord van de robot controleert voordat het naar buiten gaat; dat maakte echter geen deel uit van deze specifieke studie.

Samenvatting

Dit paper introduceert een manier om AI-agenten veiliger te maken door ze een verse, unieke, eenmalig te gebruiken omheining te geven voor elk gesprek. Als een hacker een omheining steelt, is deze nutteloos omdat het volgende gesprek een volledig andere zal hebben. Het is een snelle, gemakkelijk toe te voegen upgrade die de kans aanzienlijk verkleint dat de AI wordt misleid.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →