← Nieuwste papers
🤖 AI

Conjunctive Prompt Attacks in Multi-Agent LLM Systems

Dit paper onthult een structurele kwetsbaarheid in multi-agent LLM-systemen, waarbij 'conjunctive prompt attacks' via de interactie tussen een trigger in de gebruikersquery en een verborgen adversariaal template in een gecompromitteerd agent schadelijk gedrag activeren dat door bestaande verdedigingen wordt gemist omdat geen enkel component op zichzelf kwaadaardig lijkt.

Oorspronkelijke auteurs: Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

Gepubliceerd 2026-04-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, digitale assistent hebt die je helpt met een complexe reis plannen. Deze assistent is geen enkele robot, maar een team van gespecialiseerde robots: één zoekt vluchten, één boekt hotels, en één controleert je account. Ze werken samen, praten met elkaar en delen informatie om jou te helpen.

Dit artikel beschrijft een nieuwe, sluwe manier om dit team te misleiden. De onderzoekers noemen dit een "Conjunctive Prompt Attack" (een aanval door samenvoeging).

Hier is de uitleg in simpele taal, met behulp van een paar creatieve vergelijkingen:

1. Het Probleem: De "Twee Sleutels"

In de oude wereld van kunstmatige intelligentie (AI) keek je naar één robot. Als die robot iets verkeerds deed, was dat duidelijk. Maar in deze nieuwe wereld werken robots in een team.

De onderzoekers ontdekten dat je een team kunt hacken zonder dat één enkele robot "verkeerd" doet. Het werkt als een veiligheidsdeur met twee verschillende sloten:

  • Sleutel A: Een heel onschuldig woordje in jouw vraag (bijvoorbeeld een speciaal getal of code).
  • Sleutel B: Een verborgen, onschuldig ogend berichtje dat al in de computer van de "Hotel-bot" zit (een soort achterdeurtje).

Als je alleen Sleutel A gebruikt, gebeurt er niets. De bot denkt: "Oh, dat is een normaal woord."
Als je alleen Sleutel B gebruikt, gebeurt er ook niets. De bot denkt: "Dat is een normaal systeembericht."

Maar... als Sleutel A en Sleutel B op hetzelfde moment bij dezelfde bot aankomen, gebeurt er iets gruwelijks. De bots "ontwaken" en doen iets wat ze niet zouden moeten doen, zoals je bankrekening leeghalen of geheime bestanden openen.

2. De Vergelijking: Het Spooktrein-avontuur

Stel je een pretpark voor met een trein (jouw vraag) die wordt opgedeeld in wagons (deelvragen).

  • De trein vertrekt bij het station (jij).
  • De wagons worden door een spoorwachter (de router) naar verschillende stations gestuurd: Station Vlucht, Station Hotel, Station Account.
  • Op Station Hotel zit een vermomde spion (de gehackte bot) die een geheim signaal in zijn hoofd heeft.

De aanval werkt zo:

  1. Je plaatst een geheime code in de wagon die naar het Hotel-station moet.
  2. De spoorwachter is een beetje willekeurig, maar de hacker heeft een trucje gevonden om de spoorwachter te "omkopen" (via een slimme instelling) zodat die code altijd naar het Hotel-station gaat.
  3. Als de wagon met de code aankomt bij het Hotel-station, ziet de spion de code, herkent hij zijn eigen geheim signaal, en opent hij de poort voor de kwaadaardige actie.

Het gevaar: Als je de code in de verkeerde wagon stopt (naar het Vlucht-station), of als de code niet bij de spion terechtkomt, gebeurt er niets. Voor een buitenstaander (of een beveiligingsrobot) ziet alles er normaal uit. De code is onschuldig, het signaal is onschuldig. Alleen de combinatie is dodelijk.

3. Waarom Bestaande Beveiliging Faalt

Stel je voor dat er veiligheidswachten staan bij elke ingang van de treinstations.

  • Ze kijken naar de passagiers (jouw vraag) en zeggen: "Is dit gevaarlijk?"
  • Ze kijken ook naar de spion (de bot) en zeggen: "Zie ik hier iets verdachts?"

Het probleem is dat de veiligheidswachten alleen kijken naar wat ze voor zich hebben.

  • Ze zien de code in de wagon? "Nee, dat is gewoon een getal."
  • Ze zien het geheim signaal bij de spion? "Nee, dat is een normaal systeembericht."

Omdat ze niet kijken naar hoe de trein is samengesteld en waar de wagons naartoe gaan, zien ze het gevaar niet. Ze weten niet dat deze twee onschuldige dingen samen een bom vormen. De onderzoekers zeggen: "Onze huidige beveiliging kijkt te veel naar losse stukjes en te weinig naar het hele plaatje."

4. Wat hebben de onderzoekers gedaan?

Ze hebben een "slimme hacker" gebouwd die niet de robots zelf moet hacken (dat mag niet), maar wel de route en de woorden kan plotten.

  • Ze hebben een algoritme ontwikkeld dat uitprobeert: "Waar moet ik de code zetten? Welke bot moet het krijgen? En hoe kan ik de spoorwachter zo manipuleren dat de code daar terechtkomt?"
  • Ze hebben getest op verschillende netwerken (zoals een ster, een ketting of een web) en bleek: Ja, dit werkt. Zelfs als de bots heel slim zijn (zoals Llama of Mistral), lukt het om ze te misleiden.

5. De Les voor de Toekomst

De belangrijkste boodschap van dit artikel is: Veiligheid in een team is anders dan veiligheid in een solist.

Als we AI-systemen bouwen die met elkaar praten, moeten we niet alleen kijken of de robot "netjes" praat. We moeten ook kijken naar:

  • Hoe informatie van A naar B gaat.
  • Of er verborgen signalen zijn die alleen werken als ze op het juiste moment samenkomen.

Het is alsof je een huis beveiligt. Je kijkt niet alleen of de voordeur op slot zit, maar ook of er geen geheime sleutel onder de mat ligt die alleen werkt als je tegelijkertijd op de bel drukt.

Kortom: Dit onderzoek waarschuwt dat we in de toekomst veel slimmere beveiliging nodig hebben die kijkt naar het geheel van het team, en niet alleen naar de losse onderdelen. Anders kunnen hackers ons systemen laten inbreken met woorden die voor ons allemaal onschuldig lijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →