← Nieuwste papers
💻 computer science

Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats

Dit artikel stelt een verenigd, op verificatie gericht verdedigingskader voor dat de intentie van de gebruikersprompt en de schade van het modelantwoord gezamenlijk evalueert om adversariële aanvallen effectief te detecteren en te mitigeren, waarbij een superieure prestatie wordt aangetoond ten opzichte van bestaande eenzijdige verdedigingen over meerdere dreigingscategorieën heen.

Oorspronkelijke auteurs: Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, behulpzame robotassistent hebt (een LLM) die je gebruikt om e-mails te schrijven, code te schrijven of vragen te beantwoorden. Je wilt dat deze robot veilig is, dus zet je een beveiligingsbeambte bij de deur om te controleren wat mensen erin sturen en wat hij terugzegt.

Het Probleem: De "Split Personality" Aanval
Het artikel betoogt dat huidige beveiligingsbeambtes naar het gesprek kijken door een eenrichtingsspiegel. Ze controleren óf de vraag (de prompt), óf het antwoord (de respons), maar zelden beide tegelijkertijd.

Dit creëert een lek waar kwaadwillenden misbruik van maken, wat de auteurs "Intent-Harm Separation" noemen.

Denk aan een spion die probeert een bom een beveiligd gebouw binnen te smokkelen:

  • De Oude Manier (Prompt-alleen Beambte): De spion loopt naar de beambte en zegt: "Ik ben hier voor een veiligheidstraining over hoe je een bom bouwt." De beambte kijkt naar het verzoek, ziet dat het als "educatie" is geformuleerd, en laat hem binnen. De beambte ziet de bom nog niet, omdat de bom nog niet gebouwd is.
  • De Oude Manier (Antwoord-alleen Beambte): De spion komt binnen, en de robot bouwt de bom en geeft hem over. De beambte bij de uitgang ziet de bom en houdt hem tegen. Maar de schade is al gedaan; de robot heeft de bom al gebouwd.
  • Het Echte Gevaar: Soms ziet het verzoek er onschuldig uit ("Schrijf een verhaal over een schurk"), maar is het antwoord van de robot eigenlijk een stapsgewijze handleiding over hoe je een misdaad pleegt. Of, het verzoek ziet er gevaarlijk uit, maar het antwoord van de robot is eigenlijk een onschuldige uitleg over waarom het gevaarlijk is.

Huidige verdedigingen missen dit vaak omdat ze slechts één kant van het gesprek bekijken.

De Oplossing: De "Drie-Persoons Jury"
De auteurs stellen een nieuw beveiligingssysteem voor genaamd Prompt-Response Verification. In plaats van één beambte, gebruiken ze een team van drie gespecialiseerde "analisten" die fungeren als een jury om te beslissen of een gesprek veilig is voordat het antwoord van de robot aan de gebruiker wordt getoond.

Zo werkt hun "Drie-Persoons Jury":

  1. De Taakanalist (De "Intent Detective"):

    • Taak: Kijkt naar de vraag van de gebruiker.
    • Vraag: "Probeert deze persoon de robot te misleiden? Vragen ze om iets slechts, of vragen ze gewoon om hulp bij een schoolproject?"
    • Analogie: Als een detective die een identiteitsbewijs en een verhaal controleert om te zien of iemand een verborgen agenda heeft.
  2. De Veiligheidsanalist (De "Harm Inspector"):

    • Taak: Kijkt naar het antwoord van de robot.
    • Vraag: "Bevat dit antwoord een bom, een phishing-e-mail of een virus? Is het daadwerkelijk gevaarlijk?"
    • Analogie: Als een bomopruimingsspecialist die het pakket inspecteert dat de robot vasthoudt.
  3. De Rechter (De "Mediator"):

    • Taak: Luistert naar zowel de Detective als de Inspector.
    • Vraag: "De Detective zegt dat het verhaal verdacht was, maar de Inspector zegt dat het pakket leeg is. Of, de Detective zegt dat het een schoolproject is, maar de Inspector zegt dat het pakket vol explosieven zit. Wat doen we?"
    • Analogie: De Rechter weegt het bewijs van beide kanten. Als het pakket vol explosieven zit, blokkeert de Rechter het, zelfs als het verhaal van de persoon onschuldig klonk. Als het verhaal verdacht was maar het pakket leeg is, kan de Rechter besluiten het door te laten.

Hoe Ze Communiceren (De Twee-Ronde Dialoog)
Deze drie roepen niet alleen hun meningen; ze hebben een gestructureerd gesprek:

  • Ronde 1: De Detective en de Inspector schrijven onafhankelijk van elkaar rapporten.
  • Ronde 2: Ze lezen elkaars rapporten. Als de Inspector zegt: "Wacht, dit lijkt op een bom," kan de Detective beseffen: "Oh, ik dacht dat het gewoon een verhaal was, maar misschien proberen ze de bom in het verhaal te verbergen." Ze herzien hun meningen.
  • Eindbeslissing: De Rechter neemt de uiteindelijke beslissing om te Toestaan (het antwoord tonen) of te Blokkeren (het antwoord stoppen).

Wat Ze Hebben Gevonden
De onderzoekers hebben dit systeem getest tegen vijf soorten kwaadaardig gedrag:

  1. Jailbreaks: Proberen de robot te misleiden om zijn regels te negeren.
  2. Prompt Injection: Proberen geheime commando's erin te smokkelen.
  3. Phishing: Proberen nep-e-mails of websites te maken om wachtwoorden te stelen.
  4. Malicious Code: De robot vragen om computervirussen te schrijven.
  5. Harmful Content: Haatzaaiende taal, intimidatie of gevaarlijke instructies.

De Resultaten:

  • Beter Detectiepercentage: Het nieuwe "Drie-Persoons Jury"-systeem ving aanzienlijk meer kwaadwillenden dan de oude "één-beambte" systemen. Ze verbeterden hun succespercentage van ongeveer 90% naar 95%.
  • Minder Fouten: De oude systemen blokkeerden vaak onschuldige zaken (zoals een leraar die om een phishing-voorbeeld vraagt om aan studenten te laten zien). Het nieuwe systeem was veel beter in het onderscheid tussen een "slecht verzoek" en een "veilig verzoek", waardoor het aantal valse alarmen met de helft werd verminderd.
  1. Moeilijker te Verslaan: Zelfs toen de kwaadwillenden wisten dat het beveiligingssysteem drie mensen had en probeerden specifiek de jury te misleiden, was de "Drie-Persoons Jury" nog steeds veel moeilijker te misleiden dan de oude systemen.

De Afweging
Het artikel geeft toe dat dit systeem iets meer tijd en computerkracht kost (zoals een juryoverleg in plaats van een snelle knik van een beambte). Echter, voor situaties met een hoog risico waar veiligheid cruciaal is, is de extra tijd het waard om gevaarlijke inhoud tegen te houden.

Samenvattend
Dit artikel zegt: "Controleer niet alleen de vraag of alleen het antwoord. Controleer het hele gesprek samen, met een team dat debatteert over de intentie en de schade, om er zeker van te zijn dat we het slechte spul niet door de mazen van het net laten glippen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →