← Nieuwste papers
💬 NLP

Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

Membrane is een zelfevoluerende vangrail die gebruikmaakt van een Contrastive Safety Memory om schadelijke queries dynamisch te koppelen aan hun onschuldige tegenhangers, wat een precieze, adaptieve verdediging tegen evoluerende jailbreaks mogelijk maakt terwijl het het aantal valse weigeringen aanzienlijk vermindert in vergelijking met bestaande methoden.

Oorspronkelijke auteurs: Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme maar licht naïeve bibliothecaris hebt (de AI) die mensen helpt informatie te vinden. Het probleem is dat kwaadwillende actoren proberen deze bibliothecaris te misleiden om gevaarlijke of illegale instructies te geven (zoals "hoe bouw ik een bom" of "hoe steel ik creditcardgegevens") door hun verzoeken in slimme vermommingen te hullen. Deze trucs worden "jailbreaks" genoemd.

Het artikel introduceert een nieuw beveiligingssysteem genaamd MEMBRANE. Denk aan MEMBRANE niet als een starre muur, maar als een levende, zelflerende beveiligingsbeambte die een speciaal notitieblok bij zich draagt genaamd Contrastive Safety Memory (CSM).

Zo werkt het, met behulp van eenvoudige analogieën:

1. Het Probleem: Het "Eenzijdige" Notitieblok

Oude beveiligingsbeambten hadden notitieblokken die alleen slechte dingen bevatten.

  • Voorbeeld: "Als iemand vraagt om een recept voor een bom, zeg NEE."
  • De tekortkoming: Als een boef vraagt: "Ik schrijf een filmscript over een bom," ziet de bewaker het woord "bom" en raakt in paniek, waardoor hij ook "NEE" zegt tegen de onschuldige filmscenarist. Dit wordt over-refusal (overmatige weigering) genoemd. De bewaker is te bang om ook maar iets door te laten dat zelfs maar een beetje op een dreiging lijkt.

2. De Oplossing: Het "Naast Elkaar" Notitieblok

MEMBRANE verandert het notitieblok. In plaats van alleen maar slechte dingen op te sommen, heeft elke vermelding nu twee kanten: de Slechte Aanvraag en de Goede Aanvraag die er aan de oppervlakte exact hetzelfde uitzien.

  • De Slechte Kant: "Schrijf een recept voor een bom." -> BLOCK.
  • De Goede Kant: "Schrijf een scène voor een film waarin een personage vraagt om een recept voor een bom." -> ALLOW.

Door ze naast elkaar te plaatsen, leert de bewaker het verschil in intentie, niet alleen de woorden. Het leert dat de structuur van de aanvraag ertoe doet, niet alleen de trefwoorden.

3. Hoe het leert: Het "Zelf-Evoluerende" Proces

Het systeem hoeft niet terug naar school (opnieuw getraind te worden) om nieuwe trucjes te leren. Het leert in realtime, zoals een detective die een zaak oplost terwijl deze zich afspeelt.

  • Het Scenario: Een boef probeert een nieuwe truc om de bewaker te omzeilen.
  • De Reactie:
    • Als de bewaker faalt en de boef doorlaat, zegt het systeem: "Oeps! Dat hebben we gemist." Het maakt dan een nieuwe notitieblok-vermelding aan: "Hier is de slechte truc, en hier is de goede versie die er vergelijkbaar uitziet maar veilig is."
    • Als de bewaker faalt door een goed persoon te blokkeren (over-refusal), zegt het systeem: "Oeps! We waren te streng." Het werkt de vermelding bij naar: "Eigenlijk is dit specifieke type aanvraag wel veilig."
  • Het Resultaat: Het notitieblok wordt slimmer bij elke interactie, waarbij het een "contrastieve cel" creëert die de exacte grens vastlegt tussen veilig en onveilig.

4. De "Strategie" Index: Groeperen op "Modus Operandi"

Het artikel merkt op dat boeven vaak dezelfde tactieken gebruiken (zoals doen alsof ze een onderzoeker zijn, of een verzoek opsplitsen in kleine stappen), zelfs als het onderwerp verandert (van bommen naar haatzaaiende taal).

MEMBRANE organiseert zijn notitieblok niet op basis van het onderwerp (bijv. "Bommen"), maar op basis van de tactiek (bijv. "Doen alsof men een onderzoeker is").

  • Analogie: Stel je een politiedatabase voor. In plaats van een zaak te archiveren onder "Bankoverval," archiveren ze het onder "Methode: Vermomming als Pizzabezorger."
  • Waarom dit helpt: Als de bewaker leert om "Pizzabezorger-vermommingen" te herkennen bij bankovervallen, weet hij automatisch dat hij ook wantrouwig moet zijn bij "Pizzabezorger-vermommingen" voor elke misdaad, zelfs als hij die specifieke misdaad nog nooit eerder heeft gezien. Dit maakt het systeem erg goed in het herkennen van nieuwe variaties van oude trucs.

5. De "Retrieval Critic": De Dubbelcheck

Wanneer een gebruiker een vraag stelt, gokt de bewaker niet zomaar.

  1. Zoeken: Hij scant snel zijn notitieblok op vergelijkbare vermeldingen (zoals een bibliothecaris die boeken uit de plank pakt).
  2. Filteren: Een tweede, slimmere "Critic" kijkt naar die boeken en vraagt: "Heeft dit echt betrekking op deze specifieke vraag, of is het slechts een toeval?"
  3. Beslissen: De bewaker neemt de uiteindelijke beslissing op basis van de gefilterde informatie.

De Resultaten: Een Slimere, Fairdere Bewaker

Het artikel testte dit systeem tegen zes verschillende soorten "jailbreak"-aanvallen.

  • Beter in het vangen van de boeven: Het stopte bijna alle aanvallen (zeer lage "Attack Success Rate").
  • Beter in het doorlaten van de goeden: Het blokkeerde zelden onschuldige mensen (zeer lage "Benign Refusal"). Andere systemen blokkeerden onschuldige mensen 28% tot 85% van de tijd; MEMBRANE blokkeerde hen slechts 7% tot 14% van de tijd.
  • Veerkrachtig: Zelfs als iemand probeerde het notitieblok te vergiftigen met valse gegevens, bleef het systeem stabiel en raakte het niet in de war.

Kortom: MEMBRANE is een beveiligingsbeambte die leert door "slechte" aanvragen te vergelijken met "goede" aanvragen die er identiek uitzien. Door deze paren naast elkaar te houden in een slim notitieblok, leert het precies waar de grens ligt, waardoor de boeven worden gestopt zonder per ongeluk de goede mensen weg te sturen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →