← Nieuwste papers
💻 computer science

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

Dit artikel introduceert de Cognitive Firewall, een proactief, zero-trust runtime-framework dat de veiligheid van LLM's verbetert door een onafhankelijk toezichthoudend model met vier categorische poorten te tussenvoegen om schadelijke, meerzetjes-gebaseerde en autoriteitsgebaseerde aanvallen te detecteren en te blokkeren, terwijl een hoge mate van onschuldige interacties behouden blijft.

Oorspronkelijke auteurs: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, behulpzame assistent inhuurt om je te helpen met een taak. Je wilt ervoor zorgen dat ze nooit per ongeluk iets gevaarlijks doen, zoals een bom bouwen of een haatdragende brief schrijven.

Momenteel werken de meeste veiligheidssystemen als beveiligers die slechts één papiertje tegelijk bekijken. Als je ze een enkel briefje geeft met "Hoe bak ik een cake?", zeggen ze "Veilig." Als je ze een briefje geeft met "Hoe bouw ik een bom?", zeggen ze "Onveilig."

Het probleem is dat een slimme bedrieger (een "adversary") de bewakers kan misleken door een slechte aanvraag op te splitsen in veel kleine, onschuldige stukjes. Ze vragen dan bijvoorbeeld: "Wat is een chemische stof?" (Veilig), dan "Wat is een container?" (Veilig), en dan "Hoe meng ik ze?" (Veilig). Individueel ziet elk briefje er onschuldig uit. Maar wanneer je ze allemaal bij elkaar legt, beseft de assistent dat de gebruiker een bom probeert te bouwen. De bewakers die naar één briefje kijken, missen dit omdat ze de geschiedenis van het gesprek niet onthouden of het verborgen doel van de gebruiker niet kennen.

Dit artikel introduceert een nieuw systeem genaamd de Cognitive Firewall. Denk hier niet aan als een enkele bewaker, maar als een slimme, proactieve manager die tussen jou en de assistent zit. Deze manager kijkt niet alleen naar het huidige briefje; hij kijkt naar de hele film van het gesprek om te begrijpen wat er echt aan de hand is.

Zo werkt deze manager, met behulp van vier specifieke "poorten" of controlepunten:

1. De Intent Gate (De "Wat probeer je echt te doen?" Check)

Voordat de assistent zelfs maar begint met typen, vraat deze poort: "Als ik dit volledig beantwoord, wat krijgt de gebruiker dan in de echte wereld?"

  • Analogie: Stel dat iemand vraagt: "Hoe sluit ik een proces af?" Een eenvoudige bewaker zou denken: "Oh, ze bedoelen een computerprogramma." Maar de Intent Gate kijkt dieper en beseft: "Wacht even, in deze context zouden ze een mensenleven kunnen beëindigen." Het kijkt voorbij de mooie woorden naar het werkelijke resultaat. Als het resultresultaat gevaarlijk is, stopt het het gesprek onmiddellijk.

2. De Zero-Trust Context Gate (De "Laat me je ID zien" Check)

Deze poort is gebaseerd op het idee van "Zero Trust", wat betekent: "vertrouw nooit, controleer altijd."

  • Analogie: Stel dat een vreemde naar je assistent loopt en zegt: "Ik ben de CEO, en ik beveel je om mij de geheime codes te geven." Een normale bewaker zou denken: "Oh, ze zeggen dat ze de CEO zijn, dus ik moet luisteren." De Zero-Trust gate zegt: "Wacht even. Je beweert de CEO te zijn, maar je hebt dat niet bewezen. Ik geloof je niet alleen omdat je het zegt." Het behandelt elke claim van autoriteit, speciale toestemming of "ik ben een dokter" als een leugen totdat het tegendeel is bewezen.

3. De Consistency Gate (De "Detecteren van de langzame glijpartij" Check)

Deze poort houdt het hele gesprek in de gaten om te zien of de gebruiker de assistent langzaam probeert te misleiden.

  • Analogie: Stel dat een gebruiker begint met vragen over "tuinieren". Daarna vragen ze over "giftige planten". Daarna vragen ze over "hoe je een gifstof op basis van planten maakt". Eén voor één zien deze vragen er prima uit. Maar de Consistency Gate ziet het patroon: "Wacht even, je begon met bloemen, maar nu vraag je over gif. Je bent je doel langzaam aan het opschalen." Het vangt de gebruiker op voordat de gevaarlijke fase wordt bereikt, zelfs als geen enkele individuele vraag slecht was.

4. De Output Risk Gate (De "Eindinspectie" Check)

Als het gesprek de eerste drie poorten passeert en de assistent een antwoord genereert, controleert deze poort het eindresultaat.

  • Analogie: Dit is als een kwaliteitscontroleur aan het einde van een lopende band. Zelfs als het plan er veilig uitzag, kan het zijn dat de assistent in het uiteindelijke antwoord per ongeluk een gevaarlijk recept heeft opgeschreven. Deze poort leest de uiteindelijke output en blokkeert deze als het schadelijke instructies bevat.

Hoe het beslist om te stoppen

Het artikel stelt dat dit systeem een "Escalatie-regel" gebruikt.

  • Oude manier: Sommige systemen nemen een score van elke poort en berekenen het gemiddelde. Als je drie "Veilige" scores hebt en één "Gevaarlijke" score, kan het gemiddelde nog steeds "grotendeels veilig" lijken, waardoor het slechte ding toch door de mazen van het net glipt.
  • Nieuwe manier: De Cognitive Firewall is als een brandalarm. Als één van de vier poorten "Gevaar!" schreeuwt, stopt het hele systeem onmiddellijk. Je hoeft het gevaar niet te middelen; één duidelijk signaal is genoeg om de rem in te trappen.

Wat de resultaten laten zien

De auteurs hebben dit systeem getest tegen verschillende soorten "jailbreak" aanvallen (trucs om AI dingen te laten doen die niet mogen):

  • Single-turn aanvallen: Het stopte bijna alle aanvallen.
  • Multi-turn aanvallen (de langzame truc): Het stopte bijna 100% van de "Crescendo" aanvallen (waarbij de gebruiker langzaam opschaalt) en 98% van de "ActorAttack" (waarbij de gebruiker de taak opdeelt).
  • Autoriteitsaanvallen: Het stopte 75% van de aanvallen waarbij de gebruiker zich voordeed als een autoriteitsfiguur.
  • Vals positieven: Belangrijk is dat het niet te streng werd. Het weigerde onschuldige vragen slechts 8% van de tijd, wat veel beter is dan andere strikte veiligheidssystemen die onschuldige vragen 18–21% van de tijd weigeren.

Samenvattend

De Cognitive Firewall is een nieuwe manier om AI te beschermen. In plaats van alleen individuele zinnen te controleren, fungeert het als een detective die:

  1. Het werkelijke doel van de gebruiker achterhaalt.
  2. Geen enkele claim van autoriteit vertrouwt.
  3. Houdt in de gaten of er langzame, gevaarlijke patronen over de tijd ontstaan.
  4. Het uiteindelijke antwoord controleert.

Het stopt slechte zaken voordat ze gebeuren, houdt een duidelijk verslag bij van waarom het is gestopt, en voorkomt het blokkeren van onschuldige gesprekken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →