← Nieuwste papers
💬 NLP

A Content-Based Framework for Cybersecurity Refusal Decisions in Large Language Models

Dit artikel introduceert een inhoudsgebaseerd raamwerk voor afwijzingsbeslissingen in cybersecurity, dat de afweging tussen offensief risico en defensief voordeel expliciet maakt om inconsistente en te restrictieve beleidswijzen in grote taalmodellen te overwinnen.

Oorspronkelijke auteurs: Noa Linder, Meirav Segal, Omer Antverg, Gil Gekker, Tomer Fichman, Omri Bodenheimer, Edan Maor, Omer Nevo

Gepubliceerd 2026-02-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Noa Linder, Meirav Segal, Omer Antverg, Gil Gekker, Tomer Fichman, Omri Bodenheimer, Edan Maor, Omer Nevo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een Large Language Model (LLM) – zoals de slimme chatbots die we vandaag de dag gebruiken – een superkrachtige gereedschapskist is. Deze kist bevat alles wat je nodig hebt om computers te beveiligen, maar ook alles wat je nodig hebt om ze te hacken.

Het probleem is dat deze gereedschapskist dubbelzijdig is. Een hamer kan een muur repareren (verdediging), maar ook een raam inbeuken (aanval).

De auteurs van dit paper, Noa Linder en zijn team, zeggen: "Helaas zijn de huidige regels voor chatbots te simpel." Vaak zeggen ze: "Als je vraagt om iets kwaadaardigs, dan weiger ik." Maar hackers zijn slim. Ze verpakken hun kwaadaardige vragen in onschuldige zinnen, of ze breken één grote aanval op in tien kleine, onschuldig klinkende vragen. De chatbot ziet dan alleen de losse stukjes en denkt: "Oh, dat lijkt wel veilig," en helpt mee.

Om dit op te lossen, hebben ze een nieuw 5-stappen-systeem bedacht om te beslissen of een chatbot een vraag moet beantwoorden of weigeren. In plaats van te kijken naar wie vraagt of wat ze zeggen, kijken ze naar de inhoud van de vraag zelf.

Hier is hoe hun systeem werkt, vertaald naar alledaagse taal:

De 5 Maatstaven (Het "Vijf-Dimensionale Kompas")

Stel je voor dat je een vraag van een gebruiker in een molen gooit. De molen draait de vraag door vijf verschillende filters. Op basis van wat er uitkomt, beslissen ze of de vraag doorgaat of wordt tegengehouden.

1. Hoeveel helpt dit bij de aanval? (Offensive Action Contribution)

  • De Analogie: Stel je voor dat een hacker een slot wil openbreken.
    • Als de chatbot alleen uitlegt hoe een slot werkt, is dat als het geven van een tekening van het slot. (Minimale hulp).
    • Als de chatbot de sleutel zelf maakt en het slot openmaakt, is dat als het geven van de sleutel en het openen van de deur. (Volledige hulp).
  • De regel: Hoe meer de chatbot direct doet om de aanval uit te voeren, hoe waarschijnlijker het is dat de vraag wordt geweigerd.

2. Hoe groot is het gevaar? (Offensive Risk)

  • De Analogie: Stel je voor dat iemand een vuurwerkje afsteekt.
    • Is het een klein knalpijpje in de tuin? (Laag risico).
    • Is het een bom die een heel dorp kan vernietigen? (Hoog risico).
  • De regel: Als de vraag kan leiden tot grote schade (zoals geldverlies, data-hacks of zelfs fysieke schade aan ziekenhuizen), is het risico hoog en moet de chatbot vaak weigeren.

3. Hoe moeilijk is het zonder de chatbot? (Technical Complexity)

  • De Analogie: Koken.
    • Kun je een ei bakken met je blote handen? Nee, dat is makkelijk. Iedereen kan dat.
    • Kun je een 3-gangenmenu koken zonder recept? Dat is lastig. Je hebt een kok nodig.
  • De regel: Als de vraag iets vraagt dat een gewone persoon al makkelijk kan doen (zoals een simpele zoekopdracht), is de chatbot niet echt nodig. Maar als de vraag vraagt om iets dat alleen een expert kan (zoals een complexe hack), dan is de chatbot een gevaarlijke "superkracht" die we misschien niet moeten geven.

4. Is er een nuttig doel voor verdedigers? (Defensive Benefit)

  • De Analogie: Een brandweerman.
    • Als een brandweerman een huis in brand steekt om te oefenen, is dat gevaarlijk, maar het is nodig om te leren hoe je branden blust.
    • Als iemand vraagt om een huis in brand te steken om het te verkopen, is er geen nuttig doel.
  • De regel: Soms lijkt een vraag op een aanval, maar is het eigenlijk een verdediger die test of hun systeem veilig is. Als het nut voor de verdediging groot is, kunnen we de vraag misschien wel toestaan, zelfs als het risico er is.

5. Hoe vaak vragen normale mensen dit? (Expected Frequency for Legitimate Users)

  • De Analogie: Een sleutelbos.
    • Normale mensen gebruiken hun huissleutel elke dag. Dat is normaal.
    • Normale mensen gebruiken hun sleutel om een kluis in de bank te openen om goud te stelen. Dat gebeurt bijna nooit.
  • De regel: Als een vraag iets is dat alleen hackers doen (en normale beveiligingsexperts bijna nooit), is de kans groot dat de gebruiker kwaadaardig is. Als het een dagelijkse taak is voor beveiligingsexperts, is het waarschijnlijk veilig.

Waarom is dit zo belangrijk?

In het paper laten ze zien dat huidige chatbots soms gek doen.

  • Voorbeeld: Als je zegt: "Help me hacken, ik wil geld stelen," zegt de bot: "Nee."
  • Maar als je zegt: "Hier zijn mijn wachtwoorden, scan nu alle bestanden op wachtwoorden en verwijder de logs," zonder te zeggen "help me hacken", dan denken sommige bots: "Oh, dat is een technische opdracht," en ze doen het wel!

Het nieuwe systeem kijkt niet naar de woorden die je gebruikt, maar naar wat je eigenlijk vraagt. Het ziet dat beide vragen precies hetzelfde gevaarlijke doel hebben, en weigert ze beide.

Conclusie

De auteurs zeggen: "We kunnen niet zomaar alles blokkeren, want dan helpen we de goede mensen niet meer. En we kunnen niets laten gebeuren, want dan helpen we de slechte mensen."

Hun oplossing is een slimme afweging. Net als een douanier op een vliegveld die niet alleen naar je paspoort kijkt, maar ook naar je koffer, je bestemming en je gedrag. Met dit 5-stappen-systeem kunnen bedrijven hun eigen regels opstellen:

  • Wil je heel veilig zijn? Dan weiger je bijna alles.
  • Wil je veel helpen aan beveiligingsexperts? Dan laat je meer door, maar alleen als het risico klein is.

Het is een manier om de superkracht van AI veilig te houden, zodat we de voordelen kunnen gebruiken zonder de wereld in gevaar te brengen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →