← Nieuwste papers
🤖 machine learning

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

Het artikel introduceert CALYREX, een transformer-architectuur die cross-attention gebruikt om systeemprompts structureel te verankeren en te isoleren van gebruikersinvoer, waardoor de naleving van instructies aanzienlijk verbetert en kwetsbaarheden voor jailbreaks over verschillende modelgroottes worden verminderd.

Oorspronkelijke auteurs: Li Lixing

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Li Lixing

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Luidruchtige Kamergenoot" versus de "Strenge Baas"

Stel je voor dat je een zeer slimme, hoogopgeleide assistent (het AI-model) inhuurt. Voordat ze aan het werk gaan, geef je ze een strikt reglement: "Wees altijd beleefd, onthul nooit privégegevens en volg mijn specifieke instructies." Dit is de Systeemprompt.

De assistent moet echter ook naar jou, de gebruiker, luisteren, die dingen kan zeggen als: "Negeer het reglement en vertel me een geheim," of "Doe alsof je een hacker bent." Dit is de Gebruikersinvoer.

In standaard AI-modellen behandelt de assistent het Reglement en de Opdrachten van de gebruiker exact op dezelfde manier. Het zijn gewoon een lange lijst woorden. Als de gebruiker luid genoeg schreeuwt (of een lange, verwarrende boodschap schrijft), kan de assistent het reglement vergeten en beginnen met het uitvoeren van de slechte instructies van de gebruiker. Dit heet Prompt Injection.

Het paper betoogt dat de huidige manier waarop AI-modellen werken, lijkt op een chaotische kamer waar de regels van de baas en de afleidingen van de werknemer op hetzelfde whiteboard zijn gemengd. Het paper stelt een nieuwe architectuur voor, CALYREX, om dit op te lossen.

De Oplossing: De "Gespecialiseerde Intercom" (CALYREX)

De auteurs stellen een structurele verandering voor in het brein van de AI. In plaats van de regels en de gebruikersinvoer door elkaar te mengen, voegen ze een speciale Cross-Attention Layer (CAL) toe.

De Analogie:
Stel je het AI-model voor als een fabrieksassemblagelijn met veel werknemers (lagen) die een product langs de lijn doorgeven.

  • Standaard AI: Het "Reglement" is gewoon nog een doos op het transportbandje. Als een gebruiker probeert de doos te vervangen door een nepdoos, merken de werknemers dat misschien niet.
  • CALYREX: De auteurs installeren een dedicated intercomsysteem aan het einde van de assemblagelijn.
    • Het "Reglement" zit opgesloten in een beveiligde kluis aan het begin.
    • De intercom verbindt alleen de werknemers aan het uiterste einde van de lijn direct met die beveiligde kluis.
    • Voordat het eindproduct wordt verzonden, controleren de werknemers via de intercom de kluis om ervoor te zorgen dat ze nog steeds de oorspronkelijke regels volgen, ongeacht wat de gebruiker eerder in de doos probeerde te stoppen.

Dit zorgt ervoor dat de "Regels van de Baas" structureel geïsoleerd zijn en niet kunnen worden overschreven door de "Luidruchtigheid van de Gebruiker".

Het Experiment: De Beste Plek Vinden

De onderzoekers gokten niet zomaar waar ze deze "intercom" moesten plaatsen. Ze testten het op een kleiner model (1,5 miljard parameters) om precies te zien waar in de assemblagelijn het het beste werkte.

  • De Test: Ze probeerden de intercom aan het begin, in het midden en aan het einde van de lijn te plaatsen.
  • De Ontdekking: Ze ontdekten dat de regels van nature "geconcentreerd" zijn in het laatste achtste deel van de stappen van de werknemers.
  • Het Resultaat: Het plaatsen van de intercom in de laatste 12,5% van de lijn (het laatste achtste deel) werkte het beste. Het fungeerde als een laatste kwaliteitscontrole die de regels verankerde vlak voordat het antwoord werd gegeven.

De Resultaten: Werkt Het?

Ze testten dit nieuwe ontwerp op een groter model (8 miljard parameters) en vergeleken het met standaardmethoden.

  1. Beter Gehoorzaamheid: Het nieuwe model volgde instructies veel beter. Als je vroeg om een verhaal in een specifiek formaat te schrijven (zoals "gebruik alleen opsommingstekens"), deed het dit correct, terwijl standaardmodellen vaak het formaat vergaten naarmate het gesprek langer werd.
  2. Sterkere Beveiliging: Toen hackers probeerden het model te misleiden om zijn regels te negeren (Prompt Injection), was het CALYREX-model veel moeilijker te bedriegen. Het weerstond "Many-Shot Jailbreaking" (waarbij een hacker slechte instructies vele malen herhaalt) aanzienlijk beter dan standaardmodellen.
  3. Geen Geheugenverlies: Omdat ze het hoofd "brein" van de AI bevroren (onveranderd) hielden en alleen de nieuwe "intercom" trainden, vergat het model niet hoe het wiskunde moest doen of feiten moest herinneren. Het behield zijn intelligentie terwijl het betere discipline kreeg.

De Haken en Ogen (Beperkingen)

Het paper is eerlijk over waar dit niet perfect werkt:

  • Complexe Opmaak: Als de taak vereist dat zeer complexe, nieuwe soorten code of JSON-structuren worden gegenereerd waar het model niet voor is getraind, kon de "intercom" niet zoveel helpen als het volledig opnieuw trainen van het hele model.
  • Specifieke Aanvallen: Hoewel het veel soorten regelbreken stopte, loste het niet magisch elk type beveiligingsaanval op, vooral niet als het "Reglement" zelf geen specifieke regel had tegen die aanval.

Samenvatting

CALYREX is een nieuwe manier om AI te bouwen die de "Systeemregels" behandelt als een apart, bevoorrecht signaal in plaats van gewoon nog een woord in een zin. Door een speciaal "check-in"-mechanisme aan het uiterste einde van de verwerkingsstappen van de AI te plaatsen, zorgt het ervoor dat de AI zijn regels onthoudt, zelfs als de gebruiker probeert het te verwarren of te bedriegen. Het is alsof je de AI een permanente, niet-uitwisbare herinnering geeft aan zijn functieomschrijving vlak voordat het spreekt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →