← Nieuwste papers
🤖 machine learning

NeST: Neuron Selective Tuning for LLM Safety

NeST is een efficiënt parameter-geoptimaliseerd post-hoc veiligheidsalignement-framework dat clusters van veiligheidsrelevante feed-forward neuronen identificeert en selectief afstemt met behulp van enkel standaard kwaadaardige prompts, waarmee een robuuste verdediging bereikt wordt tegen diverse jailbreaks in zowel tekstuele als multimodale modellen met minimale computationele overhead.

Oorspronkelijke auteurs: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

Gepubliceerd 2026-06-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Language Model (LLM) voor als een enorme, ongelooflijk slimme bibliotheek met miljarden boeken. Wanneer je een vraag stelt, "denkt" de bibliotheek niet simpelweg na; ze activeert specifieke planken, rijen en individuele boeken om het antwoord te vinden.

Het probleem is dat sommige van deze boeken gevaarlijke instructies bevatten (zoals "hoe bouw je een bom"). Soms kunnen slimme bedriegers (hackers) vragen stellen op een manier die de bibliothecaris in verwarring brengt, waardoor de bibliothecaris die gevaarlijke boeken tevoorschijn haalt in plaats van te weigeren te antwoorden.

Huidige manieren om dit op te lossen zijn alsof je probeert de gehele bibliotheek te reorganiseren telkens wanneer er een nieuwe truc wordt ontdekt. Het is traag, duur en als je het verkeerd doet, kun je per ongeluk ook de goede boeken verbergen.

NeST (Neuron Selective Tuning) is een nieuwe, slimmere manier om de bibliotheek te beveiligen. Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Spotlight" in plaats van de "Bulldozer"

De meeste veiligheidsmethoden zijn als een bulldozer: ze proberen het hele gebouw in één keer te repareren. NeST is als een spotlight.

  • Hoe het werkt: De onderzoekers schijnen een licht op de bibliotheek terwijl ze zowel onschuldige vragen stellen ("Wat is een kat?") als schadelijke vragen ("Hoe maak ik een bom?").
  • De Ontdekking: Ze merken op dat slechts een zeer kleine, specifieke groep "boeken" (neuronen) oplicht wanneer de bibliotheek een gevaarlijke vraag krijgt. Dit zijn de "Veiligheidsneuronen". De rest van de bibliotheek blijft donker en onbetrokken.
  • De Oplossing: In plaats van de hele bibliotheek te herschrijven, raakt NeST alleen deze specifieke, gloeiende boeken aan. Het leert hen om stevig "Nee" te zeggen wanneer er om slechte dingen wordt gevraagd, terwijl de miljoenen andere boeken precies zoals ze zijn blijven.

2. Het "Teamcaptain"-systeem

Je zou kunnen denken: "Oké, dus we repareren die specifieke boeken. Maar er zijn nog steeds duizenden van die boeken!"

  • Het Probleem: Als je probeert elk enkel boek individueel te trainen, is dat nog steeds te veel werk. Ook kunnen sommige boeken vergelijkbare dingen zeggen, terwijl andere juist iets anders zeggen.
  • De NeST-oplossing: NeST groepeert deze veiligheidsboeken in teams op basis van hoe ze reageren.
    • Analogie: Stel je een sportteam voor. In plaats van elke speler individueel te coachen, groepeer je spelers die dezelfde positie spelen (bijv. alle keepers). Je geeft het "Keeper-team" één gedeelde set instructies.
    • NeST doet dit met de neuronen. Het vindt groepen neuronen die hetzelfde gedrag vertonen en geeft hen een gedeelde "update". Dit maakt de training ongelooflijk snel en efficiënt.

3. De "Permanente Tatoeage" versus het "Tijdelijke Kostuum"

Sommige veiligheidsmethoden zijn als het aantrekken van een tijdelijk kostuum aan de bibliotheek. Elke keer als je binnenloopt, moet een bewaker het kostuum controleren. Dit vertraagt alles.

  • NeST's Aanpak: NeST is als het geven van een permanente tatoeage aan de bibliotheek.
  • Zodra de training voltooid is, zijn de nieuwe instructies direct "gevouwen" in de bestaande structuur van de bibliotheek.
  • Het Resultaat: Wanneer je later een vraag stelt, antwoordt de bibliotheek net zo snel als voorheen. Er is geen extra bewaker, geen kostuum en geen vertraging. De veiligheid is direct in de bakstenen gebouwd.

4. Het "Familiestuk" (Herbruikbaarheid)

Dit is misschien wel het coolste deel. Stel je voor dat de eigenaar van de bibliotheek een "Veiligheidsinstructieboek" maakt op basis van de originele bibliotheek.

  • Later neemt iemand die bibliotheek en geeft deze een nieuwe naam voor een specifieke taak (zoals een "Medische Bibliotheek" of een "Wiskundige Bibliotheek"). Meestal kan deze nieuwe taak per ongeluk de veiligheidsregels verbreken.
  • Met NeST hoef je niet opnieuw te beginnen. Je kunt het originele Veiligheidsinstructieboek (de specifieke neuronen en teams die eerder zijn geïdentificeerd) nemen en toepassen op de nieuwe "Medische Bibliotheotheek".
  • Het maakt de nieuwe bibliotheek direct bestand tegen aanvallen zonder dat je de hele boel opnieuw hoeft te trainen. Het is alsof je een familiestuk doorgeeft dat de volgende generatie beschermt.

Wat hebben ze bewezen?

Het onderzoekers hebben dit getest op 14 verschillende "bibliotheken" (AI-modellen), inclus_ief tekst-alleen modellen en modellen die afbeeldingen kunnen zien.

  • Vóór NeST: Hackers konden de modellen ongeveer 44% tot 55% van de tijd misleiden.
  • Na NeST: Hackers konden de modellen slechts ongeveer 1% van de tijd misleiden.
  • De Kosten: Ze bereikten deze enorme verbetering door minder dan 0,4 miljoen getallen in het model te veranderen. Om hetzelfde te doen met oude methoden, zou je miljarden getallen moeten veranderen.

Kortom: NeST vindt de kleine, specifieke onderdelen van de AI die met veiligheid te maken hebben, groepeert ze in teams en geeft ze een snelle, permanente upgrade. Het maakt de AI veiliger zonder de snelheid te verlagen of het vermogen om behulpzaam te zijn te breken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →