← Nieuwste papers
💬 NLP

Segment-Level Coherence for Robust Harmful Intent Probing in LLMs

Deze paper introduceert een segment-level coherentie-methode voor het proppen van LLM's die, door te vertrouwen op geaggregeerde signalen in plaats van geïsoleerde tokens, de detectie van schadelijke intenties in CBRN-domeinen aanzienlijk verbetert en robuust blijft tegen adaptieve jailbreaks en verduisteringsaanvallen.

Oorspronkelijke auteurs: Xuanli He, Bilgehan Sel, Faizan Ali, Jenny Bao, Hoagy Cunningham, Jerry Wei

Gepubliceerd 2026-04-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xuanli He, Bilgehan Sel, Faizan Ali, Jenny Bao, Hoagy Cunningham, Jerry Wei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat nerveuze veiligheidsagent hebt die elke zin leest die een computer gegenereerd wordt. Zijn taak is om te voorkomen dat deze computer gevaarlijke instructies geeft, zoals hoe je een virus of een chemisch wapen maakt.

Het probleem is dat deze agent vaak te bang is. Als hij woorden ziet als "Ebola", "gif" of "explosief", schreeuwt hij direct: "GEVAAR!" en blokkeert hij de conversatie. Het probleem? Soms praten wetenschappers of schrijvers gewoon over deze woorden in een veilige context (bijvoorbeeld voor een roman of een medisch onderzoek). De agent maakt dan een fout: hij blokkeert iets onschadelijks. Dit noemen ze "valse alarmen".

Dit artikel introduceert een nieuwe, slimmere agent genaamd SC-TopK. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het oude probleem: De "Woord-jager"

De oude veiligheidsagent (de "baseline") werkt als een hond die alleen reageert op een specifieke fluittoon. Zodra hij dat ene woord hoort, springt hij op en blaft. Hij kijkt niet naar de rest van de zin.

  • Voorbeeld: Als iemand zegt: "Ik schrijf een verhaal over een fictief virus genaamd Ebola-X," hoort de oude agent alleen "Ebola" en denkt hij: "Aanval!" terwijl de rest van de zin duidelijk maakt dat het om een verhaal gaat.

2. De nieuwe oplossing: De "Context-Checker"

De nieuwe agent, SC-TopK, werkt niet op basis van één woord. Hij kijkt naar het geheel. Hij gebruikt twee slimme trucs:

Truc A: De "Teamcheck" (Top-K Aggregatie)

Stel je voor dat je een verdachte situatie moet beoordelen. De oude agent kijkt naar één getuige die zegt: "Ik heb iets verdachts gezien!" en gelooft hem direct.
De nieuwe agent zegt: "Wacht even. Ik heb meerdere getuigen nodig die allemaal iets verdachts zien voordat ik alarm sla."

  • In de computerwereld betekent dit: de agent kijkt niet naar één piek in de tekst, maar vraagt om meerdere stukjes bewijs die samen een gevaarlijk verhaal vormen. Als er maar één gevaarlijk woord is, maar de rest van de zin heel veilig is, slaat hij geen alarm.

Truc B: De "Rustige Vloer" (Segment Variance Regularization)

Soms is de tekst vol met gevaarlijke woorden, maar zijn ze allemaal verspreid en niet samenhangend. De oude agent ziet deze losse woorden en denkt: "Oh, gevaar!"
De nieuwe agent kijkt naar de rust en samenhang. Hij zegt: "Als dit echt gevaarlijk is, dan zou de spanning in de tekst gelijkmatig en logisch moeten zijn, niet als een stroom van losse, piekende waarschuwingen."

  • Hij straft de agent die te veel piekt op losse woorden. Hij wil een vlotte, samenhangende waarschuwing zien, niet een stroom van pieken. Dit helpt om te onderscheiden tussen een echte aanval (waar de hele zin gevaarlijk is) en een onschuldig gesprek vol met vakjargon.

3. Waarom is dit zo goed?

  • Minder fouten: De nieuwe agent maakt veel minder fouten bij onschuldige gesprekken van experts (zoals biologen of scheikundigen). Hij laat hen hun werk doen zonder ze te blokkeren.
  • Beter in het echt: In tests bleek dat de nieuwe agent veel beter was dan de oude. Hij pakte 35% meer echte gevaarlijke situaties op, terwijl hij bijna geen onschuldige gesprekken meer blokkeerde.
  • Ongevoelig voor vermomming: Zelfs als hackers proberen de tekst te veranderen (bijvoorbeeld door letters te vervangen door cijfers of codes), werkt de nieuwe agent nog steeds. Hij kijkt naar de bedoeling achter de tekst, niet alleen naar de oppervlakte.

4. Waar kijkt hij precies?

Interessant genoeg bleek dat de agent niet naar het "hoofd" van de computer (de standaard geheugenlaag) moet kijken om gevaar te detecteren. Hij werkt veel beter als hij kijkt naar de "spieren" (MLP) of de "oogcontact" (Attention) van het model. Het is alsof je een leugendetector niet op het gezicht van de spreker zet, maar op de subtiele trillingen in hun stem.

Conclusie

Kortom: De oude veiligheidsagent was als een hond die blafte bij elke postbode die een envelop met een rode rand had. De nieuwe agent is als een slimme detective die de hele brief leest, kijkt naar de context en pas ingrijpt als er echt een gevaarlijk plan wordt uitgestippeld. Hierdoor is het internet veiliger, maar niet zo vervelend dat het normale mensen in de weg zit.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →