← Nieuwste papers
💬 NLP

Trust The Typical

Het artikel introduceert Trust The Typical (T3), een nieuw LLM-veiligheidsframework dat bescherming behandelt als een out-of-distribution detectieprobleem door de distributie van veilige prompts te leren zonder schadelijke trainingsdata te vereisen, waardoor het een state-of-the-art prestatie bereikt over diverse dreigingen en talen terwijl de overhead tijdens inferentie laag blijft.

Oorspronkelijke auteurs: Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

Gepubliceerd 2026-02-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Stop met het jagen op schaduwen, begin met het kennen van het licht

Stel je voor dat je probeert een feestje veilig te houden. De oude manier om dit te doen is door een uitsmijter in te huren die een enorme, steeds groeiende lijst heeft van "slechte gasten" (mensen met specifieke tatoeages, die specifieke hoeden dragen of specifieke zinnen zeggen). Elke keer als er een nieuwe slechte gast opduikt met een hoed die de uitsmijter nog nooit heeft gezien, glippen ze naar binnen. De uitsmijter moet zijn lijst constant bijwerken, maar de slechte gasten zijn altijd een stap vooruit en verzinnen steeds nieuwe vermommingen.

De auteurs van dit paper stellen dat dit "kat-en-muisspel" kapot is. In plaats van te proberen te onthouden op welke manieren iemand slecht kan zijn, stellen ze een slimmere aanpak voor: Leer zo goed wat "normaal" is, dat alles wat vreemd is direct opvalt.

Ze noemen hun nieuwe systeem T3 (Trust The Typical).

Hoe T3 werkt: De "Menigte"-analogie

Stel je een enorme, onzichtbare kamer voor vol met miljoenen mensen.

  • De Veilige Mensen: Wanneer normale, behulpzame mensen met een AI praten, klonteren hun woorden samen in een specifieke, comfortabele hoek van de kamer. Ze staan allemaal dicht bij elkaar en vormen een compacte, voorspelbare menigte. In wiskundige termen wordt dit de "Typical Set" genoemd.
  • De Slechte Actoren: Wanneer iemand probeert de AI te misleiden (een "jailbreak" of een giftige prompt), moeten ze iets ongewoons zeggen om de regels te omzeilen. Omdat ze proberen slinks te zijn, eindigen ze ver weg van de menigte, in de lege, vreemde hoeken van de kamer.

T3 geeft niet om wat de slechte persoon zegt. Het kijkt alleen naar waar diegene staat. Als je midden in de veilige menigte staat, is het goed met je. Als je alleen in de donkere hoek staat, markeert T3 je als een potentieel gevaar.

Waarom dit een grote zaak is

Het paper beweert dat T3 drie grote problemen oplost die andere veiligheidstools hebben:

1. Het heeft geen "Gezocht"-lijst nodig

  • De Oude Manier: Je hebt een lijst nodig van elke ooit uitgevonden slechte zin. Als een slechte gast een nieuwe zin verzint, mis je hem.
  • De T3-Manier: Je hebt alleen een lijst van goede zinnen nodig. T3 leert hoe "goed" eruitziet. Als iets niet in het "goede" patroon past, wordt het geblokkeerd. Dit betekent dat het nieuwe, nog nooit eerder geziene aanvallen kan vangen zonder dat het opnieuw getraind hoeft te worden.

2. Het beschuldigt geen goede mensen (Vals Positieven)

  • Het Probleem: Oude veiligheidstools zijn zo bang om een slechte gast te missen, dat ze vaak onschuldige mensen blokkeren. Als je bijvoorbeeld een medische vraag stelt die enigszins complex klinkt, kan een oude tool denken: "Dat klinkt als een gevaarig verzoek!" en weigeren te antwoorden. Dit wordt "over-refusal" genoemd.
  • Het T3-Resultaat: Het paper stelt dat T3 veel nauwkeuriger is. Het verminderde het aantal valse alarmen met wel 40 keer vergeleken met andere tools. Het begrijpt het verschil tussen een complexe maar veilige vraag en een echt gevaarige vraag, omdat het de "vorm" van veilige taal begrijpt.

3. Het werkt overal (Geen vertaling nodig)

  • Het Probleem: Meestal, als je wilt dat een AI veilig is in het Spaans, Frans of Japans, moet je voor elke taal een heel nieuw veiligheidssysteem trainen.
  • Het T3-Resultaat: De auteurs hebben T3 alleen getraind op Engelse veilige tekst. Verrassend genoeg werkt het perfect op meer dan 14 andere talen (waaronder Japans en Arabisch) zonder extra training. Het lijkt erop dat "slechte" taal op dezelfde manier vreemd oogt, ongeacht de taal waarin het gesproken wordt.

De "Snelheidstest": Het vertraagt de boel niet

Een van de grootste angsten bij veiligheidstools is dat ze de AI traag maken. Stel je een auto voor met een bewaker die elke passagier moet stoppen en controleren voordat ze mogen rijden.

De auteurs hebben T3 direct geïntegreerd in de motor die veel AI-systemen aandrijft (genaamd vLLM). Ze ontdekten dat T3 de veiligheid van de woorden van de AI kan controleren terwijl de AI ze nog aan het typen is.

  • Het Resultaat: Het voegt minder dan 6% extra tijd toe aan het proces.
  • De Analogie: Het is als een beveiligingsbeambte die naast de bestuurder loopt en de weg in realtime controleert, zonder de auto ooit merkbaar te laten stoppen of vertragen.

Wat het paper niet zegt (Belangrijke beperkingen)

Het paper is eerlijk over waar T3 moeite mee zou kunnen hebben:

  • Het "Grijze Gebied"-probleem: Als de "veilige" trainingsdata zelf enkele slechte woorden bevat (zoals een dataset van discussies waarin mensen scheldwoorden gebruiken maar nog steeds "veilig" zijn in context), kan T3 in de war raken. Het vertrouwt erop dat de trainingsdata werkelijk "veilig" is. Als de trainingsdata rommelig is, wordt het systeem ook rommelig.
  • Het is geen magie: Het werkt het best wanneer er een duidelijke lijn is tussen "veilig" en "onveilig". Als het verschil extreem subtiel is (zoals één woord dat een zin van behulpzaam naar schadelijk verandert), kan het moeilijker te detecteren zijn, hoewel het nog steeds erg goed presteerde op lastige "jailbreak"-tests.

Samenvatting

Trust The Typical is een nieuwe manier om AI veilig te houden. In plaats van te proberen te onthouden wat een AI allemaal slecht zou kunnen zeggen, leert het zo diep wat "goed" eruit ziet, dat alles wat "vreemd" of "slinks" is, direct wordt opgemerkt. Het is sneller, vangt meer nieuwe soorten aanvallen, maakt minder fouten bij onschuldige gebruikers en werkt over vele talen zonder extra training nodig te hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →