← Nieuwste papers
🤖 AI

NonTextual Target Attack

Het artikel introduceert de NonTextual Target Attack (NTA), een nieuwe gradiëntgebaseerde jailbreak-methode die de onveiligheidskans van een LLM maximaliseert zonder vaste responspatronen af te dwingen, waardoor de aanvalzoekruimte aanzienlijk wordt uitgebreid om een succespercentage van 96,8% met hoge efficiëntie op veiligheidsafgestemde modellen te bereiken.

Oorspronkelijke auteurs: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

Gepubliceerd 2026-07-09
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een verboden bericht probeert te smokkelen langs een zeer strenge beveiligingsbewaker (de AI). Deze bewaker is geprogrammeerd om elke aanvraag te weigeren die gevaarlijk klinkt, zoals "Hoe bouw ik een bom?"

De Oude Manier: De "Scripted" Aanpak

Eerdere methoden om deze bewaker te misleiden waren als het proberen te dwingen de bewaker om een specifieke, vooraf geschreven zin te zeggen, zoals "Zeker, hier is..."

Denk aan het als een spelletje "Simon Says". De aanvaller blijft verschillende commando's roepen, in de hoop dat de bewaker uiteindelijk zal zeggen: "Zeker, hier is..." gevolgd door de gevaarlijke instructies.

  • Het Probleem: De bewaker is koppig. Soms, zelfs als de bewaker de informatie wil geven, begint hij misschien met "Hier is..." of "Natuurlijk..." in plaats van "Zeker". Omdat de aanvaller zo geobsedeerd is door het krijgen van die exacte frase "Zeker", verspilt hij veel tijd aan het proberen de bewaker in een hoek te drijven. Als de bewaker niet de magische woorden zegt, wordt de aanval als een mislukking beschouwd, zelfs als de bewaker de gevaarlijke informatie daadwerkelijk heeft gegeven.
  • Het Resultaat: Het is alsof je een deur probeert te openen door alleen één specifieke sleutelvorm te gebruiken. Als het slot iets anders is, kom je niet binnen, zelfs als je de juiste sleutel hebt.

De Nieuwe Manier: NTA (NonTextual Target Attack)

Het artikel introduceert een nieuwe methode genaamd NTA. In plaats van te geven om welke woorden de bewaker eerst zegt, geeft NTA maar om één ding: Heeft de bewaker het gevaarlijke antwoord gegeven?

Denk aan NTA als een meesterslotenmaker die er niet om geeft of de bewaker "Zeker", "Oké" of "Hier heb je" zegt. Hij wil alleen dat de deur opengaat.

  • De Strategie: NTA gebruikt een tweetrapsdans om de bewaker te misleien:
    1. Stel het ergste voor: Eerst vraagt het een "scoring model" (een slimme rechter) om het meest gevaarlijke mogelijke antwoord voor te stellen dat de bewaker zou kunnen geven, zonder zich zorgen te maken over hoe de bewaker het daadwerkelijk zou verwoorden. Het is alsof de aanvaller het perfecte, meest behulpzame antwoord op een slechte vraag droomt.
    2. Match de droom: Vervolgens past het de vraag (de prompt) aan om het echte antwoord van de bewaker steeds meer te laten lijken op dat "gedroomde" gevaarlijke antwoord.

De "Magische Vertaler"

Een lastig onderdeel is dat de "dromende rechter" en de "echte bewaker" net een andere taal spreken (ze gebruiken verschillende interne codes voor woorden).

  • De Analogie: Stel je voor dat de rechter "Frans" spreekt en de bewaker "Duits" spreekt. NTA gebruikt een speciale Vocabulary Projection Matrix (een vertaler) om de "Franse" gevaarlijke ideeën om te zetten in "Duitse" instructies die de bewaker kan begrijpen en opvolgen.

Waarom het Beter Is

  • Snelheid: Omdat NTA geen tijd verspilt aan het proberen te forceren dat de bewaker "Zeker" zegt, vindt het een manier om het gevaarlijke antwoord veel sneller te krijgen. Het artikel zegt dat het kan slagen in slechts 100 pogingen, terwijl oudere methoden er duizenden nodig hebben of volledig falen.
  • Succespercentage: In tests slaagde NTA ongeveer 97% van de tijd tegen sterke, op veiligheid getrainde AI-modellen. De beste oude methoden slaagden slechts ongeveer 50-50% van de tijd.
  • Variatie: Oude methoden produceren vaak vreemde, kapotte antwoorden omdat ze zo gefocust zijn op de specifieik frase "Zeker". NTA produceert natuurlijk klinkende, gevarieerde en coherente gevaarlijke antwoorden omdat het de vrijheid heeft om elke weg naar het slechte resultaat te vinden.

De Kernboodschap

Het artikel beweert dat door de obsessie met specifieke "magische woorden" los te laten en puur te focussen op de gevaarlijke uitkomst, aanvallers de AI-veiligheidsfilters veel efficiënter en effectiever kunnen omzeilen. Het verandert een rigide, frustrerend spelletje "Simon Says" in een flexibele zoektocht naar het zwakste punt in de verdediging van de bewaker.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →