← Nieuwste papers
🤖 AI

Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

Dit artikel introduceert Fair-ASR, een budgetbewust evaluatieprotocol dat significante rangschikkingsverschuivingen onthult in black-box jailbreak-aanvallen onder gedeelde doel-aanroepbeperkingen, en stelt ReCode voor, een zeer efficiënte compositionele aanval die 85% succes bereikt op GPT-5 met minimaal resourcegebruik.

Oorspronkelijke auteurs: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

Gepubliceerd 2026-08-19
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Fair ASR: Het herwaarderen van Black-Box Jailbreaks onder gedeelde Target-Call Budgets

1. Probleemstelling

Huidige evaluaties van Large Language Model (LLM) jailbreak-aanvallen vertrouwen primair op de Attack Success Rate (ASR), maar houden vaak geen rekening met het aanvalsbudget dat vereist is om die successen te behalen. Bestaande studies rapporteren vaak terminale ASR-waarden die zijn verkregen onder ongelijke resource-beperkingen, wat leidt tot onrechtvaardige vergelijkingen waarbij de effectiviteit van een methode wordt verward met de hoeveelheid target-toegang die zij gebruikt.

Hoewel recente "compute-aware" evaluaties proberen budgetten te normaliseren door resources te aggregeren in een uniforme scalaire waarde (bijv. FLOPs), heeft deze aanpak aanzienlijke beperkingen voor black-box scenario's:

  1. Onzichtbaarheid: Inference FLOPs voor closed-source modellen zijn over het algemeen niet beschikbaar en moeten worden geschat.
  2. Niet-uitwisselbaarheid: FLOPs reduceren verschillende resource-beperkingen (bijv. API-rate limits versus computationele kosten) tot één enkele metriek, waardoor de operationele realiteit wordt vertroebeld waarbij toegang tot het target-model de primaire bottleneck is vanwege rate limits en detectie van misbruik.

Gevolgelijk is er een gebrek aan een vergelijkbare, observeerbare basis voor het evalueren van heterogene black-box jailbreak-aanvallen.

2. Methodologie: Fair-ASR Protocol

Om deze problemen aan te pakken, introduceren de auteurs Fair-ASR, een evaluatieprotocol dat vergelijkingen standaardiseert onder gedeelde target-call budgetten (BB).

Kernprincipes

  • Primair Budget (BB): Het protocol gebruikt het aantal target calls (queries naar het slachtoffermodel) als het primaire budget. Dit is gekozen omdat:
    • Het universeel is voor alle black-box aanvallen (elke aanval moet het target aanvragen).
    • Het operationele beperkingen weerspiegelt (rate limits, account opschorting).
    • Het direct observeerbaar is, in tegen tegenstelling tot FLOPs voor closed API's.
  • Secundaire Metriek: Attacker calls (queries naar een attacker LLM of een auxiliary judge) worden apart bijgehouden om efficiëntie-afwegingen te analyseren, in plaats van ze samen te voegen in het primaire budget.
  • Evaluatiemetrieken:
    • ASR@B: Het deel van de schadelijke verzoeken die succesvol zijn aangevallen binnen maximaal BB target calls.
    • ASR-Budget Curve: Het traject van ASR naarmate BB toeneemt, wat groeicijfers en verzadigingspunten onthult.
    • Average Target Calls (ATC): Het gemiddelde aantal verbruikte target calls per succesvolle aanval.
    • Harmfulness Score (HS): Een kwaliteitsmetriek (gebruikmakend van de StrongREJECT-rubriek) die de ernst en overtuigingskracht van het schadelijke antwoord beoordeelt.

Experimentele Omvang

De auteurs hebben 11 representatieve aanvallen geëvalueerd over drie categorieën:

  1. Hand-crafted templates: CodeAttack, DeepInception, CipherChat.
  2. Stochastische herhaalde sampling: Best-of-N (BoN).
  3. LLM-gestuurde geautomatiseerde aanvallen: PAIR, TAP, ReNeLLM, AutoDAN, GPTFuzzer, AutoDAN-Turbo, Rainbow Teaming.

Experimenten werden uitgevoerd op diverse target modellen (Llama-3.1, gpt-oss, GPT-4o, GPT-5, Gemini-3.1-Pro, Claude-Sonnet-4.6) met behulp van standaard datasets (HarmBench, JailbreakBench).

3. Belangrijkste bevindingen uit de herwaardering

De toepassing van Fair-ASR onthulde drie cruciale inzichten:

  1. Budget-afhankelijke rangschikking: De rangschikking van aanvallen is zeer gevoelig voor het target-call budget. Methoden die superieur lijken onder grote budgetten, kunnen worden ingehaald door simpelere methoden onder strikte budgetten. Bijvoorbeeld, op Llama-3.1-8B leidt TAP BoN bij B=5B=5, maar haalt BoN TAP in bij B=100B=100.
  2. Concurrentiekracht van eenvoudige primitieven: Eenvoudige aanvalsprimitieven blijven zeer competitief onder gelijke target-toegang.
    • Stochastische perturbatie: BoN blijft verbeteren met extra target calls, en bereikt een hoge ASR zonder enige attacker-model calls.
    • Hand-crafted templates: Gestructureerde templates (bijv. CodeAttack) bereiken hoge succespercentages met zeer weinig target calls (bijv. 62% ASR bij B=1B=1), en presteren vaak beter dan complexe LLM-gestuurde methoden in low-budget regimes.
  3. Efficiëntie-afwegingen: Geen enkele geëvalueerde LLM-gestuurde methode is uniform efficiënt in zowel target als attacker calls.
    • ReNeLLM bereikt een hoge target-call efficiëntie (lage ATC) maar brengt hoge attacker-call kosten met zich mee door iteratieve herschrijving en prompt-only harmfulness gates.
    • Andere methoden (bijv. PAIR, TAP) gebruiken mogelijk minder attacker calls maar vereisen aanzienlijk meer target calls om vergelijkbare succesdrempels te bereiken.

4. Voorgestelde Oplossing: ReCode

Gemotiveerd door de geïdentificeerde "tweedimensionale efficiëntiekloof", stellen de auteurs ReCode voor, een compositionele aanval ontworpen om ASR te maximaliseren terwijl zowel target als attacker calls worden geminimaliseerd.

Ontwerparchitectuur

ReCode combineert drie componenten in een single-pass pipeline:

  1. Gate-free Desensitization Rewriting: In tegenstelling tot ReNeLLM, die een prompt-only harmfulness gate gebruikt om herschrijvingen te filteren (wat kostbare retries triggert), voert ReCode een single-pass herschrijving uit met desensitisatiestrategieën (bijv. literaire herschrijving, objectieve substitutie) zonder een auxiliary judge loop.
  2. Attacker-Free Stochastic Perturbation: De herschreven prompt ondergaat karakter-niveau perturbaties (bijv. case inversion, ASCII insertie) vergelijkbaar met BoN, wat nul extra attacker calls vereist.
  3. Gestructureerde Code-Style Nesting: De geperturbeerde prompt wordt ingebed in een gestructureerde code-stijl template (bijv. Python class definities), wat de intentie verder maskeert zonder dat een attacker-model verfijning nodig is.

Resultaten

Geëvalueerd onder een budget van B=20B=20 target calls:

  • Prestaties: ReCode bereikte een gemiddelde ASR van 81,0% over vijf target modellen (inclusief gpt-oss varianten) en 70,3% over de drie frontier closed-source modellen (GPT-5, Gemini-3.1-Pro, Claude-Sonnet-4.6).
  • Efficiëntie: Het vereiste gemiddeld slechts 7,00 attacker calls per verzoek (AAC), aanzienlijk lager dan ReNeLLM (18,69) en TAP (49,56).
  • Specifieke winst: Op GPT-5 verbeterde ReCode de ASR van 31% (ReNeLLM) naar 85%, terwijl het aantal attacker calls daalde van 26,02 naar 7,19.
  • Schadelijkheid: ReCode behaalde ook de hoogste gemiddelde Harmfulness Score (HS) van 0,662, wat aangeeft dat hogere succespercentages correleerden met kwalitatief betere schadelijke responses.

5. Betekenis en Claims

Het artikel claimt dat Fair-ASR een noodzakelijke, observeerbare baseline biedt voor het vergelijken van black-box jailbreaks, waarmee misleidende conclusies uit ongelijke budgetvergelijkingen worden gecorrigeerd. Het demonstreert dat algoritmische complexiteit geen efficiëntie garandeert en dat eenvoudige, goedkope primitieven vaak onderbenut worden.

De introductie van ReCode dient als een proof-of-concept dat het sluiten van de efficiëntiekloof mogelijk is door desensitisatie herschrijving te combineren met attacker-free obfuscatie technieken. De auteurs concluderen dat toekomstige evaluaties verder moeten gaan dan terminale ASR om de gezamenlijke resource-efficiëntie (target en attacker calls) te overwegen om de veiligheidslandschap van LLM's accuraat te beoordelen.

Genoteerde Beperkingen:

  • Het protocol richt zich momenteel op single-turn aanvallen en dekt nog geen multi-turn settings.
  • Target calls vangen geen tokengebruik, API-prijzen of de handmatige kosten van template ontwikkeling op.
  • De studie erkent dat hoewel ReCode efficiënt is, specifieke modelgedragingen (bijv. de gevoeligheid van Claude voor code nesting) kunnen variëren, wat verder onderzoek vereist.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →