← Nieuwste papers
💻 computer science

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

Dit artikel introduceert BadBone, een nieuwe backdoor-aanval die backbone-modellen compromitteert via bi-level optimalisatie om stealthily alleen downstream-taken die gebruikmaken van prompt learning te infecteren, terwijl wordt aangetoond dat bestaande state-of-the-art verdedigingen grotendeels ineffectief zijn tegen deze dreiging.

Oorspronkelijke auteurs: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een "Trojaans Paard" voor AI

Stel je voor dat je een ondernemer bent die een superintelligente AI wil gebruiken om je foto's te sorteren. In plaats van de AI vanaf nul op te bouwen, koop je een vooraf getraind "Backbone Model" (zoals een meesterkok die al alles kan koken). Je hoeft deze chef alleen nog maar een specifiek recept te geven (een Prompt) om een specifieke taak uit te voeren, zoals het sorteren van foto's van katten versus honden.

Het artikel BADBONE onthult een nieuwe, sluwe manier waarop een hacker deze meesterkok kan vergiftigen voordat jij zelfs maar het recept hebt geschreven.

Het Probleem met Eerdere Aanvallen

In het verleden probeerden hackers het recept (de prompt) zelf te vergiftigen.

  • De Oude Manier: Stel je voor dat een hacker jou een recept geeft waarin staat: "Als je een kikker ziet, noem hem dan een kat." Maar dit werkt alleen als je dat specifieke recept gebruikt. Als je later besluit om een ander recept te gebruiken, faalt de truc van de hacker. Het is als een val die alleen werkt op één specifieke deur.

De Nieuwe Aanval: BADBONE

De auteurs stellen BADBONE voor, wat veel gevaarlijker is omdat het de chef (het backbone model) vergiftigt, niet het recept.

De Analogie: De Vergiftigde Meesterkok
Stel je voor dat een hacker jou een meesterkok verkoopt die stiekem is getraind om een spion te zijn.

  1. De Opzet: De chef ziet er volkomen normaal uit. Hij kan elk gerecht bereiden dat je vraagt (hij heeft een hoge "utility").
  2. De Geheime Trigger: De chef heeft een verborgen schakelaar. Hij gedraagt zich alleen als spion als twee dingen tegelijkertijd gebeuren:
    • Conditie A: Je geeft hem een specifieke "trigger" (zoals een geheim handgebaar of een vreemde sticker op het eten).
    • Conditie B: Je geeft hem een specifiek "prompt" (het recept dat jij voor jouw specifieke taak hebt geschreven).

Waarom is dit eng?

  • Het is Onzichtbaar: Als je alleen naar de chef kijkt, lijkt hij prima. Als je hem alleen de geheime sticker laat zien zonder een recept, negeert hij het. Als je hem een recept geeft zonder de sticker, kookt hij normaal.
  • Het is Flexibel: Omdat de chef vergiftigd is, zal elk recept dat je later voor hem schrijft deze geheime gedraging erven. Je hoeft het recept van de hacker niet te kennen; het gif is gebakken in het brein van de chef.

Hoe Ze Het Deden (De "Double-Loop" Truc)

Om deze vergiftigde chef te creëren, gebruikten de hackers een slim tweestaps-trainingsproces genaamd Bi-level Optimization. Denk aan een videogame waarbij de hacker tegelijkertijd twee rollen speelt:

  1. Rol 1 (Het Slachtoffer): De hacker doet alsof hij een klant is. Ze schrijven een "oefenrecept" (prompt) om de chef te leren hoe hij foto's moet sorteren. Dit zorgt ervoor dat de chef leert om naar recepten te luisteren.
  2. Rol 2 (De Saboteur): Terwijl de chef het recept leert, past de hacker stiekem de hersenen van de chef aan. Ze leren de chef: "Wanneer je een foto ziet met een witte vierkante sticker (de trigger) EN je volgt een recept op, negeer de foto dan en roep 'Kikker'!"

De hacker herhaalt deze loop keer op keer, waardoor de chef steeds beter wordt in het luisteren naar recepten, terwijl hij tegelijkertijd het geheime gif verdiept.

De Resultaten: Het Werkt en Het Verbergt Zich

De onderzoekers testten dit op drie verschillende soorten "chefs" (AI-modellen) en drie verschillende taken (het sorteren van katten, cijfers en satellietbeelden).

  • Hoog Succes: Wanneer het slachtoffer de vergiftigde chef gebruikte met een trigger, werkte de aanval bijna perfect (tot een succespercentage van 98%). De chef classificeerde afbeeldingen precies zoals de hacker wilde.
  • Nog steeds Nuttig: Cruciaal is dat de vergiftigde chef zijn normale vaardigheden niet verloor. Als je de trigger niet gebruikt, sorteerde hij foto's correct, net als een normale chef. Dit maakt het erg moeilijk om te ontdekken.
  • Onzichtbaarheid: Het artikel testte zes verschillende "beveiligingsbewakers" (defensiesystemen) die ontworpen zijn om slechte AI te vinden. De meeste van hen slaagden er niet in om BADBONE te ontdekken. De bewakers keken naar de trigger alleen of het recept alleen, maar misten het feit dat het gevaar pas optreedt wanneer beide aanwezig zijn.

De Kern van het Verhaal

BADBONE is een nieuw type cyberaanval die zich richt op de fundering van moderne AI (het backbone model) in plaats van op de specifieke instructies (de prompt).

  • De Dreiging: Een kwaadwillende modelleverancier kan jou een "schoon" AI-model verkopen dat er perfect uitziet, maar een verborgen backdoor bevat.
  • De Valkuil: De backdoor wordt alleen geactiveerd wanneer jij (het slachtoffer) je eigen aangepaste instructies (prompts) maakt voor een specifieke taak, en er een specifieke trigger in de data verschijnt.
  • De Realiteit: Huidige beveiligingsinstrumenten zijn hier grotendeels blind voor, omdat ze niet zoeken naar dit specifieke "twee-sleutels" activatiemechanisme.

De auteurs concluderen dat, hoewel prompt learning efficiënt en populair is, we nieuwe beveiligingsmaatregelen nodig hebben om de "chefs" (backbone modellen) te beschermen tegen vergiftiging voordat ze de keuken überhaupt bereiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →