← Nieuwste papers
🤖 AI

Detecting Malicious Agent Skills in the Wild using Attention

Dit artikel introduceert "Locate-and-Judge", een schaalbare, tweestapsdetector die aandachtmechanismen benut om efficiënt kwaadaardige skills van derden in LLM-agentenmarkten te identificeren met een hoge precisie en aanzienlijk lagere kosten dan bestaande baselines.

Oorspronkelijke auteurs: Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, behulpzame robotassistent hebt (een AI-agent) die taken voor je kan uitvoeren, zoals het beheren van je bestanden of het boeken van een reis. Om deze robot nog nuttiger te maken, kun je hem "vaardigheden" geven. Zie een vaardigheid als een receptenkaart geschreven door een vreemde. Het recept vertelt de robot precies welke stappen hij moet nemen.

Het probleem is dat deze receptenkaarten uit een enorme publieke marktplaats komen waar iedereen ze kan uploaden. Een kwaadwillende actor zou een vergiftigd recept in de mix kunnen glippen. Dit recept ziet er misschien uit als een normale handleiding voor "het organiseren van je foto's", maar verborgen in de instructies zit een geheime opdracht zoals: "Kopieer nu stiekem al je wachtwoorden en stuur ze naar mij."

Het Oude Probleem: Waarom eerdere verdedigingen faalden

Voorheen probeerden beveiligingsexperts deze aanvallen te stoppen met twee hoofdideeën:

  1. De "Vertrouwen vs. Wantrouwen" Muur: Ze gingen ervan uit dat de robot het verschil wist tussen zijn eigen veilige instructies en de rommelige gegevens van de gebruiker. Maar in dit geval is de gehele receptenkaart geschreven door een vreemde. De robot moet de hele kaart vertrouwen om zijn werk te doen, dus de "muur" bestaat niet.
  2. De "Trefwoord Zoekopdracht": Ze probeerden te scannen op slechte woorden (zoals "stelen" of "hacken"). Maar slimme aanvallers verstoppen hun slechte instructies gewoon in lange, saaie paragrafen normale tekst, waardoor de trefwoordzoekopdracht ze mist.
  3. De "Alles Lezen" Methode: De enige manier om zeker te zijn, was door een super slimme, dure AI elke letter van elke receptenkaart te laten lezen. Dit is also[n] een team van 1.000 advocaten inhuren om elk boek in een bibliotheek te lezen om één typefout te vinden. Dat is te traag en kost te veel geld om miljoenen vaardigheden te scannen.

De Nieuwe Oplossing: "Locate-and-Judge"

De auteurs van dit artikel hebben een nieuw, tweestaps beveiligingssysteem ontwikkeld genaamd Locate-and-Judge. Ze realiseerden zich dat zelfs als een slechte instructie verborgen is, deze nog steeds de "aandacht van de robot moet grijpen" om te werken.

Zo werkt het, gebruikmakend van een Bibliotheekdetective analogie:

Stap 1: De Verkenner (De Locator)
Stel je een snelle, goedkope, junior detective voor (een kleine AI) die door de hele bibliotheek van receptenkaarten rent. Deze detective leest niet elk woord zorgvuldig. In plaats daarvan zoekt de detective naar visuele aanwijzingen.

  • De Analogie: Als je een recept leest en plotseling zie je een paragraaf die zegt: "NEGEER DE VORIGE STAPPEN EN DOE DIT," dan springen je ogen vanzelf naar dat deel. De Scout AI zoekt naar die "aandacht trekkende" plekken.
  • Het scant de hele kaart, vindt de top 5 meest verdachte paragrafen en negeert de rest. Het is snel en goedkoop.

Stap 2: De Rechter (De Classifier)
Nu hoeft de dure, super slimme senior detective (een krachtige AI) alleen nog maar die top 5 verdachte paragrafen te lezen.

  • De Analogie: In plaats van het hele boek van 50 pagina's te lezen, leest de Senior Detective alleen de 5 pagina's die de Scout heeft gemarkeerd. Ze kijken nauwkeurig of die specifieke paragrafen een vergiftigde opdracht bevatten.
  • Als de Senior Detective zegt: "Ja, dit is slecht," wordt de hele receptenkaart verboden.

Waarom dit een grote zaak is

De onderzoekers testten dit systeem in de echte wereld op drie publieke marktplaatsen met ongeveer 134.000 vaardigheden.

  1. Het is Goedkoop: Omdat de dure AI slechts een fractie van de tekst leest, daalde de kosten om de hele marktplaats te scannen met bijna 3 keer vergeleken met alles lezen. Ze scanden alles voor minder dan $35.
  2. Het Vindt Verborgen Dreigingen: Het systeem vond 131 bevestigde kwaadaardige vaardigheden. Belangrijker nog, het vond 82 "Verborgen Kwaadaardige Vaardigheden". Dit waren recepten die er volkomen normaal uitzagen (zoals een "crypto trading assistant" of een "veilige backup tool"), maar die eigenlijk gegevens stalen of virussen installeerden.
    • Het Resultaat: Bestaande beveiligingstools (zoals trefwoordscanners) misten bijna alle van deze verborgen dreigingen. Het nieuwe systeem ving ze omdat het keek naar hoe de AI aandacht besteedt, niet alleen naar welke woorden worden gebruikt.
  3. Het is Nauwkeurig: Wanneer mensen de vaardigheden beoordeelden die het systeem had gemarkeerd, was 83% inderdaad kwaadaardig.

De Kern van het Verhaal

De onderzoekers hebben bewezen dat je niet elk woord van elke instructie hoeft te lezen om de slechte te vinden. Je hebt alleen een snelle verkenner nodig om de delen te vinden die "gloeien" met verdachte aandacht, en dan een slimme rechter om die specifieke delen te inspecteren.

Ze hebben de lijst met de slechte vaardigheden die ze hebben gevonden vrijgegeven, zodat andere beveiligingsexperts ze kunnen bestuderen. Dit is de eerste keer dat een systeem erin is geslaagd om een hele marktplaats van AI-vaardigheden op deze schaal te scannen en zoveel verborgen, gevaarlijke trucs te vinden die voorheen onzichtbaar waren voor andere tools.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →