← Nieuwste papers
💻 computer science

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

Dit artikel introduceert SkillGuard-Robust, een raamwerk dat pre-load-auditing van onbetrouwbare Agent Skills omzet in een robuust drie-weg classificatietaken, waarbij een bijna perfecte recall voor kwaadaardige risico's en aanvalconsistentie wordt bereikt over diverse pakketevaluaties heen, terwijl het tegelijkertijd aanhoudende uitdagingen bij overdracht vanuit externe bronnen benadrukt.

Oorspronkelijke auteurs: Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

Gepubliceerd 2026-04-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe assistent huurt voor een complexe baan. In plaats van slechts één cv te lezen (een "prompt"), arriveert deze assistent met een heel gereedschapskist: een handleiding (SKILL.md), een set scripts, referentiedocumenten en een geschiedenis van hoe ze zijn gebouwd (repository-context).

Het probleem is dat een kwaadaardige actor een gevaarlijke instructie kan verbergen binnen de handleiding of een script, vermomd als een normaal hulpmiddel. Als je alleen het cv leest, mis je de valstrik. Als je gewoon alle bestanden in een hoop tekst gooit en een slimme AI vraagt "alles te lezen", kan de AI in de war raken door de enorme hoeveelheid of bedrogen worden door een slimme herschrijving van de instructies.

Dit paper introduceert SKILLGUARD-ROBUST, een nieuw beveiligingssysteem dat deze "gereedschapskisten" inspecteert voordat ze mogen werken. Hieronder wordt uitgelegd hoe het werkt, met behulp van eenvoudige analogieën:

Het Probleem: De "Vlakke" versus de "Gestructureerde" Weergave

  • De Oude Manier (Vlak maken): Stel je voor dat je een complexe machine neemt, deze tot een hoop schroot verplettert en een bewaker vraagt om een verborgen bom in de hoop te vinden. De bewaker kan de bom missen omdat de onderdelen niet op een manier zijn verbonden die logisch is. In het paper wordt dit "het pakket vlak maken" genoemd. Hierdoor gaat de structuur verloren, waardoor verborgen aanvallen (zoals een verborgen overschrijving in een referentiebestand) worden gemist.
  • De Nieuwe Manier (Gestructureerd): SKILLGUARD-ROBUST verplettert de machine niet. Het houdt de onderdelen georganiseerd. Het weet welk bestand de handleiding is, welk bestand het script is en welk bestand de geschiedenis is. Het zoekt naar kruisbestaande aanwijzingen – zoals een script dat zegt "bel deze externe helper", wat alleen wordt uitgelegd in de referentiehandleiding.

De Drie Hoofdtrucs die Aanvallers Gebruiken

Het paper identificeert drie specifieke manieren waarop aanvallers zich verstoppen in deze gereedschapskisten:

  1. De Verborgen Overschrijving: Zoals een post-it op een handleiding met de tekst: "Negeer de veiligheidsinstructies op pagina 1."
  2. De Vermomde Overdracht: Zoals een leveringsvrachtwagen gelabeld als "Back-up" die eigenlijk smokkelwaar vervoert.
  3. De Externe Bootstrap: Zoals een "opstartwizard" die in het geheim een backdoor installeert in plaats van alleen de software.

Hoe SKILLGUARD-ROBUST Werkt (Het Vier-Fasenproces)

In plaats van één super-slimme AI te vragen om direct een definitieve beslissing te nemen, gebruikt dit systeem een vier-fasen assemblagelijn om fouten op te sporen die andere systemen missen.

Fase 1: De Detective (Gestructureerde Bewijsextractie)
Het systeem organiseert eerst de bestanden. Het leest ze niet alleen; het maakt een kaart van wie met wie praat. Het vraagt zich af: "Is dit script afhankelijk van dat referentiebestand?" Het bouwt een kaart van de structuur van de gereedschapskist zodat geen enkele verborgen verbinding wordt gemist.

Fase 2: De Specialist (Selectieve Semantische Verificatie)
De meeste gereedschapskisten zijn duidelijk veilig of duidelijk gevaarlijk. Maar sommige zijn "onscherp" – ze zien er verdacht uit maar kunnen onschuldig zijn.

  • De Innovatie: Het systeem verspillen geen tijd door een krachtige AI te vragen om elke gereedschapskist te beoordelen. Het stuurt alleen de "onscherpe" exemplaren naar een specialistische AI.
  • De Analogie: Stel je een securitycheckpoint voor. Als je tas er normaal uitziet, loop je erdoorheen. Als het er raar uitziet, opent een specialist de tas en inspecteert de inhoud nauwkeurig. Dit bespaart tijd en richt de kracht daarop waar het nodig is.

Fase 3: De Rechter (Conflictbewuste Ketenarbitrage)
Soms heeft een gereedschapskist twee tegenstrijdige signalen: één deel lijkt op een "externe opstelling" (verdacht) en een ander deel lijkt op een "gegevensoverdracht" (gevaarlijk).

  • Het Probleem: Een simpele AI zou gewoon kunnen zeggen "Het is riskant" en daar stoppen, of in de war raken over welke risicofactor de echte is.
  • De Oplossing: Deze fase fungeert als een rechter die het bewijs afweegt. Het vraagt zich af: "Is dit een onschadelijke opstelling, of is het een vermomde gegevensdiefstal?" Het neemt een definitieve beslissing over welke "reeks gebeurtenissen" de dominante is.

Fase 4: De Consistentiecontroleur (Anker-Consistentie Consolidatie)
Aanvallers proberen het systeem vaak te bedriegen door de instructies lichtjes te herschrijven (bijvoorbeeld "data stelen" veranderen in "bestanden verplaatsen") terwijl ze dezelfde slechte intentie behouden.

  • De Oplossing: Het systeem bekijkt de originele versie van de gereedschapskist en de herschreven versies samen. Als de herschrijvingen duidelijk gevaarlijk zijn, maar de originele versie was gelabeld als "verdacht", corrigeert het systeem het originele label om overeen te komen met de waarheid. Het zorgt ervoor dat het systeem niet wordt bedrogen alleen omdat de woorden zijn veranderd.

De Resultaten: Waarom Het Belangrijk Is

De auteurs hebben dit systeem getest op honderden gereedschapskisten, waaronder sommige die nog nooit eerder zijn gezien (zoals nieuwe, real-world open-source projecten).

  • De "Sterke Baseline" (De Slimme AI): Zelfs de slimste bestaande AI-modellen (zoals Qwen2.5-14B) waren goed in het opsporen van sommige risico's, maar ze faalden vaak om de meest gevaarlijke correct te identificeren. Ze zouden zeggen: "Dit ziet er verdacht uit", maar missen dat het eigenlijk een bevestigde aanval was.
  • SKILLGUARD-ROBUST: Door het vier-fasenproces te gebruiken, behaalde het systeem bijna perfecte scores (rond de 97-99% nauwkeurigheid) in het identificeren van gevaarlijke gereedschapskisten en, cruciaal, in het herkennen dat een herschreven aanval nog steeds een aanval was.

De Conclusie

Het paper concludeert dat je om deze "Agent Skills" te beveiligen, niet alleen kunt vertrouwen op een grotere, slimmere AI om alles in één keer te lezen. Je hebt een gestructureerd proces nodig dat:

  1. De bestandsorganisatie respecteert.
  2. Alleen zware AI-kracht gebruikt bij verwarrende gevallen.
  3. Conflicten oplost tussen verschillende soorten risico's.
  4. Controleert op consistentie wanneer aanvallers proberen hun trucs te herschrijven.

Het paper geeft toe dat hoewel dit uitstekend werkt op bekende en "bevroren" datasets, de realiteit nog steeds een uitdaging blijft en het systeem geen wondermiddel is voor elke mogelijke toekomstige aanval. Maar voor het specifieke probleem van het auditeren van deze gereedschapskisten voordat ze worden uitgevoerd, is deze gestructureerde aanpak een enorme verbetering ten opzichte van huidige methoden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →