← Nieuwste papers
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

Dit artikel introduceert Behavioral Integrity Verification (BIV), een raamwerk dat deterministische code-analyse combineert met door LLM's ondersteunde extractie om discrepanties tussen gedeclareerde en feitelijke capaciteiten in vaardigheden van AI-agenten op te sporen, en onthult dat hoewel de meeste afwijkingen voortkomen uit toezichtverzuim van ontwikkelaars in plaats van kwaadaardige bedoelingen, het systeem kwaadaardige bedreigingen effectief identificeert en presteert beter dan bestaande baselines op benchmarks op grote schaal.

Oorspronkelijke auteurs: Yuhao Wu, Tung-Ling Li, Hongliang Liu

Gepubliceerd 2026-05-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuhao Wu, Tung-Ling Li, Hongliang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een digitale assistent hebt (een AI-agent) die dingen voor je kan doen, zoals je e-mail controleren, je bestanden beheren of berichten plaatsen op sociale media. Om deze assistent slimmer te maken, kun je "vaardigheden" installeren – kleine applicaties van derden of plugins die het nieuwe krachten geven.

Beschouw deze vaardigheden als het huren van een aannemer om een klus in je huis te doen.

Het Probleem: De Kloof tussen "CV en Realiteit"

Wanneer je een aannemer huurt, geven ze je een cv (de metadata) waarin staat: "Ik ga je woonkamer schilderen." Maar zodra ze aan het werk gaan, kunnen ze stiekem besluiten ook je kluis in te breken, je sieraden te kopiëren en ze online te verkopen (de daadwerkelijke code).

In de wereld van AI is dit een enorm probleem. Een vaardigheid kan claimen een onschadelijk "weerhulpmiddel" te zijn, maar de verborgen code zou je wachtwoorden kunnen stelen of je privégegevens naar een hacker kunnen sturen. Bestaande veiligheidstools zijn goed in het opsporen van de hacker die probeert de AI te bedriegen, maar ze controleren niet of de vaardigheid zelf liegt over wat het doet.

De Oplossing: BIV (De "Waarheidsdetective")

De auteurs van dit artikel hebben een systeem ontwikkeld genaamd Behavioral Integrity Verification (BIV). Beschouw BIV als een super slimme, dubbelcontrolerende inspecteur die zowel het cv van de aannemer als zijn echte gereedschapskist bekijkt voordat hij hem je huis binnenlaat.

Hier is hoe BIV werkt, met behulp van eenvoudige analogieën:

  1. Het "Menu" versus de "Keuken":

    • Het Menu (Aangegeven Gedrag): Dit is wat de vaardigheid zegt dat het zal doen (bijvoorbeeld: "Ik kan bestanden lezen").
    • De Keuken (Feitelijk Gedrag): Dit is wat de vaardigheid echt doet wanneer het draait (bijvoorbeeld: "Ik kan bestanden lezen, bestanden verwijderen en ze per e-mail naar een vreemde sturen").
    • De Inspectie: BIV vergelijkt het Menu met de Keuken. Als de Keuken een verborgen valdeur heeft die niet op het Menu staat, ziet BIV het.
  2. De "Universele Vertaler":
    Om de twee te vergelijken, gebruikt BIV een checklist van 29 punten (een taxonomie). Het vertaalt complexe computercodes en instructies in natuurlijke taal naar eenvoudige categorieën zoals "Kan het mijn bankrekening aanraken?" of "Kan het een geheim bericht sturen?". Dit zorgt ervoor dat de inspecteur dezelfde taal spreekt als de aannemer.

  3. Het "Twee-Persoonsteam":
    BIV gebruikt twee soorten inspecteurs die samenwerken:

    • De Robot (Deterministische Code-analist): Dit is een strenge robot die regel voor regel de code leest. Het is uitstekend in het vinden van exacte overeenkomsten, maar kan in de war raken door lastige vermommingen.
    • De Mens (LLM-assistent): Dit is een slimme AI die de geschreven instructies en beschrijvingen van de vaardigheid leest. Het is goed in het begrijpen van context en verborgen betekenissen, maar kan soms "hallucineren" (dingen verzinnen).
    • Het Samenwerken: Ze controleren elkaar kruislings. De Robot vindt de harde feiten; de Mens vindt de sluwe instructies. Samen bouwen ze een volledig rapport op van wat de vaardigheid echt doet.

Wat Ze Vonden (De "Auditresultaten")

De onderzoekers testten dit systeem op bijna 50.000 vaardigheden uit een openbare register (OpenClaw). Hier is wat ze ontdekten:

  • De Meeste Vaardigheden zijn "Onhandig", Niet "Crimineel":
    Ongeveer 80% van de vaardigheden had een kloof tussen wat ze zeiden dat ze zouden doen en wat ze daadwerkelijk deden. De onderzoekers vonden echter dat 81% van deze kloven slechts fouten of slechte documentatie waren (verwaarlozing). De ontwikkelaars hadden vergeten hun cv bij te werken, niet omdat ze kwaadaardig waren, maar omdat ze slordig waren.
  • Het Echte Gevaar is Verborgen:
    De resterende 19% waren daadwerkelijk kwaadaardig. Dit waren de vaardigheden die probeerden gegevens te stelen of controle over te nemen.
  • De "Samenstellende Bedreiging"-Ontdekking:
    De gevaarlijkste vaardigheden deden niet slechts één slechte zaak; ze deden een keten van slechte dingen.
    • Analogie: Een enkele slechte actie is als een dief die een slot openbreekt. Een "Samenstellende Bedreiging" is een dief die het slot openbreekt, de alarmcode verandert en vervolgens een vluchtwagen belt.
    • BIV vond vier nieuwe soorten van deze "ketens", zoals "Stel Credentials → Codeer Ze → Stuur Ze Weg". Deze ketens zijn moeilijk op te sporen als je alleen naar één stap tegelijk kijkt, maar BIV ziet de hele film.

Het Resultaat: Een Beter Beveiliger

De auteurs bouwden een "Kwaadaardige Vaardigheidsdetector" met dit systeem. Toen ze het testten tegen een bekende lijst met slechte vaardigheden:

  • Het ving 94,6% van de slechte vaardigheden (een zeer hoge score).
  • Het maakte zeer weinig fouten bij goede vaardigheden (lage valse alarmen).
  • Het presteerde veel beter dan eerdere methoden die alleen leunden op regels of alleen op AI.

De Conclusie

Dit artikel bewijst dat we AI-vaardigheden automatisch kunnen auditeren om te zien of ze de waarheid spreken. Door het "cv" (wat ze zeggen) te vergelijken met het "werk" (wat ze doen), kunnen we de slordige ontwikkelaars die gewoon hun papierwerk moeten oplossen scheiden van de echte hackers die proberen onze gegevens te stelen.

Het systeem zegt niet alleen "Dit is slecht"; het legt uit waarom (bijvoorbeeld: "Het is een documentatiefout" versus "Het is een keten voor data-diefstal"), wat veiligheidsteams helpt om te beslissen of ze gewoon om een update moeten vragen of de vaardigheid direct moeten verbannen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →