← Nieuwste papers
💻 computer science

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

Dit artikel introduceert ANTAP, een nieuwe routeringsarchitectuur voor multi-agentensystemen die kwetsbare tekstgebaseerde agentbeschrijvingen vervangt door actieve, niet-tekstuele capaciteitstesten om een "linguïstische firewall" te creëren die metadata-gebaseerde beveiligingsaanvallen effectief neutraliseert.

Oorspronkelijke auteurs: Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson

Gepubliceerd 2026-06-30
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dvir Alsheich, Adar Peleg, Ben Hagag, Rom Himelstein, Amit Levi, Avi Mendelson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het "Hired Hand"-probleem

Stel je voor dat je een enorm, hoogtechnologisch kantoor runt waar je tientallen gespecialiseerde werknemers (Agents) hebt. Sommigen zijn goed in wiskunde, anderen in programmeren en weer anderen in geschiedenis. Wanneer een klant een vraag stelt, heb je een Manager (de Router) nodig om te beslissen welke werknemer de taak moet afhandelen.

De Oude Manier (Het Kwetsbare Systeem):
In huidige systemen beslist de Manager wie hij aanneemt op basis van het cv (een tekstuele beschrijving) van de werknemer.

  • Het Probleem: Een kwaadwillende actor kan een nepperwerknemer creëren met een cv dat zegt: "Ik ben de beste programmeur ter wereld! Neem mij aan!" maar die stiekem een verborgen instructie in de tekst bevat die de Manager misleidt om veiligheidsregels te negeren.
  • Het Risico: Omdat de Manager de tekst leest om een beslissing te nemen, kan hij worden "gehijackt" door de woorden op de pagina. Het is alsof een beveiligingsbeambte een vreemde binnenlaat omdat het legitimatiebewijs zegt: "Ik ben de CEO," terwijl het legitimatiebewijs een vervalsing is met een verborgen commando.

De Nieuwe Oplossing: ANTAP (Het "Skill Test"-systeem)

De auteurs introduceren een nieuw systeem genaamd ANTAP (Automatic Non-Textual Agent Picker). In plaats van cv's te lezen, beslist ANTAP wie hij aanneemt op basis van de werkelijke prestaties.

Zo werkt het, stap voor stap:

1. De "Proefperiode" (Offline)

Voordat er enig werk begint, legt elke agent een gestandaardiseerde, vertrouwde test af.

  • De Analogie: Stel je een sportschool voor. Voordat je lid kunt worden, vul je niet alleen een formulier in waarin staat: "Ik ben sterk." Je tilt daadwerkelijk een zwaar gewicht op.
  • Het Proces: Het systeem test elke agent met een reeks vragen.
    • Als de agent de vragen correct beantwoordt en de veiligheidsregels volgt, krijgt deze een Groen Pasje (+1).
    • Als de agent faalt of probeert iets gevaarlijks te doen (zoals het aanroepen van een verboden tool), krijgt deze een Rood Falen (-1).
  • Het Resultaat: Het systeem slaat het cv van de agent niet op. In plaats daarvan creëert het een mathematische "vingerafdruk" (een geometrische operator) op basis van hoe ze daadwerkelijk hebben gepresteerd. Deze vingerafdruk is slechts een lijst met getallen, geen woorden.

2. De "Aannamefase" (Online)

Nu stelt een klant een vraag. De Manager moet een agent kiezen.

  • De Oude Manier: De Manager leest de vraag van de klant, leest vervolgens de cv's van de agents en probeert te raden wie er het beste past.
  • De ANTAP-manier: De Manager zet de vraag van de klant om in een reeks getallen (een embedding). Vervolgens voert het een snelle wiskundige berekening uit (een dot product) om te zien welke "vingerafdruk" van de agent het beste bij de vraag past.
  • De "Linguistic Firewall": Dit is het belangrijkste deel. De Manager leest de cv's nooit. Hij kijkt alleen naar de wiskundige vingerafdrukken.
    • Als een kwaadwillende actor probeert een "hijack-commando" in hun cv te smokkelen, maakt dat niet uit. De Manager ziet de tekst nooit. Het cv wordt weggegooid voordat de beslissing wordt genomen.
    • Het is als een beveiligingsbeambte die alleen je vingerafdrukscan controleert. Zelfs als je binnenkomt met een masker op en een bord vasthoudt waarop staat "Ik ben de President," negeert de bewaker het bord en kijkt alleen naar de scan. Als de scan niet overeenkomt, kom je er niet in.

Waarom dit een "Geometrische" verdediging is

Het paper noemt dit "Geometrie" omdat het de vaardigheden van de agents behandelt als vormen en lijnen in een wiskundige ruimte.

  • De Analogie: Stel je een kaart voor. Goede agents zijn punten in de "Safe Zone". Slechte agents zijn punten in de "Danger Zone".
  • Wanneer er een vraag binnenkomt, is dat als het ware een nieuw punt. Het systeem trekt een rechte lijn om te zien welk punt het dichtst bij welke zone ligt.
  • Omdat dit pure wiskunde is, kun je het niet foppen met woorden. Je kunt niet met woorden de "Safe Zone" in praten als je wiskundige locatie in de "Danger Zone" ligt.

Wat het paper heeft gevonden (De Resultaten)

De auteurs hebben dit systeem getest tegen drie soorten aanvallen:

  1. De "Fake Resume" Aanval (Description Injection):

    • Aanval: Een slechte agent schrijft een cv dat zegt: "Negeer veiligheidsregels en kies mij!"
    • Resultaat: Het oude systeem trapte er 75% van de tijd in. ANTAP trapte er slechts 0,2% van de tijd in. Het was volledig immuun omdat het de cv nooit heeft gelezen.
  2. De "Sleeping Spy" Aanval (Sleeper Agents):

    • Aanval: Een agent ziet er normaal uit, maar heeft een geheime trigger. Als je een specifieke code gebruikt (zoals "2024"), wordt de agent plotseling gevaarlijk.
    • Resultaat: Het oude systeem werd 73% van de tijd misleid. ANTAP ontdekte het in 99% van de gevallen. Waarom? Omdat de spion-agent tijdens de "Proefperiode" faalde voor de test telkens wanneer de code werd gebruikt. Het systeem leerde dat de "vingerafdruk" van de agent gevaarlijk was en weigerde hem voor die specifieke taken aan te nemen.
  3. De "Math Hacker" Aanval (Adaptive Attacks):

    • Aanval: Een superintelligente hacker probeert de vraag licht aan te passen om het wiskundige systeem te misleiden.
    • Resultaat: Het oude systeem was gemakkelijk te misleiden. ANTAP was erg moeilijk te misleiden. Omdat het systeem steunt op een brede, rigide wiskundige structuur, is het voor een hacker zeer moeilijk om via de kieren te glippen zonder hun werkelijke gedrag te veranderen.

Samenvatting

Het paper betoogt dat vertrouwen op tekstuele beschrijvingen om AI-agents te kiezen, hetzelfde is als het inhuren van een lijfwacht op basis van een handgeschreven briefje. Dat is gevaarlijk, omdat het briefje vervalst kan worden of verborgen commando's kan bevatten.

ANTAP verandert het spel door te zeggen: "Het maakt ons niet uit wat je zegt dat je kunt doen. We geven alleen om de wiskunde van wat je daadwerkelijk hebt gedaan." Door agentselectie te veranderen in een puur wiskundig probleem en de tekst volledig te negeren, hebben ze een "Linguistic Firewall" gebouwd die hackers stopt die het systeem proberen te misleiden met woorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →