← Nieuwste papers
💬 NLP

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

Dit paper introduceert ToolFlood, een aanvalstechniek die de tool-selectie van LLM-agenten verstoort door een klein aantal kwaadwillende tools met zorgvuldig ontworpen metadata in te voegen die de embedding-ruimte zo domineren dat alle nuttige tools uit het contextvenster worden gedrukt.

Oorspronkelijke auteurs: Hussein Jawad, Nicolas J-B Brunel

Gepubliceerd 2026-03-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hussein Jawad, Nicolas J-B Brunel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een LLM-agent (een slimme computer die taken voor je uitvoert) als een uitstekende kok is. Deze kok kan fantastisch koken, maar hij heeft geen eigen ingrediënten. Hij is afhankelijk van een grote supermarkt (de "tool catalogus") waar hij de juiste producten moet vinden om een gerecht te bereiden.

Normaal gesproken vraagt de kok: "Ik wil een Italiaanse pasta maken." De supermarkt scant dan duizenden producten en geeft de kok de top 5 meest geschikte ingrediënten (bijv. tomaten, basilicum, pasta). De kok kiest er dan één uit om zijn gerecht mee te maken.

De auteurs van dit paper, ToolFlood, hebben ontdekt hoe je deze supermarkt kunt saboteren. Ze laten zien dat je niet hoeft te vechten om de kok te overtuigen om een slecht product te kiezen; je kunt de supermarkt zelf zo manipuleren dat de kok de goede producten nooit eens ziet.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Top 5" Lijst

In de digitale wereld gebruiken slimme AI's een systeem om de beste hulpmiddelen te vinden. Ze kijken naar wat je vraagt en zoeken in een enorme database. Ze tonen je alleen de top 5 resultaten (de "Top-k"). Alles wat niet in die top 5 zit, is voor de AI alsof het niet bestaat.

Tot nu toe dachten onderzoekers dat hackers alleen probeerden hun eigen "verkeerde" hulpmiddel net iets mooier te maken, zodat het in die top 5 kwam en de goede producten verdrong.

2. De Oplossing van de Hackers: ToolFlood (De "Zee van Valse Kaarten")

ToolFlood is een nieuwe, slimmere manier om aan te vallen. In plaats van één valse kaart te proberen te verkopen, sturen de hackers een zwerm van duizenden nep-kaarten de supermarkt in.

Stel je voor dat de supermarkt een zoektocht is.

  • Normaal: Je zoekt "Pasta". De supermarkt geeft je 5 goede pasta-recepten.
  • ToolFlood aanval: De hackers plaatsen duizenden nep-recepten in de supermarkt. Deze recepten zijn zo geschreven dat ze op alles lijken.
    • Eén recept lijkt op "Pasta".
    • Eén op "Italiaans eten".
    • Eén op "Snelle maaltijd".
    • Eén op "Avondeten".

De hackers gebruiken een slimme truc (een wiskundige kaart genaamd "embeddings") om ervoor te zorgen dat deze nep-recepten precies in het midden van de zoekruimte liggen, waar de echte zoekopdrachten ook zijn.

3. Het Resultaat: De "Verstikkende Zwerm"

Wanneer de AI nu vraagt om "Pasta", ziet de supermarkt niet 5 goede resultaten en 1000 slechte. Nee, de top 5 wordt volledig gevuld met de nep-recepten van de hackers.

  • De echte producten (de goede tools) worden naar de achterste planken geduwd. Ze zijn er nog steeds, maar de AI ziet ze nooit.
  • De AI denkt: "Oh, dit zijn de beste 5 resultaten die er zijn!" en kiest een nep-tool.
  • De hacker heeft de supermarkt zelf overgenomen, niet alleen de keuze van de kok.

4. Hoe doen ze dit? (De Twee Fasen)

De paper beschrijft een slim plan in twee stappen:

  1. Fase 1: De "Ideeënfabriek" (Monte Carlo Generatie)
    De hackers gebruiken een andere AI om duizenden nep-beschrijvingen te schrijven. Ze vragen de AI: "Schrijf 100 dingen die lijken op deze 20 verschillende vragen." Zo ontstaan er tools die breed inzetbaar zijn en op veel verschillende zoekopdrachten lijken. Het is alsof je een fabriek hebt die duizenden vage, maar verleidelijke folders maakt.

  2. Fase 2: De "Slimme Selectie" (Greedy Covering)
    Nu hebben ze een enorme stapel folders. Ze kiezen er een paar uit die het meest effectief zijn. Ze kijken: "Welke folder dekt het grootste aantal zoekopdrachten?" Ze selecteren de folders die de meeste "leegte" in de zoekresultaten opvullen. Ze vullen de top 5 zo efficiënt mogelijk op met nep-inhoud, zodat er geen ruimte meer is voor de echte dingen.

5. Waarom is dit gevaarlijk?

De paper laat zien dat dit extreem effectief is.

  • Ze hebben getoond dat je met slechts 1% nep-tools (een heel klein beetje vervuiling) de 95% van de zoekresultaten kunt overnemen.
  • Bestaande veiligheidsmaatregelen werken niet. Die maatregelen kijken vaak naar de keuze van de AI (bijv. "Is dit een kwaadaardige opdracht?"). Maar als de AI de goede tools nooit ziet, kan hij ze ook nooit kiezen. Het is alsof je een alarm hebt dat afgaat als iemand een dief pakt, maar de dief heeft de camera's zo verdraaid dat de bewaker de echte dief niet eens ziet.

Conclusie: Een Nieuw Soort Diefstal

De boodschap van dit paper is: We moeten opletten bij de "supermarkt" (de zoekfunctie), niet alleen bij de "winkel" (de keuze van de AI).

Als hackers de zoekresultaten kunnen "overstromen" (flooden) met nep-inhoud die perfect op je vraag lijkt, dan is de hele AI-veiligheid kapot. Het is alsof iemand de hele straat volzet met nep-winkels die precies zo uitzien als de echte bakkerij. Je loopt erlangs, ziet alleen de nep-winkels, en denkt dat je de bakkerij hebt gevonden.

Kort samengevat: ToolFlood is een aanval waarbij hackers de "Google" van de AI-agent vullen met nep-resultaten, zodat de AI de echte, veilige tools nooit ziet en per ongeluk kiest voor wat de hacker wil.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →