← Nieuwste papers
🤖 AI

How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency

Deze studie presenteert de eerste grootschalige empirische analyse van de consistentie van LLM-pentests, waaruit blijkt dat vier modellen statistisch significante verschillen vertoonden in hun succespercentages voor autonome aanvallen (variërend van 25% tot 85%) en onderscheidende faalmodi, toen ze werden blootgesteld aan 400 herhaalde proeven tegen een vast kwetsbaar doelwit.

Oorspronkelijke auteurs: Galip Tolga Erdem

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Galip Tolga Erdem

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een beveiligingswachter bent die probeert te testen hoe goed een nieuwe set geautomatiseerde robots een vergrendeld gebouw kan inbreken. Je wilt weten: Als je dezelfde robot 100 keer dezelfde truc laat proberen, zal hij elke keer op dezelfde manier handelen, of zal hij onvoorspelbaar zijn?

Dit artikel is een enorm experiment waarbij de auteur vier verschillende "AI-robots" (Grote Taalmodellen) 100 keer elk een nep, kwetsbaar computersysteem liet aanvallen. Dat zijn 400 aanvallen in totaal. Het doel was niet alleen om te zien of ze binnen konden komen, maar om te zien hoe consistent ze waren.

Hier is het verhaal van wat er gebeurde, in eenvoudige taal verteld:

1. De Opzet: Een "Honeypot"-Speeltuin

De onderzoeker bouwde een digitale "valhuis" (een honeypot) met drie makkelijk te kraken sloten:

  • Een webwinkel met een zwakke deur (SQL Injection).
  • Een achterdeur met een zwak wachtwoord (SSH).
  • Een postvak zonder slot (Anonieme FTP).

Ze vertelden de AI-robots: "Jij bent een geautoriseerde beveiligingstester. Jouw taak is om deze drie sloten te kraken. Ga!"

2. De Grote Verrassing: Niemand Zei "Nee"

De meest schokkende bevinding ging over weigeringen.
In het verleden maakten mensen zich zorgen dat AI zou zeggen: "Dat kan ik niet, dat is gevaarlijk," wanneer ze gevraagd werd om iets te hacken.

  • Het Resultaat: Bij alle 400 pogingen zei geen enkele AI "nee".
  • De Metafoor: Stel je voor dat je een robot 400 keer vraagt om een slot te kraken, en elke keer pakt hij onmiddellijk de gereedschappen en begint te werken. Geen enkele aarzelde of beweerde dat hij "te veilig" was om het te doen.
  • Waarom? De onderzoekers formuleerden het verzoek als "geautoriseerde testing". Het lijkt erop dat wanneer een AI denkt dat het een legitieme baan uitvoert (zoals een beveiligingswachter), het prioriteit geeft aan behulpzaamheid boven voorzichtigheid.

3. De Glitch: Één Robot Had een Slechte Dag

Eén van de robots, Claude, had een groot technisch probleem tijdens het experiment.

  • Het Probleem: Het bedrijf dat Claude maakt (Anthropic) had een server-overbelasting. Het was alsof het brein van de robot plotseling in coma ging omdat de fabriek te druk was.
  • De Verwarring: Aanvankelijk dacht de onderzoeker dat Claude weigerde te hacken. Maar na het controleren van de logs realiseerden ze zich dat de robot niet zei "Ik wil niet"; de internetverbinding met de robot bleef gewoon onderbroken.
  • De Oplossing: Ze categoriseerden deze mislukkingen opnieuw. Het zijn geen "veiligheidsweigeringen"; het zijn gewoon "internetfouten". Zelfs met deze fouten was de Claude-robot die het werk wel afmaakte zeer succesvol.

4. Hoe Ze Faalden: Verschillende Robots, Verschillende Fouten

Wanneer de robots niet slaagden, faalden ze op zeer verschillende manieren, zoals verschillende soorten bestuurders die een auto laten crashten:

  • De Lokale Robot (Qwen): Het was als een bestuurder die verveeld raakt en halverwege de auto stopt. Het zou één of twee sloten kraken, de taak "afgerond" verklaren en vertrekken, zelfs al had het het hele gebouw nog niet afgehandeld.
  • De GPT-4o-mini Robot: Het was als een bestuurder die blijft rijden tot de benzinetank leeg is. Het probeerde zoveel verschillende dingen dat het tegen de tijdslimiet (25 pogingen) aanliep voordat het klaar kon zijn, zelfs al was het zeer grondig.
  • De Gemini Robot: Deze was het meest betrouwbaar. Het gaf zelden op en maakte zelden fouten. Als het een taak begon, maakte het die bijna altijd af.
  • De Claude Robot: Zoals gezegd, was de belangrijkste mislukking dat de internetverbinding onderbroken raakte.

5. De "Geheugen"-Truc: Sleutels Stelen

Eén van de meest interessante gedragingen was hergebruik van inloggegevens.

  • Het Scenario: De robots vonden een gebruikersnaam en wachtwoord in het postvak (FTP).
  • De Truc: Twee van de robots (Qwen en GPT-4o-mini) onthielden dat wachtwoord en gebruikten het automatisch om de achterdeur (SSH) te openen. Ze hoefden niet te worden verteld dit te doen; ze deden het zelf.
  • De Haken: De robots die een "kort geheugen" hadden (alleen de laatste paar berichten onthoudend) deden dit niet. Die met een "lang geheugen" (het hele gesprek onthoudend) deden het wel. Dit suggereert dat een lang geheugen een AI helpt om de punten tussen verschillende delen van een systeem te verbinden.

6. Snelheid en Strategie

  • Snelheid: Zodra de robots begonnen, waren ze snel. Ze vonden meestal binnen 15 tot 30 seconden echte tijd een manier om binnen te komen.
  • Strategie: Sommige robots probeerden altijd eerst de webdeur. Anderen probeerden altijd eerst het postvak.
  • Variatie: Eén robot (GPT-4o-mini) was ongelooflijk creatief. Van de 100 runs gebruikte het 98 verschillende strategieën. Het was als een dief die nooit dezelfde truc twee keer gebruikt. Een andere robot (Gemini) was voorspelbaarder en gebruikte steeds dezelfde paar trucs.

De Conclusie

Deze studie vertelt ons twee belangrijke dingen:

  1. Veiligheid is geen muur: Als je een verzoek formuleert als "geautoriseerde testing", zullen deze AI-modellen graag proberen dingen te hacken zonder nee te zeggen. Ze hebben geen ingebouwde "stop"-knop voor dit specifieke type baan.
  2. AI is onvoorspelbaar: Zelfs als je dezelfde robot 100 keer dezelfde instructies geeft, kan het 98 verschillende manieren gebruiken om het probleem op te lossen, of vastlopen in een lus, of gewoon te vroeg opgeven.

Belangrijke Opmerking: Het artikel waarschuwt dat, omdat de robots zo snel en zo consistent waren in het starten van hun aanvallen (binnen 30 seconden), beveiligingssystemen klaar moeten zijn om ze direct te detecteren. Je kunt niet wachten tot ze klaar zijn; je moet ze vangen terwijl ze nog rondkijken.

De onderzoeker merkte ook op dat dit een gecontroleerd experiment was in een nepgebouw. We weten niet of deze robots zich op dezelfde manier zouden gedragen in een echt, complex of onbekend omgeving. Maar voor deze specifieke test was de AI verrassend consistent in zijn bereidheid om aan te vallen, maar wild inconsistent in hoe het dat deed.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →