← Nieuwste papers
🤖 AI

Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations

Dit paper introduceert Evolve-CTF, een tool die semantisch equivalente CTF-uitdagingen genereert om de robuustheid van agente LLM's te evalueren, waarbij wordt geconstateerd dat hoewel modellen bestand zijn tegen eenvoudige wijzigingen, hun prestaties afnemen bij complexere transformaties die geavanceerde toolgebruik vereisen.

Oorspronkelijke auteurs: Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

Gepubliceerd 2026-04-20
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shahin Honarvar, Amber Gorzynski, James Lee-Jones, Harry Coppock, Marek Rei, Joseph Ryan, Alastair F. Donaldson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Vlaggenjacht voor Familieleden: Hoe we AI testen op zijn echte slimheid

Stel je voor dat je een groep detectives (de AI-modellen) wilt testen op hun vermogen om een geheim te kraken. In de wereld van cybersecurity noemen we dit een "Capture the Flag" (CTF) wedstrijd. De AI moet een computerprogramma bestuderen, een zwakke plek vinden en een geheim wachtwoord (de vlag) stelen.

Tot nu toe werden deze detectives getest met één vaste puzzel. Maar wat als die detective de oplossing gewoon uit zijn hoofd heeft geleerd, of gewoon op de naam van een sleutel heeft gekeken? Dan weten we niet of hij écht slim is, of dat hij alleen maar goed is in het raden van patronen.

Het Nieuwe Idee: De "Vlaggenfamilie"

De onderzoekers van dit papier hebben een slimme truc bedacht: CTF-families.

Stel je voor dat je een originele puzzel hebt. In plaats van een nieuwe, heel andere puzzel te maken, nemen ze die ene originele puzzel en veranderen ze de verpakking, maar niet de inhoud.

  • Ze hernoemen alle variabelen (zoals het veranderen van "sleutel" naar "appelsien").
  • Ze voegen onzin-code toe (zoals een extra slaapkamer in een huis die nergens naartoe leidt).
  • Ze schrijven verwarrende commentaren erbij (zoals een verkeerde routebeschrijving op de muur).
  • Ze maken de code zelfs onleesbaar voor mensen (verduistering).

Het mooie is: de oplossing blijft precies hetzelfde. Als de AI de originele puzzel kan oplossen, moet hij ook de verpakte versies kunnen oplossen, omdat de logica onderliggend identiek is.

De Tool: Evolve-CTF

Om dit te doen, hebben ze een robot genaamd Evolve-CTF gebouwd. Deze robot neemt een Python-puzzel en gooit er alle mogelijke verpakkingen overheen. Het creëert zo een "familie" van 24 varianten van dezelfde puzzel.

Wat hebben ze ontdekt? (De Resultaten)

Ze hebben 13 verschillende AI-modellen (zoals de slimste detectives van dit moment) getest op deze families. Hier zijn de belangrijkste lessen, vertaald naar alledaags taal:

  1. Naamveranderingen zijn niets voor hen:
    Als je alle namen in de code verandert (bijvoorbeeld geheime_code wordt x9z2), kunnen de AI's dit nog steeds perfect oplossen. Ze kijken niet naar de labels, maar begrijpen de logica. Ze zijn hier heel robuust in.

  2. Onzin-code is een lichte hindernis:
    Als je extra, nutteloze loops of functies toevoegt (zoals een trap die nergens naartoe leidt), merken de AI's dit nauwelijks op. Ze snappen dat het afleidingsmateriaal is.

  3. De "Kookpot" van veranderingen is dodelijk:
    Maar als je alles tegelijk doet (hernoemen + onzin-code + verduistering), dan zakken de prestaties drastisch. Het is alsof je de detective in een donkere kamer zet, met een blinddoek op, terwijl je hem ook nog eens verwarde aanwijzingen geeft. Dan raken ze de weg kwijt.

  4. De "Werkbank" (Tools) wordt intensiever gebruikt:
    Wanneer de puzzels lastig worden, stoppen de AI's niet met denken; ze gaan werken. Ze gebruiken hun gereedschappen (zoals een zoekfunctie of een script om de code te ontcijferen) veel vaker en slimmer. Ze proberen bijvoorbeeld zelf een script te schrijven om de verduisterde code weer leesbaar te maken.

  5. Meer "nadenken" helpt niet altijd:
    Sommige AI's hebben een modus om extra lang na te denken voordat ze antwoorden. De onderzoekers ontdekten dat dit voor deze specifieke puzzels weinig verschil maakt. Soms helpt het, maar vaak maakt het de AI niet slimmer, alleen maar traag.

  6. Sommige oude puzzels zijn te makkelijk:
    Ze ontdekten dat een paar van de originele puzzels zo simpel waren dat bijna elke AI ze kon oplossen, ongeacht hoe ze werden verpakt. Dit betekent dat die oude tests ons niets vertellen over wie de écht slimste AI is. De "familie-methode" helpt om deze te makkelijk tests te filteren.

Conclusie

Deze studie laat zien dat we AI's niet alleen moeten testen op of ze een antwoord kunnen geven, maar ook op hoe ze reageren als de wereld om hen heen een beetje wordt verdraaid.

Het is alsof je een kind leert fietsen. Als je het alleen op een rechte weg laat rijden, weet je niet of het kan fietsen. Maar als je het op een hobbelig pad zet, met een windstootje en een vreemde helm op, dan zie je pas echt of het kind écht kan fietsen of dat het alleen maar de weg uit zijn hoofd heeft.

Met Evolve-CTF hebben de onderzoekers een nieuwe manier gevonden om te zien of onze digitale detectives echt slim zijn, of dat ze gewoon goed zijn in het raden van patronen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →