← Nieuwste papers
🤖 machine learning

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

Dit paper toont aan dat een door Claude Code aangedreven 'autoresearch'-pijplijn nieuwe, state-of-the-art witte-doos-adversariale aanvalsalgoritmen voor LLM's ontdekt die aanzienlijk beter presteren dan bestaande methoden en zelfs 100% succes bereiken bij het omzeilen van Meta-SecAlign-70B.

Oorspronkelijke auteurs: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

Gepubliceerd 2026-03-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🤖 De Digitale Ontdekker: Hoe een AI een AI verslaat

Stel je voor dat je een enorme, ondoordringbare burcht hebt: een kunstmatige intelligentie (zoals een chatbot) die zo is getraind om nooit iets gevaarlijks of onbeleefds te zeggen. Dit is de "veiligheidsmuur" van de AI.

Normaal gesproken proberen hackers (of beveiligingsexperts) om deze muur te doorbreken door gaten te zoeken. Ze gooien duizenden verschillende zinnen tegen de muur om te zien of hij breekt. Maar dit is vaak een moeizame, handmatige klus.

Wat hebben de auteurs van dit paper gedaan?
Ze hebben een andere AI (genaamd Claude) de opdracht gegeven om niet zelf te hacken, maar om de hackers te ontwerpen. Het is alsof ze een superintelligente architect hebben ingehuurd om de beste manieren te bedenken om een slot te openen, in plaats van zelf met een breekijzer te proberen.

🛠️ De "Autoresearch" Machine: De Leerling die de Meester verslaat

De onderzoekers hebben een systeem gebouwd dat ze "Claudini" noemen. Dit werkt als volgt:

  1. De Start: Claude krijgt een verzameling van bekende manieren om AI's te hacken (zoals de bekende "GCG"-methode). Dit zijn de "oude gereedschappen".
  2. De Opdracht: Claude moet een nieuwe, betere manier bedenken om een AI te dwingen om een specifiek woord te zeggen (bijvoorbeeld "Hacked"), zelfs als de AI dat niet mag.
  3. De Cyclus:
    • Claude kijkt naar de oude methoden.
    • Hij bedenkt een nieuwe formule (een algoritme).
    • Hij test deze formule op een computer.
    • Als het werkt, wordt het beter. Als het niet werkt, past hij het aan.
    • Dit herhaalt hij duizenden keren, alsof hij een video-game speelt waarbij hij elke keer een level hoger gaat.

🏆 Wat is er gebeurd? (De Resultaten)

Het resultaat is verbazingwekkend. De door Claude ontworpen methoden waren veel beter dan alles wat menselijke experts tot nu toe hadden bedacht.

  • De "Jailbreak" (De Burcht doorbreken):
    Stel je voor dat je een AI probeert te dwingen om een gevaarlijk geheim te onthullen. De oude methoden hadden slechts een kans van 10% om te slagen. De door Claude ontdekte methoden hadden een kans van 40%. Dat is een enorme sprong.
  • De "Alleskunner" (Generalisatie):
    Het meest indrukwekkende is dat Claude niet alleen een trucje bedacht voor één AI. Hij bedacht een universele sleutel.
    • Hij oefende op een simpele AI (een "surrogaat").
    • Vervolgens gebruikte hij diezelfde sleutel op een heel andere, veel sterkere AI (Meta-SecAlign-70B).
    • Resultaat: De sleutel paste perfect! De nieuwe AI werd volledig om de tuin geleid (100% succes), terwijl de oude methoden daar slechts 56% succes hadden.

🔍 Hoe werkt het precies? (De Metafoor van de Chef-kok)

Je kunt het zien als een chef-kok die probeert het perfecte gerecht te maken.

  • Menselijke experts proberen vaak één recept te perfectioneren: "Misschien moet ik iets meer zout doen?" of "Misschien moet ik de temperatuur iets verlagen?".
  • Claude (de AI) doet iets anders. Hij neemt de ingrediënten van tien verschillende recepten, mixt ze door elkaar, en bedenkt dan: "Wat als we de zoutmeting van recept A combineren met de kooktechniek van recept B, en dan de oven op een heel andere manier gebruiken?"

In het paper zien we dat Claude vooral bestaande ideeën combineerde (zoals momentum en gradient scaling) en ze op slimme manieren aanpaste. Hij vond niet per se een nieuwe wet van de natuur, maar hij vond de perfecte manier om de oude wetten te combineren.

⚠️ Waarom is dit belangrijk? (De "Spiegel")

Dit paper is een waarschuwing en een kans tegelijk:

  1. Beveiliging is kwetsbaar: Als een AI-agent (zoals Claude) in staat is om binnen een paar dagen betere hack-methoden te vinden dan de beste menselijke experts in jaren, dan betekent dit dat onze huidige beveiliging misschien niet sterk genoeg is.
  2. De toekomst van onderzoek: Het laat zien dat we AI's kunnen gebruiken om zelf de veiligheid te testen. In plaats van dat mensen handmatig proberen gaten te vinden, kunnen we een AI-agent de taak geven om continu op zoek te gaan naar zwakke plekken. Dit heet "automatisch rood-teamen" (het spelen van de slechterik om de beveiliging te testen).

🎯 Conclusie

Kort samengevat: De onderzoekers hebben een AI-agent de leiding gegeven over het ontwerpen van hacks. Deze agent, Claudini, heeft bewezen dat hij sneller en slimmer is dan menselijke experts. Hij heeft nieuwe methoden gevonden die bestaande beveiligingsmuren van AI's effectief doorbreken.

Het is alsof je een robot hebt gebouwd die beter kan vechten dan de beste vechters ter wereld. De les is duidelijk: we moeten onze beveiliging niet meer alleen op mensen vertrouwen, maar op systemen die zichzelf continu verbeteren en testen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →