← Nieuwste papers
🤖 AI

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes is een adversariaal self-play versterkingsleerframework dat de robuustheid van redenering bij LLM's verbetert door een enkel model te trainen om gelijktijdig afleidende contexten te genereren en problemen binnen die contexten op te lossen, waardoor contextuele interferentie wordt omgezet in een co-evolutionair curriculum dat de prestaties op diverse benchmarks verbetert en kwetsbaarheden in andere modellen blootlegt.

Oorspronkelijke auteurs: Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar iets naïeve student traint om complexe wiskundepuzzels op te lossen. Normaal gesproken geef je hen schone, perfecte problemen zonder afleiding. Ze worden goed in het oplossen van die specifieke puzzels, maar als je een beetje verwarrende informatie in de vraag schuift, kunnen ze op een dwaalspoor raken en falen.

Het artikel introduceert een nieuwe trainingsmethode genaamd Seirênes (vernoemd naar de Sirenen uit de Griekse mythologie, wiens prachtige zang zeelieden van koers bracht). In plaats van de student alleen maar moeilijkere problemen te geven, verandert Seirênes de student in twee verschillende personen die een spel tegen elkaar spelen binnen hetzelfde brein.

Hier is hoe het spel werkt, met behulp van eenvoudige analogieën:

De Twee Rollen

Het AI-model speelt twee rollen tegelijkertijd:

  1. De Trickster (De Adversary): Deze rol probeert een wiskundeprobleem te schrijven dat normaal lijkt, maar een "val" bevat. De val is geen willekeurige onzin; het is een slimme, geloofwaardig klinkende hint die de solver op het verkeerde spoor zet. Denk aan het als een goochelaar die je een aanwijzing geeft die bijna logisch klinkt, maar je eigenlijk afleidt van de echte oplossing.
  2. De Solver (De Redener): Deze rol probeert het wiskundeprobleem op te lossen, zelfs als de Trickster een verwarrende hint heeft toegevoegd. De Solver moet de "ruis" negeren en de ware logica eronder vinden.

De Trainingslus: Een Zelfverbeterende Cyclus

Bij traditionele training geef je de student misschien gewoon meer oefenopgaven. Bij Seirênes is de training een voortdurende wapenwedloop:

  • Stap 1: De Trickster kijkt naar een probleem en probeert een misleidende hint te bedenken die de Solver zou verwarren.
  • Stap 2: De Solver probeert het probleem op te lossen met die misleidende hint.
  • Stap 3: Als de Solver op een dwaalspoor raakt, krijgt de Trickster een "beloning" (punten) voor zijn slimheid. Als de Solver de val negeert en het probleem correct oplost, krijgt de Solver de beloning.
  • Stap 4: Het model leert hiervan. De Solver wordt beter in het opsporen van vallen, en de Trickster wordt beter in het bedenken van nieuwe, moeilijkere vallen.

Omdat het hetzelfde model is dat beide kanten speelt, evolueren ze samen na elkaar. Naarmate de Solver slimmer wordt, moet de Trickster slimmer worden om bij te blijven, wat de Solver dwingt om nog robuuster te worden.

Waarom Dit Belangrijk Is

Het artikel vond dat standaard AI-modellen vaak "bros" zijn. Ze kunnen een wiskundeprobleem perfect oplossen in een schone omgeving, maar als je een zin toevoegt die irrelevant of licht misleidend is, daalt hun prestatie aanzienlijk. Ze neigen naar oppervlakkige patronen in plaats van diepe logica te volgen.

Seirênes lost dit op door het model te dwingen om afleiding te negeren. Het is als het trainen van een vechtkunstenaar niet alleen door te vechten tegen een perfecte tegenstander, maar door te vechten tegen een tegenstander die probeert hen te struikelen, af te leiden of te verwarren met nepbewegingen.

De Resultaten

De onderzoekers testten dit op verschillende moeilijke wiskundebenchmarks (zoals hoogwaardige wiskundewedstrijden). Ze ontdekten:

  • Sterker Redeneren: Modellen getraind met Seirênes werden aanzienlijk beter in het zelfstandig oplossen van wiskundeproblemen, zelfs zonder trucs. Ze verbeterden met ongeveer 7 tot 10 procentpunten ten opzichte van standaard trainingsmethoden.
  • Beter Verdedigen: De modellen werden veel moeilijker te misleiden. Wanneer getest met verwarrende informatie, crashten ze niet zo snel als andere modellen.
  • Universele Zwakte: Interessant genoeg was de "Trickster" getraind door het kleine model met 4 miljard parameters in staat om zelfs 's werelds krachtigste, gesloten-bron AI-modellen (zoals GPT en Gemini) te verwarren, waardoor hun nauwkeurigheid met ongeveer 4–5 punten daalde. Dit bewijst dat de methode echte "blinde vlekken" vond in hoe deze modellen denken.

De Conclusie

Seirênes is een manier om AI slimmer te maken door het te leren omgaan met een rommelige, afleidende wereld. In plaats van alleen maar antwoorden te memoriseren op schone vragen, leert de AI diep te graven naar de waarheid, zelfs als iemand probeert het te misleiden. Het verandert een zwakte (gemakkelijk afgeleid worden) in een trainingsinstrument om een sterkere, betrouwbaardere redenaar op te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →