← Nieuwste papers
💻 computer science

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

BenchEvolver is een oplossingsgericht evolutionair framework dat bestaande programmeerproblemen automatisch transformeert naar moeilijkere, verifieerbare varianten door referentie-oplossingen te evolueren, waardoor hoogwaardige benchmarks zoals LiveCodeBench-Plus worden gecreëerd die de discriminatie van modellen herstellen en effectieve trainingssignalen bieden voor zelfverbetering.

Oorspronkelijke auteurs: Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

Gepubliceerd 2026-06-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een videogame voor waarin de spelers (AI-modellen) zo goed zijn geworden dat ze elk level met 100% nauwkeurigheid voltooien. De game-ontwerpers (menselijke onderzoekers) zitten vast omdat ze niet snel genoeg nieuwe levels kunnen maken om deze super-spelers uit te dagen. De oude levels zijn te makkelijk en het spel heeft zijn spanning verloren.

Dit paper introduceert BenchEvolver, een nieuwe tool die fungeert als een "Level-Up Engine" voor deze AI-games. In plaats van dat mensen proberen nieuwe, moeilijke problemen vanaf nul te verzinnen, neemt BenchEvolver een bestaand, makkelijk probleem en muteert dit automatisch naar iets dat veel moeilijker is, terwijl het er tegelijkertijd voor zorgt dat het nieuwe level nog steeds eerlijk en oplosbaar is.

Hier is hoe het werkt, onderverdeeld in eenvoudige concepten:

1. Het Probleem: De "Easy Mode" Valstrik

Op dit moment zijn AI-modellen zo geavanceerd dat ze bijna alle programmeerpuzzels kunnen oplossen. Het is als een student die elke vraag in het tekstboek uit zijn hoofd heeft geleerd. Wanneer ze een toets maken, halen ze overal een 10e cijfer. Dit is om twee redenen slecht:

  • We kunnen niet zien welke AI echt slimmer is, omdat ze allemaal perfecte scores halen.
  • De AI stopt met leren omdat het nooit een uitdaging tegenkomt die het niet kan oplossen.

2. De Oplossing: Eerst het "Antwoordmodel" Evolueren

De meeste eerdere pogingen om nieuwe problemen te maken werkten als volgt: "Laten we een nieuw verhaal schrijven over een wiskundeprobleem, en dan maar hopen dat een AI het kan oplossen." Dit leidt vaak tot kapotte puzzels of problemen die te vaag zijn.

BenchEvolver draait het om. In plaats van te beginnen met het verhaal (het probleem), begint het met het antwoordmodel (de oplossing-code).

  • De Metafoor: Stel je een meesterkok (de AI) voor die weet hoe hij een perfecte chocoladetaart moet bakken (de oplossing).
  • De Mutatie: BenchEvolver zegt tegen de kok: "Oké, bak nu een taart, maar je moet een geheim ingrediënt gebruiken dat de chemie verandert, en je mag niet dezelfde oveninstellingen gebruiken."
  • Het Resultaat: De kok schrijft een nieuw, complex recept (de geëvolueerde oplossing).
  • De Achterwaartse Stap: Zodra de kok dit nieuwe, moeilijke recept heeft, werkt BenchEvolver achterstevoren om de instructies voor de klant te schrijven (de probleemstelling) en creëert het een smaaktest (de tests) om te zien of de taart goed is geworden.

Omdat het probleem is gebouwd rondom een werkende, complexe oplossing, weten we met zekerheid dat de puzzel oplosbaar is en een duidelijk antwoord heeft.

3. De "Zelf-Uitdagende" Lus

Het coolste deel is dat BenchEvolver geen "superintelligente leraar" nodig heeft om de levels moeilijk te maken. Het gebruikt de AI zelf om de nieuwe levels te testen.

  • De AI probeert het nieuwe, gemuteerde probleem op te lossen.
  • Als de AI het goed oplost, is het level te makkelijk. BenchEvolver zegt: "Probeer het opnieuw, maak het moeilijker!"
  • Als de AI het fout heeft, maar de puzzel is nog steeds geldig, succes! We hebben een level gevonden dat de zwakte van de AI blootlegt.

Dit creëert een cyclus waarbij de AI een uitdaging genereert, probeert deze op te lossen, faalt, leert van de fout, en vervolgens een nog moeilijkere uitdaging genereert. Het is als een trainingspartner die sterker wordt elke keer dat je tegen hem vecht.

4. De Resultaten: Een Nieuwe "Hard Mode" Competitie

De onderzoekers hebben dit getest op twee grote sets programmeerpuzzels:

  1. LiveCodeBench: Competitieve programmeerpuzzels (zoals Codeforces).
  2. SciCode: Wetenschappelijke programmeerpuzzels voor onderzoek.

Wat gebeurde er?

  • Moeilijkheidsgraad Schoot Omhoog: Ze namen problemen waarbij AI-modellen voorheen 90–99% correct scoorden. Na de evolutie daalde hetzelfde model naar 27–62% correct. De "Easy Mode" werd succesvol omgezet in "Hard Mode."
  • Nieuwe Benchmark: Ze creëerden LIVECODEBENCH-PLUS, een collectie van 91 supermoeilijke problemen. Deze nieuwe testset kan eindelijk weer het verschil tussen de top AI-modellen aangeven.
  • Trainingskracht: Wanneer ze deze nieuwe, moeilijke problemen gebruikten om de AI te trainen (met een methode genaamd Reinforcement Learning), werd de AI aanzienlijk beter in het oplossen van andere moeilijke problemen die het nog nooit eerder had gezien.

Samenvatting

Beschouw BenchEvolver als een sportschool voor AI. In plaats van te wachten tot mensen nieuwe, zware gewichten bouwen, tilt de AI de bestaande gewichten op, voegt er meer schijven aan toe, en probeert vervolgens de nieuwe, zwaardere versie te tillen. Als de AI het niet kan tillen, leert hij hoe hij sterker kan worden.

Het paper bewijst dat door eerst de oplossingen te evolueren en dan achterstevoren naar de problemen te werken, we automatisch een oneindige stroom van hoogwaardige, moeilijke uitdagingen kunnen creëren die AI-modellen scherp houden en ons werkelijke voortgang meten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →