← Nieuwste papers
💬 NLP

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

Dit artikel introduceert HeuriGym, een open-source agentic benchmark die het vermogen van Large Language Models om iteratief heuristische algoritmen te genereren en te verfijnen voor combinatorische optimalisatieproblemen evalueert, waarbij significante beperkingen in de tool-gebruik en adaptieve redenering van huidige modellen worden onthuld via een nieuwe Quality-Yield Index metriek.

Oorspronkelijke auteurs: Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

Gepubliceerd 2026-01-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team hebt van ongelooflijk slimme, goed onderlegde robots (Large Language Models, of LLM's) die uitstekend zijn in het schrijven van essays, het beantwoorden van trivia en zelfs het schrijven van basis computercode. Je wilt weten of ze ook daadwerkelijk moeilijke, echte puzzels kunnen oplossen op eigen kracht, en niet alleen antwoorden kunnen opzeggen die ze uit een tekstboek hebben geleerd.

Het paper introduceert een nieuwe "gym" genaamd HeuriGym om dit te testen. Zo werkt het, uitgelegd via eenvoudige analogieën:

1. Het Probleem: De "Quizshow" versus de "Echte Baan"

Huidige tests voor AI zijn als een meerkeuzequiz.

  • Het Probleem: Als je een AI een wiskundeprobleem vraagt dat het in de trainingsdata heeft gezien, krijgt het een A+. Maar als je het een nieuw type probleem vraagt, bevriest het vaak. Het is als een student die het antwoordmodel heeft uit het hoofd geleerd, maar de wiskunde erachter niet begrijpt.
  • De Oude Manier: Sommige tests vragen de AI om code te schrijven die aan een specifieke controle voldoet. Maar deze zijn vaak te simpel of hebben slechts één "goed" antwoord.
  • De Nieuwe Manier (HeuriGym): In plaats van een quiz is HeuriGym als het geven van een complex constructieproject zonder instructiehandleiding. Het doel is niet alleen om een test te "halen"; het doel is om een machine te bouwen die efficiënt werkt.

2. De Uitdaging: De "Combinatorische Optimalisatie"-puzzel

Het paper richt zich op een specifiek type moeilijk probleem genaamd Combinatorische Optimalisatie.

  • De Analogie: Stel je voor dat je een logistiek manager bent die probeert 1.000 vrachtwagens in te plannen. Je moet de perfecte route voor elke vrachtwagen uitstippelen zodat ze de minste brandstof verbruiken en op tijd aankomen.
  • De Addertjes onder het gras: Er zijn meer mogelijke routes dan er atomen in het universum zijn. Je kunt ze niet allemaal controleren. Je moet een "heuristiek"-genie zijn — wat betekent dat je een slimme afkorting of een "vuistregel" moet uitvinden om snel een goede oplossing te vinden, zelfs als deze wiskundig gezien niet perfect is.

3. De Opzet: De "Agentic Loop"

HeuriGym vraat de AI niet alleen om één keer code te schrijven en te beoordelen. Het stelt een feedbackloop op, zoals een videogame met "respawns".

  1. De Prompt: De AI krijgt een probleemomschrijving (bijv. "Plan deze elektronische circuits in zodat ze zo snel mogelijk draaien").
  2. De Poging: De AI schrijft een programma (een heuristiek) om het probleem op te lossen.
  3. De Realiteitscheck: Het systeem voert de code uit.
    • Is het gecrasht? (Syntaxfout)
    • Zijn de regels overtreden? (Schending van beperkingen/constraints)
    • Was het te traag? (Time-out)
  4. De Feedback: Het systeem vertelt de AI: "Je probeerde een bibliotheek te gebruiken die niet bestaat," of "Je oplossing overschrijdt de tijdlimiet."
  5. De Herpoging: De AI leest de foutmelding, leert ervan en probeert de code opnieuw te schrijven om de fout te herstellen.

Deze cyclus herhaalt zich, waardoor de AI kan "leren" hoe hij het probleem oplost door middel van vallen en opstaan, net zoals een menselijke ingenieur dat zou doen.

4. Het Scorebord: De "Quality-Yield Index" (QYI)

Hoe beoordeel je een robot die probeert een nieuwe manier te verzinnen om een puzzel op te lossen? De auteurs hebben een nieuwe score bedacht genaamd QYI.

  • Yield (Opbrengst): Heeft de robot de taak daadwerkelijk voltooid zonder te crashen? (Heeft het een werkende oplossing gekregen?)
  • Quality (Kwaliteit): Hoe goed is de oplossing in vergelijking met een menselijke expert?
  • De Score: Een score van 1.0 betekent dat de robot precies zo goed presteerde als een menselijke expert. Een score van 0 betekent dat het volledig is mislukt.

5. De Resultaten: De "Realiteitscheck"

De auteurs hebben negen van de slimste beschikbare AI-modellen getest (zoals GPT-o4-mini en Gemini-2.5-Pro).

  • Het Oordeel: Zelfs de "slimste" modellen scoorden slechts rond de 0.6.
  • Wat dit betekent: De beste AI-modellen zijn slechts ongeveer 60% zo effectief als een menselijke expert bij deze taken. Ze kunnen vaak code schrijven die draait, maar ze worstelen met het schrijven van code die efficiënt genoeg is of creatief genoeg om een menselijke oplossing te verslaan.
  • De Strijd: De modellen blijven vaak hangen in loops, hallucineren (verzinnen) niet-bestaande computerbibliotheken of slagen er niet in complexe beperkingen te begrijpen. Ze waren goed in het opvolgen van instructies, maar slecht in het "buiten de kaders denken" om een nieuwe strategie te verzinnen.

6. Waarom dit Belangrijk is

Het paper betoogt dat we moeten stoppen met AI te testen op simpele quizzen en moeten beginnen met het testen op echte technische uitdagingen.

  • Het Doel: Om de AI-ontwikkeling te duwen naar modellen die werkelijk kunnen redeneren, zich kunnen aanpassen en nieuwe oplossingen kunnen verzinnen voor wetenschap en techniek, in plaats van alleen patronen te memoriseren.
  • De Kernboodschap: We hebben een krachtig hulpmiddel gebouwd (HeuriGym) om deze vooruitgang te meten. Op dit moment is AI een veelbelovende leerling, maar het is nog geen meester-ambachtsman als het gaat om het oplossen van complexe, real-world optimalisatieproblemen.

Kortom: HeuriGym is een gym waar AI-robots proberen hun eigen gereedschap te maken om onmogelijke puzzels op te lossen. Ze worden beter, maar ze maken nog steeds veel fouten en hebben het niveau van een menselijke expert nog niet bereikt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →