← Nieuwste papers
🤖 AI

COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation

COMPAS is een op moeilijkheidsgraad gebaseerd framework dat codegeneratie optimaliseert door gezamenlijk te zoeken naar het beste model, de beste prompt en de beste decodingsinstellingen voor specifieke groepen met een bepaalde moeilijkheidsgraad, waarmee significante verbeteringen worden behaald in zowel pass rates als kostenefficiëntie op benchmarks zoals LiveCodeBench en SWE-bench.

Oorspronkelijke auteurs: Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

Gepubliceerd 2026-08-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jingzhi Gong, Jie M. Zhang, Gunel Jahangirova, Dong Huang, Mohammad Reza Mousavi, Mark Harman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je het perfecte gebakje probeert te bakken, maar dat je een magische oven hebt die tegen je kan praten. In de wereld van de informatica is deze "oven" een Large Language Model (LLM), een superintelligent AI die computercode kan schrijven net als een menselijke programmeur. Om het beste gebakje te krijgen, moet je drie dingen kiezen: welke oven je gebruikt (het model), welk recept je geeft (de prompt) en hoe je de temperatuur en de timer instelt (decoding settings). Een lange tijd probeerden wetenschappers het één perfecte recept en de oveninstelling te vinden die voor elk enkel gebakje zou werken, van een simpel cupcake tot een complexe bruidstaart. Maar ze liepen steeds tegen een probleem aan: een instelling die een cupcake luchtig maakt, kan een bruidstaart doen aanbranden, en een instelling die geld bespaart op bloem kan de smaak verpesten. De grote vraag was: hoe vinden we de perfecte combinatie voor elke specifieke taak zonder een fortuin uit te geven of jarenlang elke mogelijkheid te proberen?

Maak kennis met COMPAS, een nieuwe methode die werkt als een briljante, budgetbewuste chef-kok. In plaats van één regel voor iedereen te raden, beseft COMPAS dat verschillende taken verschillende "moeilijkheidsgraden" hebben. Het stelt voor dat we onze taken groeperen — zoals problemen sorteren in "Gemakkelijk", "Gemiddeld" en "Moeilijk" — en vervolgens een uniek, perfect recept voor elke groep vinden. De onderzoekers ontdekten dat prompts (instructies) en decoding settings (de knoppen van de oven) het beste samen werken wanneer ze worden aangepast, niet afzonderlijk, en dat wat werkt voor het ene AI-model, kan falen voor een ander. Door een slim tweestaps-proces te gebruiken — eerst de juiste oven voor de klus kiezen, en dan het recept en de knoppen samen fijn afstemmen — bouwden ze een "menu" van opties voor elk moeilijkheidsniveau. Wanneer er een nieuwe taak binnenkomt, controleert COMPAS direct de moeilijkheid, kiest het perfecte vooraf gemaakte menu voor die groep en gaat aan de slag.

In hun experimenten was deze aanpak een groot succes. Op een testset van programmeerproblemen genaamd LiveCodeBench slaagde COMPAS erin om 52,8% van de tijd het juiste antwoord te geven, waarmee het de vorige beste methode versloeg die slechts 45,9% bereikte. Nog beter: het deed dit terwijl het aanzienlijk minder geld uitgaf: de kosten daalden van $36,57 naar slechts $4,92. Ze testten het ook op een complexere uitdaging waarbij het oplossen van bugs in volledige softwareprojecten centraal stond (SWE-bench), waar het 76,0% van de taken oploste, waarmee het wederom de best bestaande methoden overtrof.

Het geheime ingrediënt van COMPAS is de "difficulty-aware" strategie. De onderzoekers ontdekten drie belangrijke zaken door hun experimenten. Ten eerste interageren de instructies en de oveninstellingen; het tegelijkertijd aanpassen van beide levert betere resultaten op dan het een voor een doen. Ten tweede kan een aanpassing die één AI-model helpt, een ander juist schaden, dus moet je je model zorgvuldig kiezen voordat je begint met aanpassen. Ten derde, en het belangrijkste, is de "beste" instelling voor een makkelijk probleem totaal anders dan de "beste" voor een moeilijk probleem. Een globale, een-maat-voor-iedereen aanpak werkt simpelweg niet.

Om dit op te lossen, gebruikt COMPAS een tweefasig plan. In de offline fase (de voorbereidingsfase) splitst het alle trainings-taken in groepen op basis van hoe moeilijk ze zijn. Vervolgens voert het een snelle, goedkope test uit om de beste AI te kiezen voor elke groep. Zodra het model is gekozen, gaat het over naar een "joint search" modus, waarbij het een slimme feedbackloop gebruikt om tegelijkertijd de prompt en de decoding settings aan te passen. Het probeert niet zomaar willekeurige combinaties; het leert van zijn fouten en successen, en bouwt zo een "quality-cost front" — in feilen een lijst van de best mogende afwegingen tussen het behalen van een goed resultaat en het besparen van geld — voor elke moeilijkheidsgroep.

In de online fase (het realtime bakken), wanneer er een nieuwe taak binnenkomt, verspilt COMPAS geen tijd aan zoeken. Het kijkt simpelweg naar het moeilijkheidslabel van de taak, vindt de bijbehorende groep en kiest de beste configuratie uit die groep's vooraf gebouwde menu. Het is also kind van een bibliotheek met perfect afgestelde recepten die klaarstaat om te gebruiken, zodat je nooit vanaf nul hoeft te beginnen.

Het paper laat zien dat deze methode robuust is. Zelfs toen ze de random seeds veranderden (zoals het anders schudden van een kaartspel) of het testten op verschillende soorten AI-modellen, presteerde COMPAS consequent beter dan andere methoden. Het bewees ook dat het opdelen van taken op basis van moeilijkheid cruciaal is; als je de moeilijkheidsgraden negeert en probeert één instelling voor alles te gebruiken, dalen je resultaten aanzienlijk. Hoewel de methode momenteel het beste werkt wanneer de AI-modellen uit dezelfde "familie" komen, suggereren de onderzoekers dat deze aanpak in de toekomst uitgebreid kan worden. Voor nu is COMPAS een krachtig bewijs dat slim zijn over hoe je zoekt naar de juiste instellingen even belangrijk is als de instellingen zelf.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →