Composer 2 Technical Report
Composer 2 is een gespecialiseerd model voor agentische software-engineering dat door middel van voortgezette pretraining en grootschalige versterkende leer een aanzienlijke verbetering in prestaties bereikt op complexe coderingstaken, zoals aangetoond door de hoge scores op benchmarks zoals CursorBench, Terminal-Bench en SWE-bench Multilingual.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
🚀 De Kern: Een Software-ontwikkelaar die "echt" denkt
Stel je voor dat je een zeer slimme, maar soms wat ongeduldige stagiair hebt die software schrijft. De vorige versies (Composer 1 en 1.5) waren goed in het beantwoorden van vragen en het maken van kleine aanpassingen. Maar Composer 2 is als diezelfde stagiair, maar dan na een intensieve, jarenlange stage bij de beste ingenieurs van de wereld. Hij kan nu niet alleen kleine foutjes vinden, maar ook grote, complexe projecten van A tot Z oplossen, vaak zonder dat jij hem elke stap hoeft te vertellen.
Het rapport vertelt het verhaal van hoe ze deze "super-stagiair" hebben opgeleid.
1. Twee Stappen in de Opleiding: De Basis en de Praktijk
De makers van Composer 2 hebben een slimme tweestapsmethode gebruikt om de AI te trainen.
Stap 1: De Theorie (Continued Pretraining)
Stel je voor dat je een student eerst een hele bibliotheek laat lezen voordat je hem naar het ziekenhuis stuurt. In deze fase hebben ze het model (dat al slim was) laten "lezen" van enorme hoeveelheden code. Het doel was niet om hem te leren praten, maar om zijn kennis over software te verdiepen. Het is alsof je een medicijnstudent laat studeren aan de hand van duizenden medische dossiers voordat je hem laat opereren.- Het resultaat: Het model weet nu veel meer over hoe software werkt, zelfs in grote, ingewikkelde systemen.
Stap 2: De Praktijk (Reinforcement Learning)
Nu de student de theorie kent, moet hij aan de slag. Dit is de "reinforcement learning" fase. Hier krijgt de AI een taak (bijvoorbeeld: "Maak deze knop werken") en mag hij proberen, falen, proberen, en weer falen.- De Beloning: Als hij het goed doet, krijgt hij een "sterretje" (een beloning). Als hij de verkeerde bestanden aanraakt of de code rommelig maakt, krijgt hij een "strafje".
- De Leercurve: Na duizenden pogingen leert de AI niet alleen wat hij moet doen, maar ook hoe hij het slim aanpakt. Hij leert plannen te maken, tests te schrijven en zelfs te denken over de lange termijn, net als een ervaren menselijke ontwikkelaar.
2. De Oefenplaats: CursorBench (Geen "Vraag en Antwoord" meer)
Een groot probleem met eerdere tests voor AI was dat ze te makkelijk waren. Het was alsof je een student testte met meerkeuzevragen waar het antwoord al in de tekst stond. In het echte leven werken ontwikkelaars echter met vaag beschreven problemen en rommelige bestanden.
Om dit op te lossen, hebben ze CursorBench bedacht.
- De Vergelijking: Stel je voor dat je een auto wilt testen. De oude tests waren alsof je de auto op een rechte, lege weg liet rijden. CursorBench is alsof je de auto laat rijden door een drukke stad, met regen, gaten in de weg en onverwachte voetgangers.
- Het Effect: De taken in CursorBench zijn vaag ("Deze knop werkt niet meer, zoek het op") en vereisen dat de AI zelf de oorzaak moet vinden in duizenden regels code. Composer 2 excelleert hierin, terwijl andere modellen vaak vastlopen.
3. De "Zelfsamenvatting": Een Slimme Notitieblok
Een van de grootste uitdagingen voor AI is het onthouden van wat er eerder gebeurd is in een lang gesprek. Als een taak duurt als een heel hoofdstuk in een boek, vergeet de AI vaak het begin.
Composer 2 gebruikt een trucje genaamd Self-Summarization.
- De Analogie: Stel je voor dat je een lange vergadering hebt. Na elke 10 minuten schrijft de AI een kort verslag van wat er besproken is en gooit de rest weg, maar houdt de kernpunten vast.
- Het Voordeel: Hierdoor kan de AI werken aan projecten die uren duren, zonder "vergeten" te worden. Het is alsof hij een onuitputtelijk geheugen heeft, omdat hij constant zijn eigen notities maakt en opschuift.
4. De Infrastructuur: Een Orkest van Robots
Het trainen van zo'n groot model is als het dirigeren van een orkest van duizenden muzikanten die allemaal tegelijk spelen.
- Synchronisatie: Als de muzikanten niet precies op hetzelfde tempo spelen, klinkt het als lawaai. De makers hebben een systeem gebouwd waarbij de "trainers" (die de AI leren) en de "inference" (die de AI laten werken) perfect op elkaar zijn afgestemd.
- Snelheid: Ze gebruiken speciale technieken om de AI sneller te laten denken zonder dat hij minder slim wordt. Het is alsof je een Formule 1-auto bouwt die niet alleen snel is, maar ook zuinig brandstof verbruikt.
5. De Resultaten: Slimmer, Sneller en Goedkoper
Wat levert dit allemaal op?
- Beter dan de rest: Composer 2 scoort extreem hoog op de nieuwe, moeilijke tests (CursorBench) en doet het net zo goed als de duurste, bekendste AI-modellen ter wereld.
- Efficiëntie: Het meest indrukwekkende is dat Composer 2 dit bereikt met minder rekenkracht.
- De Vergelijking: Stel je voor dat je twee auto's hebt. De ene is een dure, brandstofverslindende limo (andere AI-modellen). De andere is een slimme, elektrische hatchback (Composer 2). Ze rijden even snel, maar de hatchback kost een fractie van de prijs om te rijden.
Conclusie: De Toekomst van Software
Kortom, Composer 2 laat zien dat je AI niet alleen kunt "voeden" met data, maar dat je hem ook kunt "opleiden" door hem echte problemen te laten oplossen in een veilige omgeving. Het is een stap dichterbij een AI die niet alleen code schrijft, maar ook denkt als een menselijke ingenieur: plannend, analyserend en oplossend, zelfs als de opdracht vaag is.
Het is alsof we de stagiair hebben omgetoverd tot een senior engineer die 24/7 voor je werkt, zonder koffie te hoeven drinken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.