SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution
Het artikel introduceert SWE Atlas, een nieuwe benchmarksuite die is ontworpen om coderingsagenten te evalueren op ondervertegenwoordigde professionele workflows zoals codebase Q&A, het schrijven van tests en refactoring door zowel functionele correctheid als software-engineeringkwaliteit te beoordelen, waarbij blijkt dat hoewel topmodellen de toon aangeven, er aanzienlijke uitdagingen blijven bestaan bij het hanteren van edge cases en het naleven van best practices.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Van "Reparateurs" tot "Meester-Architecten"
Stel je voor dat je een team van ongelooflijk slimme, supersnelle bouwrobots hebt ingehuurd (dit zijn de AI-coderingsagenten) om te helpen bij het bouwen en onderhouden van een enorme stad (een softwarecodebase).
De afgelopen jaren hebben we deze robots getest door ze simpele, specifieke klusjes te geven: "Repareer dit kapotte raam" of "Installeer deze nieuwe deur". Als de robot het raam repareert zonder het kozijn te beschadigen, krijgt het een gouden ster. Dit is wat eerdere tests (zoals SWE-Bench) deden. Ze maten of de robot dingen kon repareren.
SWE Atlas zegt: "Wacht even. Een goede bouwvakker zijn gaat niet alleen over het repareren van kapotte ramen. Het gaat ook over het begrijpen van de hele stad, het schrijven van veiligheids handleidingen en het herontwerpen van oude gebouwen zodat ze niet over tien jaar instorten."
De onderzoekers bouwden een nieuwe, moeilijkere test genaamd SWE Atlas om te zien of deze robots kunnen fungeren als professionele ingenieurs, en niet alleen als reparateurs.
De Drie Nieuwe Uitdagingen (De "Atlas"-taken)
In plaats van alleen bugs te repareren, geeft SWE Atlas de robots drie soorten professionele banen:
1. Codebase Q&A: De "Stadsgids"
- De Oude Manier: "Hier is een kaart. Vertel me waar de bibliotheek is." (De robot leest alleen de kaart).
- De SWE Atlas Manier: "Ik ben nieuw hier. Ik moet weten hoe de verkeerslichten zich gedragen als het regent en het elektriciteitsnet uitvalt. Ik wil niet alleen een kaart; ik wil dat je de auto bestuurt, de verkeerslichten in real-time observeert en me precies vertelt wat er gebeurt als er iets misgaat."
- De Haken en Ogen: De robot moet de software daadwerkelijk uitvoeren, kijken hoe het worstelt onder stress, en het live gedrag uitleggen. Het kan niet alleen gokken op basis van het lezen van de code.
2. Testschrijven: De "Veiligheidsinspecteur"
- De Oude Manier: "Schrijf een test om ervoor te zorgen dat de deur opent." (De robot schrijft een test die controleert of de deur opent).
- De SWE Atlas Manier: "Schrijf een test die probeert de deur te breken. Wat als iemand probeert hem open te maken terwijl hij op slot zit? Wat als de scharnieren roestig zijn? Wat als de wind te hard waait?"
- De Haken en Ogen: De robot moet een adversaris zijn. Het moet aan elke rare, randgeval-scenario denken dat een crash kan veroorzaken. Als de robot een test schrijft die alleen het "happy path" controleert (alles werkt perfect), faalt hij de test.
3. Refactoring: De "Renovatie-expert"
- De Oude Manier: "Schilder de muur blauw." (De robot verandert de kleur).
- De SWE Atlas Manier: "Deze kamer is een puinhoop. De bedrading is verward, de loodgieterswerk zit op de verkeerde plek en het meubilair blokkeert de deur. Herord de hele kamer zodat het makkelijker is om te leven, maar verplaats geen enkel stuk meubilair en verander niet hoe de kamer functioneert. Gooi ook alle oude, kapotte gereedschappen weg die we niet meer nodig hebben."
- De Haken en Ogen: De robot moet de code opruimen (onderhoudsvriendelijk maken) zonder per ongeluk iets te breken dat momenteel werkt. Het is alsof je hartchirurgie uitvoert terwijl de patiënt een marathon loopt.
Hoe Ze De Robots Beoordeelden (De "Rubriek")
In het verleden waren tests als een meerkeuzetoets: Werkte de code? Ja/Nee.
SWE Atlas gebruikt een Leraarsrubriek. Stel je een strenge kunstleraar voor die het schilderij van een student beoordeelt.
- Heb je de lucht geschilderd? (Ja/Nee)
- Heb je de juiste penseelstreken gebruikt? (Ja/Nee)
- Heb je de penseel op de vloer laten liggen? (Ja/Nee - dit is een "Negatieve Rubriek" omdat het slechte praktijk is).
De onderzoekers gebruikten een tweede AI (een "Rechter") om het werk van de robot te bekijken en deze gedetailleerde vakjes te controleren. Ze gaven om:
- Netheid: Heeft de robot "dode code" (afval) achtergelaten?
- Organisatie: Is de nieuwe code makkelijk voor een mens om later te lezen?
- Volledigheid: Heeft de robot enige randgeval-scenario's gemist?
Wat Ze Vonden (De Resultaten)
De onderzoekers testten de slimste beschikbare AI-modellen (zoals GPT-5.4 en Opus 4.7) en enkele open-source modellen. Hier is het oordeel:
De "Reparateurs" zijn Geweldig, maar de "Ingenieurs" Worstelen:
De top AI-modellen zijn uitstekend in het repareren van simpele bugs (het "reparatie"-werk). Maar wanneer ze worden gevraagd het rommelige, complexe werk van professionele engineering te doen (zoals diepe refactoring of het schrijven van robuuste tests), dalen hun scores aanzienlijk.Het "Consistentie"-Probleem:
Als je een top-robot vraagt een probleem 3 keer op te lossen, kan het zijn dat hij het één keer goed doet en de andere twee keer faalt. Ze zijn nog niet betrouwbaar genoeg om met kritieke infrastructuur vertrouwd te worden.De "Verkenning"-Kloof:
De beste robots slaagden omdat ze niet alleen de code lazen; ze voerden de code uit. Ze richtten de software op, braken het, repareerden het en keken naar de logs. Robots die alleen de code "lezen" zonder het uit te voeren, faalden de "Codebase Q&A"-taken.De "Happy Path"-Valstrik:
Bij het schrijven van tests neigden robots naar tests die alleen controleerden of dingen normaal werkten. Ze faalden in het schrijven van tests die rampen controleerden (de "adversariele" mindset).Open versus Gesloten Modellen:
De krachtigste, duurste, "gesloten" modellen (van grote techbedrijven) presteerden veel beter dan de gratis, "open" modellen. De open modellen waren vaak te verward om de complexe, multi-stap taken aan te kunnen.
De Conclusie
SWE Atlas is een wake-up call. Het vertelt ons dat hoewel AI steeds beter wordt in het schrijven van kleine stukjes code of het repareren van simpele fouten, het nog niet klaar is om een Professionele Software-ingenieur te zijn.
Het worstelt nog steeds met:
- Vooruitdenken over wat er zou kunnen misgaan.
- Rommelige code opruimen zonder het te breken.
- Begrijpen hoe een systeem zich in de echte wereld gedraagt (niet alleen op papier).
Het papier concludeert dat we moeten stoppen met alleen te vragen "Werkt het?" en moeten beginnen met vragen "Is het goede engineering?", omdat de toekomst van AI-codering afhankelijk is van het laatste.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.