← Nieuwste papers
💻 computer science

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

Dit artikel introduceert SaaSBench, de eerste benchmark die is ontworpen om autonome coderingsagenten te evalueren in complexe, multi-component enterprise SaaS-omgevingen, en onthult dat de belangrijkste knelpunt voor state-of-the-art modellen niet ligt in het genereren van code-logica, maar in het succesvol configureren en integreren van heterogene systeemcomponenten.

Oorspronkelijke auteurs: Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong Wang, Zehui Chen, Xiangxiang Chu, Feng Zhao

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong Wang, Zehui Chen, Xiangxiang Chu, Feng Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Van "Een Zin Schrijven" tot "Een Wolkenkrabber Bouwen"

Stel je voor dat je een robotassistent hebt die zeer goed is in het schrijven van code. Op dit moment lijken de meeste tests voor deze robots op het vragen om een enkele zin te schrijven of een typefout te corrigeren in een alinea. Ze slagen deze tests gemakkelijk.

Maar in de echte wereld gaat het bij het bouwen van software niet om het schrijven van één zin; het gaat om het bouwen van een wolkenkrabber. Je moet de fundering storten, de muren opbouwen, de loodgieterswerk installeren, de elektriciteit bedraden en ervoor zorgen dat de lift werkt voordat iemand er kan wonen.

SaaSBench is een nieuwe, uiterst moeilijke test die is ontworpen om te zien of deze AI-robots in staat zijn om een hele "wolkenkrabber" (een complex zakelijk softwaresysteem) vanaf nul te bouwen, uitsluitend op basis van een geschreven beschrijving, zonder dat een mens hen bij de hand houdt.

Het Probleem: Het "Speelgoed" versus "Het Echte Ding"

De auteurs stellen dat eerdere tests waren als het vragen aan een robot om een LEGO-kasteel te bouwen. Het is leuk, maar het vereist geen echte engineeringvaardigheden. Echte zakelijke software (SaaS) is rommelig. Het omvat:

  • Veel talen: Alsof een bouwteam verschillende talen spreekt (Python, Go, JavaScript, enz.).
  • Veel tools: Het gebruik van verschillende databases en frameworks die met elkaar moeten communiceren.
  • Complexe regels: Als je een gebruiker verwijdert, wat gebeurt er dan met hun data? Als de server crasht, herstelt het systeem zich dan?

Bestaande tests controleerden niet of de robot deze rommel kon hanteren. Ze controleerden alleen of de robot een paar regels code kon schrijven die geïsoleerd werkten.

De Oplossing: SaaSBench (Het "Vastgoed" Examen)

De onderzoekers hebben SaaSBench gebouwd, wat lijkt op een eindexamen voor een meester-architect.

  1. De Blauwdruk (Het PRD): In plaats van een simpele prompt zoals "maak een takenlijst", krijgt de AI een enorm document van meer dan 4.000 regels (Product Requirements Document). Dit is de gedetailleerde blauwdruk voor een echt zakelijk product, zoals een videoconferentie-app, een facturatiesysteem of een projectmanagementtool.
  2. De Bouwplaats: De AI wordt gedropt op een digitale bouwplaats (een Docker-container). Het moet:
    • Alle tools installeren.
    • De database opzetten.
    • De code schrijven.
    • De front-end (wat gebruikers zien) verbinden met de back-end (de logica).
    • Het systeem deployen zodat het daadwerkelijk draait op internet.
  3. De Inspecteur (De DAG-evaluatie): Dit is het slimste deel. In plaats van alleen te controleren "Werkt het?", gebruikt de test een Afhankelijkheidskaart (een Directed Acyclic Graph).
    • Stel je een checklist voor waarbij Stap B niet kan worden gecontroleerd totdat Stap A perfect is.
    • Als de AI faalt bij het opzetten van de database (Stap A), slaat de test automatisch het controleren van het inlogscherm (Stap B) over en markeert het als "Overgeslagen" in plaats van "Gefaald". Dit voorkomt dat de AI tweemaal wordt gestraft voor dezelfde basisfout.
    • Het controleert 5.370 verschillende "validatienodes", van "Draait de server?" tot "Berekent de facturatielogica belastingen correct?".

De Resultaten: De "Overmoedige Bouwer"

De onderzoekers testten de slimste beschikbare AI-agenten (zoals Claude, GPT en anderen) op dit examen. De resultaten waren verrassend en nederig:

  • De Score is Laag: Zelfs de beste AI slaagde slechts voor ongeveer 20% van de taken.
  • De Bottleneck is niet het "Brein": De AI faalde niet omdat het complexe zakelijke logica niet kon schrijven (zoals het berekenen van rentetarieven).
  • De Bottleneck is de "Handen": Meer dan 95% van de fouten gebeurde voordat de AI zelfs maar bij de zakelijke logica kwam.
    • De AI bleef hangen bij het proberen de juiste softwarepakketten te installeren.
    • Het faalde bij het configureren van de databaseverbinding.
    • Het probeerde de server te starten en crashte direct.
    • Het werd "overmoedig", dacht dat het klaar was, en stopte met werken, waardoor het gebouw halfaf bleef staan.

De Analogie: Het is als een briljante architect die een perfect gebouw op papier kan ontwerpen, maar vastloopt bij het proberen van het beton te mengen. Ze komen nooit bij het deel waar ze de kamers daadwerkelijk bouwen.

De Conclusie

SaaSBench laat zien dat hoewel AI beter wordt in het schrijven van codefragmenten, het nog steeds verschrikkelijk is in het engineeren van systemen. Het mist de discipline om de omgeving op te zetten, afhankelijkheden te beheren en ervoor te zorgen dat het hele systeem stabiel draait.

Het paper concludeert dat AI om ons echt te helpen bij het bouwen van software, we moeten stoppen met hen te testen op "LEGO-kastelen" en moeten beginnen met hen te testen op "wolkenkrabbers". Totdat ze betrouwbaar de fundering en de loodgieterswerk kunnen opzetten, zijn ze niet klaar om het echte ding te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →