← Nieuwste papers
💻 computer science

SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?

Dit artikel introduceert **SWE-Bench Mobile**, een nieuwe benchmark die aantoont dat huidige AI-agenten nog grote moeite hebben met het ontwikkelen van complexe, industriële iOS-applicaties, waarbij de best presterende configuraties slechts een succespercentage van 12% behalen.

Oorspronkelijke auteurs: Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

Gepubliceerd 2026-02-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een supermoderne, robotachtige assistent hebt die alles voor je kan bouwen. Je zegt alleen: "Maak een app die werkt als Instagram," en boem, de robot is klaar. Dat klinkt als sciencefiction, toch?

Dit wetenschappelijke artikel, genaamd SWE-Bench Mobile, is eigenlijk een soort "eindexamen" voor die digitale assistenten (we noemen ze AI-agents). De onderzoekers wilden weten: kunnen deze robots echt een professionele app bouwen zoals een menselijke programmeur dat doet, of zijn ze eigenlijk alleen maar heel goed in het kopiëren van kleine stukjes tekst?

Hier is de uitleg in begrijpelijke taal:

1. De "Echte Wereld" Test (Geen oefenopgaven!)

De meeste tests voor AI zijn als een rekensommetje op een blaadje: "Wat is 5 + 5?" Dat is makkelijk voor een computer. Maar een echte app bouwen is niet een rekensommetje; het is als het bouwen van een gigantische, complexe LEGO-stad waar alles met elkaar verbonden is. Als je één steentje in de fundering verandert, kan de toren aan de andere kant van de stad omvallen.

De onderzoekers gebruikten echte, ingewikkelde code van een enorme app (van het Chinese sociale medium Xiaohongshu). De AI kreeg niet alleen tekst, maar ook:

  • Het "Bouwplan" (PRD): Een document waarin staat wat de app moet kunnen.
  • De "Tekening" (Figma): Een visueel ontwerp dat laat zien hoe de knoppen en kleuren eruit moeten zien.
  • De "Grote Doos LEGO" (Codebase): Honderdduizenden regels code die al bestonden.

2. De Resultaten: De Robot is nog een "Leerling"

De uitslag was een beetje teleurstellend. De beste AI-assistenten slaagden in slechts 12% van de taken.

Om dit te begrijpen, kun je het zo zien:
Stel je voor dat je een stagiair de opdracht geeft om een nieuwe keuken in een huis te plaatsen. De stagiair kan heel goed een nieuwe kraan monteren (een klein taakje), maar zodra hij de hele keuken moet ontwerpen, de leidingen moet aanpassen én de kastjes moet inbouwen zodat ze passen bij de rest van het huis, raakt hij volledig de weg kwijt. Hij vergeet de waterleidingen, of hij plaatst de koelkast op een plek waar de deur niet open kan.

Waarom ging het mis?

  • Tunnelvisie: De AI zag wel wat hij moest doen in één bestandje, maar vergat dat hij ook drie andere bestandjes moest aanpassen om het werkend te krijgen.
  • De "Vergeten Schakelaar": In professionele apps gebruiken programmeurs vaak "schakelaars" (feature flags) om nieuwe functies langzaam aan te zetten. De AI vergat deze schakelaars bijna altijd te gebruiken.
  • Visuele Blindheid: De AI kon de tekstuele instructies wel lezen, maar had moeite om de visuele tekeningen (de Figma-ontwerpen) echt te vertalen naar de juiste knoppen op het scherm.

3. De Belangrijkste Les: De "Auto" vs. de "Chauffeur"

Een heel interessante ontdekking was dat de AI-assistent (de auto) soms belangrijker was dan het AI-model (de motor).

Het is alsof je een Formule 1-motor in een oude tractor zet, en daarna in een hypermoderne raceauto. De motor is misschien even sterk, maar de auto (de software die de AI helpt navigeren door de code) bepaalt of je daadwerkelijk de finish haalt. De commerciële assistenten (zoals Cursor) werkten veel beter dan de gratis, open-source versies, simpelweg omdat ze betere "gereedschapskisten" hadden.

Conclusie

Moeten we bang zijn dat robots onze programmeurs vervangen? Nee, nog niet.

Op dit moment zijn deze AI-agents eerder als een super-snelle assistent met een heel slecht geheugen. Ze kunnen je fantastisch helpen met kleine klusjes en het schrijven van simpele regeltjes, maar voor het echte, grote werk — het bouwen van een complexe, stabiele app — hebben ze nog steeds een menselijke meester nodig die de boel in de gaten houdt en de grote lijnen bewaakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →