← Nieuwste papers
🤖 machine learning

MobileDev-Bench: A Comprehensive Benchmark for Evaluating Language Models on Mobile Application Development

Dit paper introduceert MobileDev-Bench, een nieuw benchmark voor het evalueren van taalmodellen op mobiel app-ontwikkeling, dat aantoont dat zelfs de meest geavanceerde modellen worstelen met complexe, multi-bestandsproblemen in echte productieomgevingen.

Oorspronkelijke auteurs: Moshood A. Fakorede, Krishna Upadhyay, A. B. Siddique, Umar Farooq

Gepubliceerd 2026-03-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Moshood A. Fakorede, Krishna Upadhyay, A. B. Siddique, Umar Farooq

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een reparatiewerkplaats hebt voor mobiele apps, zoals die op je telefoon zitten. Tot nu toe hebben onderzoekers vooral gekeken hoe goed kunstmatige intelligentie (AI) kleine, simpele taken kan oplossen, zoals het repareren van een losse schroef in een losse kast of het schrijven van een kort stukje code voor een website.

Maar mobiele apps zijn anders. Ze zijn ingewikkelder, hebben meer regels en bestaan uit veel meer losse onderdelen die allemaal perfect op elkaar moeten aansluiten.

Deze paper introduceert MobileDev-Bench. Dit is een nieuwe, zeer moeilijke "toets" om te zien of AI-apparaten echt klaar zijn om mobiele apps te repareren.

Hier is hoe het werkt, vertaald naar alledaags taal:

1. De "Proefkeuken" (De Benchmark)

Stel je voor dat je een chef-kok wilt testen. Je kunt hem niet alleen vragen om een boterham te maken (dat is te makkelijk). Je moet hem vragen om een compleet, complex diner te bereiden met ingrediënten uit verschillende landen, waarbij de oven precies op de juiste temperatuur moet staan.

  • Wat hebben ze gedaan? De onderzoekers hebben 384 echte problemen verzameld uit 18 populaire, echte mobiele apps (zoals een podcast-app of een weer-app).
  • De uitdaging: De AI moet niet alleen het probleem begrijpen, maar ook precies weten welke bestanden er aangepast moeten worden en of de app daarna nog steeds werkt.
  • De "valstrik": Veel andere tests kijken alleen naar de code. Maar bij een mobiele app moet je ook de "recepten" (configuratiebestanden), de "decoratie" (afbeeldingen en teksten) en de "keukengerei" (bouwsystemen) aanpassen. Als je één ding vergeet, werkt de hele app niet meer.

2. De "Grote Verschillen" (Waarom is dit zo moeilijk?)

In de paper wordt uitgelegd dat mobiele apps heel anders zijn dan de simpele programma's waar AI tot nu toe goed in was.

  • Het "Puzzel"-effect: Bij een simpele test moet je vaak maar één stukje van de puzzel verplaatsen. Bij een mobiele app moet je soms 12 verschillende puzzelstukken tegelijk verplaatsen, en die moeten allemaal in het juiste plaatje passen.
  • De "Meerdere Talen"-probleem: Soms moet je in één reparatie zowel Java (een taal voor Android) als Kotlin (een nieuwere versie) of TypeScript gebruiken. Het is alsof je een huis moet renoveren waarbij je tegelijkertijd de elektriciteit in het Nederlands en het sanitair in het Frans moet regelen.
  • De "Gebouw"-analogie: Een mobiele app is als een hoog gebouw. Als je de lift wilt repareren, moet je misschien ook de stroomkast op de begane grond aanpassen, de deuren op de eerste verdieping vervangen en het instructieboekje voor de bewoners updaten. Als je alleen de lift repareert, blijft het gebouw niet werken.

3. Het Resultaat: De AI "Strikt"

Toen de onderzoekers de beste AI-modellen van vandaag (zoals GPT-5, Claude en Gemini) op deze test lieten werken, was het resultaat... teleurstellend.

  • De score: De AI's slaagden maar in 3% tot 5% van de gevallen.
  • Wat betekent dit? Stel je voor dat je 100 auto's naar een garage brengt met een defect. De AI zou er maar 3 of 4 goed kunnen repareren. De rest zou hij ofwel helemaal niet kunnen vinden, of hij zou de verkeerde onderdelen vervangen.

4. Waarom faalt de AI? (De "Blindheid")

De paper geeft een heel duidelijk antwoord op de vraag: Waarom lukt het niet?

Het probleem is niet dat de AI niet goed kan schrijven (de reparatie zelf). Het probleem is dat de AI niet goed kan vinden waar het probleem zit.

  • De "Zoektocht": De AI is als een detective die in een enorme bibliotheek (de app) op zoek is naar één verkeerd boekje. Maar de bibliotheek is zo groot en de boeken zijn zo door elkaar gegooid dat de detective vaak de verkeerde planken bekijkt.
  • De "Blindheid": De AI ziet vaak niet dat als je het raam in de woonkamer vervangt, je ook het kozijn in de slaapkamer moet aanpassen. Omdat de AI niet ziet dat deze twee dingen met elkaar verbonden zijn, maakt hij een fout.

5. Wat betekent dit voor de toekomst?

De onderzoekers zeggen: "We moeten stoppen met denken dat AI al klaar is voor dit werk."

  • De les: We moeten eerst de AI leren beter te zoeken en de samenhang tussen de verschillende onderdelen van een app te begrijpen, voordat we kunnen verwachten dat ze complexe apps kunnen repareren.
  • De belofte: Met deze nieuwe test (MobileDev-Bench) hebben onderzoekers nu een meetlat om te zien of nieuwe AI-technieken dit probleem echt oplossen. Het is een eerlijke manier om te zien wie er echt vooruitgang boekt.

Kortom:
Deze paper zegt: "AI is slim, maar als het gaat om het repareren van complexe mobiele apps, is het nog een beetje als een leerling die de gereedschapskist wel kent, maar niet weet welke sleutel hij moet gebruiken voor welke bout. We hebben een nieuwe, zware test bedacht om te zien of we die leerling eindelijk kunnen laten slagen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →