← Nieuwste papers
🤖 machine learning

Benchmarking Web API Integration Code Generation

Dit artikel introduceert WAPIIBench, een dataset en evaluatiepijplijn die onthult dat huidige open-source grote taalmodellen aanzienlijk moeite hebben met het genereren van correcte web API-integratiecode, waarbij ze minder dan 40% succes behalen door problemen zoals gehallucineerde endpoints en onjuist argumentgebruik.

Oorspronkelijke auteurs: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde robot probeert te leren hoe hij een specifiek gerecht moet bestellen van een enorme, complexe menukaart. De menukaart is niet zomaar een lijst met gerechten; het is een strikte set regels over hoe je je bestelling opschrijft, welke knoppen je indrukt en welke ingrediënten je precies moet vermelden. Als je zelfs maar één detail fout doet, wijst de keuken de bestelling af.

Dit artikel gaat over het testen hoe goed deze "robots" (die eigenlijk Large Language Models zijn, of LLM's—dezelfde technologie achter AI-chatbots) de code kunnen schrijven die nodig is om deze bestellingen naar echte webdiensten (zoals Google Calendar, Slack of Asana) te sturen.

Hier is een overzicht van wat de onderzoekers hebben gedaan en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

Het Probleem: De "Magie" is Nog Geen Magie

Ontwikkelaars gebruiken "Web API's" om verschillende softwarepakketten met elkaar te laten communiceren. Het is alsof je Lego-blokjes aan elkaar koppelt. Meestal moeten mensen de instructies schrijven om deze blokjes aan elkaar te klikken. De hoop was dat AI dit automatisch zou kunnen doen.

De onderzoekers vroegen zich af: Kan een AI naar een simpel verzoek kijken zoals "Voeg een nieuwe gebeurtenis toe aan mijn agenda" en de perfecte, foutloze code schrijven om dat te laten gebeuren?

Het Experiment: Het Bouwen van een "Rijexamen" voor AI

Om dit te ontdekken, bouwde het team een speciale test genaamd WAPIIBench. Zie dit als een rijexamen voor AI.

  1. De Route: Ze creëerden 395 specifieke "rijscenario's" met behulp van vier populaire real-world diensten (Asana, Google Calendar, Google Sheets en Slack).
  2. De Regels: Ze gebruikten de officiële "gebruikershandleidingen" (OpenAPI-specificaties) voor deze diensten om precies te weten hoe een correcte bestelling eruitziet.
  3. De Test: Ze gaven de AI een prompt (bijv. "Maak een nieuwe agenda aan") en vroegen het om de code te schrijven.
  4. De Controle: In plaats van alleen de code te lezen om te zien of het er goed uitzag, probeerden ze de code daadwerkelijk uit te voeren in een veilige, gecontroleerde sandbox. Als de code probeerde een bestelling te sturen naar een niet-bestaand adres of de verkeerde ingrediënten gebruikte, faalde de test.

De Resultaten: De AI Raakt Vaak Verdwaald

De resultaten waren een beetje teleurstellend voor degenen die hoopten op directe automatisering.

  • De Score: Zelfs de beste open-source AI-modellen kregen slechts ongeveer 30% tot 40% van de taken volledig correct uitgevoerd. Het beste commerciële model (GPT-4o) deed het beter en haalde ongeveer 60-77%, maar dat betekent nog steeds dat het bijna een derde van de tijd faalde.
  • De "Hallucinaties": Dit is het grootste probleem. De AI verzint vaak dingen.
    • Verzonnen Adressen: De AI verzonnen URL-adressen die niet bestonden (zoals een taxichauffeur vertellen dat hij naar "123 Fopstraat" moet gaan terwijl het restaurant eigenlijk aan de "456 Hoofdstraat" zit). Dit gebeurde in tot wel 39% van de gevallen.
    • Verkeerde Ingrediënten: De AI voegde parameters (ingrediënten) toe die de dienst niet accepteerde, of miste parameters die wel vereist waren.
  • Gedeeld Succes: De AI was goed in het onthouden van de algemene vorm van de code (zoals weten dat het de POST-methode moet zijn, wat vergelijkbaar is met weten dat je een "bestelling plaatst" in plaats van een "bestelling annuleert"). Maar wanneer het kwam op de specifieke details van waar het naartoe gestuurd moest worden en precies wat er gezegd moest worden, had het moeite om de stukjes correct samen te voegen.

Een Enkele Verrassende Wendingen

  • Groter is Niet Altijd Beter: Soms presteerde een middelgroot AI-model slechter dan zowel een piepklein als een enorm model. Het is alsof een student te hard heeft gestudeerd voor het verkeerde examen en daardoor in de war is geraakt.
  • Geheugen vs. Begrip: De AI leek delen van de handleidingen uit de trainingsdata te hebben "onthouden". Het kende sommige URL's en argumentnamen, maar kon ze niet betrouwbaar combineren om een nieuw, specifiek probleem op te lossen. Het was als een student die de antwoorden van vorig jaar wiskundetoets had uit het hoofd geleerd, maar dit jaar de problemen niet kon oplossen.
  • De "Invul-Truc": Wanneer de onderzoekers de AI het juiste adres (URL) gaven en alleen vroegen om de rest in te vullen, deed de AI het veel beter. Dit suggereert dat de AI weet hoe hij instructies moet volgen als hij niet eerst de bestemming hoeft te raden.

De Kern van het Verhaal

De conclusie van het artikel is dat hoewel AI goed wordt in het schrijven van code, het nog niet betrouwbaar genoeg is om softwareverbindingen automatisch te maken zonder menselijk toezicht. Als je een AI nu de code laat schrijven om je zakelijke apps met het internet te verbinden, zal het waarschijnlijk 60% tot 70% van de tijd je gegevens naar de verkeerde plek sturen of de verbinding verbreken.

De onderzoekers stellen dat we betere veiligheidscontroles en nieuwe manieren nodig hebben om de AI te helpen om regels in realtime "op te zoeken" (in plaats van te vertrouwen op geheugen) voordat we erop kunnen vertrouwen dat het deze verbindingen zelfstandig bouwt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →