Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents
Dit artikel introduceert Alipay-PIBench, een realistische benchmark bestaande uit 18 taakinstanties verspreid over negen projecten om het vermogen van programmeeragenten om complexe Alipay-betalingsintegraties af te handelen te evalueren, waarbij wordt aangetoond dat toegang tot specifieke integratievaardigheden de prestaties aanzienlijk verbetert en een gestructureerd kader biedt voor het diagnosticeren van modelcapaciteiten in betalingsgerelateerde softwareontwikkeling.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers niet alleen code schrijven als een robot die op een toetsenbord typt, maar zich echt gedragen als junior ontwikkelaars die een projectmap kunnen openen, de bedrijfslogica begrijpen en bugs in meerdere bestanden kunnen oplossen. Dit is de opwindende grens van "coding agents". Lange tijd hebben we deze AI-helpers getest op eenvoudige, geïsoleerde puzzels—zoals het vragen aan hen om een enkel wiskundig probleem op te lossen of een piepklein functieblokje te schrijven. Maar in de echte wereld is software geen verzameling van geïsoleerde puzzels; het is een gigantische, onderling verbonden stad. Om een echte app te bouwen, moet een AI begrijpen hoe de voordeur verbonden is met de achterkant van het kantoor, hoe data tussen kamers stroomt en hoe het gebouw veilig gehouden kan worden voor indringers. Dit geldt met name voor iets dat zo hoog in de inzet staat als het afhandelen van geld. Als een AI een betalingssysteem fout doet, is dat niet zomaar een typefout; het is een potentieel financieel drama. Daarom vragen onderzoekers zich af: kunnen deze AI-agents de rommelige, gevaarlijke en complexe realiteit van het integreren van een betalingssysteem in een echte zakelijke applicatie daadwerkelijk aan?
Maak kennis met Alipay-PIBench, een nieuwe "rijexamen"-test voor coding agents, gecreëerd door het team van Ant Group. Zie het als een gespecialiseerde rijschool voor AI, maar in plaats van auto's te leren hoe ze parallel moeten parkeren, leert het hen hoe ze een zeer specifieke, hoge druk situatie moeten aanpakken: het integreren van een betalingssysteem (specifiek Alipay) in een echte zakelijke applicatie. De onderzoekers bouwden een speeltuin met 18 verschillende "rijscenario's" gebaseerd op echte projecten. Ze verdeelden deze in twee niveaus: Basic, waarbij de AI alleen het geld van punt A naar punt B moet krijgen, en Advanced, waarbij de AI te maken krijgt met verkeersopstoppingen, valse boetes en beveiligers (het afhandelen van risico's zoals dubbele betalingen, terugbetalingen en beveiligingscontroles).
Het team onderwierp zes verschillende AI-modellen aan deze test. Ze wilden twee hoofdzaken zien: hoe goed zijn deze AI's in de baan op zichzelf, en helpt het geven van een "spiekbriefje" (een gestructureerde gids genaamd alipay-payment-integration) hen om beter te presteren? De resultaten waren veelzeggend. Zonder het spiekbriefje hadden de AI's moeite, en maakten ze vaak code die er goed uitzag maar faalde wanneer je daadwerkelijk probeerde geld uit te geven. Echter, toen de onderzoekers de AI's de gestructureerde gids gaven, steeg het gemiddelde succespercentage met ongeveer 10,31 procentpunt. De best presterende AI, Claude Opus 4.8, bereikte een succespercentage van 91,37% met de gids, terwijl de slechtste performer, MiniMax M3, op 68,58% uitkwam.
Maar dit is het meest interessante deel van het verhaal: de test onthulde dat "er goed uitzien" niet hetzelfde is als "werken". De onderzoekers gebruikten een meerlagig inspectiesysteem. Ze controleerden of de code aanwezig was (statische controles), of het kon draaien (integratietesten) en of het de regels van het geld volgde (beveiligings- en logica-controles). Ze ontdekten een grote kloof: een AI kon code schrijven die de "is het er?"-controle met vliegende vaardigheden doorstond (een score van meer dan 90% op structuur), maar spectaculair faalde wanneer het daadwerkelijk probeerde een betaling te verwerken (een score van minder dan 40% op uitvoering). Het is als een student die de definities van alle auto-onderdelen uit het hoofd kent, maar crasht op het moment dat hij daadwerkelijk probeert te rijden. De studie suggereert dat hoewel deze AI-agents beter worden, ze nog steeds hulp nodig hebben bij het begrijpen van de diepe, onzichtbare regels van veiligheid en logica die voorkomen dat echte geldsystemen in elkaar storten. Het "spiekbriefje" maakte hen niet alleen sneller; het hielp hen ook de meest gevaarlijke fouten te vermijden, wat bewijst dat in de wereld van coding agents, het hebben van een goede kaart even belangrijk is als het hebben van een snelle motor.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.