← नवीनतम पेपर
🤖 AI

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

यह शोध पत्र Alipay-PIBench प्रस्तुत करता है, जो एक यथार्थवादी बेंचमार्क है जिसमें नौ परियोजनाओं के तहत 18 कार्य उदाहरण शामिल हैं ताकि जटिल Alipay भुगतान एकीकरणों को संभालने की कोडिंग एजेंटों की क्षमता का मूल्यांकन किया जा सके, जो यह प्रदर्शित करता है कि विशिष्ट एकीकरण कौशल तक पहुँच प्रदर्शन में महत्वपूर्ण सुधार करती है और भुगतान संबंधी सॉफ्टवेयर विकास में मॉडल क्षमताओं के निदान के लिए एक संरचित ढांचा प्रदान करती है।

मूल लेखक: Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

प्रकाशित 2026-07-20
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल एक रोबोट की तरह कीबोर्ड पर टाइप करके कोड नहीं लिखते, बल्कि वास्तव में जूनियर डेवलपर्स की तरह काम करते हैं जो एक प्रोजेक्ट फोल्डर खोल सकते हैं, बिजनेस लॉजिक को समझ सकते हैं, और कई फाइलों में बग्स को ठीक कर सकते हैं। यह "कोडिंग एजेंट्स" का रोमांचक क्षेत्र है। लंबे समय तक, हमने इन एआई सहायकों का परीक्षण सरल, अलग-थलग पहेलियों पर किया है—जैसे कि उन्हें एक एकल गणितीय समस्या हल करने या एक छोटा सा फंक्शन लिखने के लिए कहना। लेकिन वास्तविक दुनिया में, सॉफ्टवेयर अलग-थलग पहेलियों का संग्रह नहीं है; यह एक विशाल, आपस में जुड़ी हुई नगरी है। एक वास्तविक ऐप बनाने के लिए, एक एआई को यह समझने की आवश्यकता है कि सामने का दरवाजा बैक ऑफिस से कैसे जुड़ता है, कमरों के बीच डेटा कैसे प्रवाहित होता है, और इमारत को घुसपैचारियों से सुरक्षित कैसे रखा जाए। यह विशेष रूप से उस चीज़ के लिए सच है जो पैसे के लेन-देन जैसी उच्च-जोखिम वाली स्थिति हो। यदि कोई एआई पेमेंट सिस्टम को गलत कर देता है, तो यह केवल एक टाइपिंग की गलती नहीं है; यह एक संभावित वित्तीय आपदा है। इसलिए, शोधकर्ता पूछ रहे हैं: क्या ये एआई एजेंट वास्तव में एक वास्तविक बिजनेस ऐप में पेमेंट सिस्टम को एकीकृत करने की अव्यवस्थित, खतरनाक और जटिल वास्तविकता को संभाल सकते हैं?

यहाँ आता है Alipay-PIBench, कोडिंग एजेंट्स के लिए एक नया "ड्राइविंग टेस्ट", जिसे एंट ग्रुप (Ant Group) की टीम द्वारा बनाया गया है। इसे एआई के लिए एक विशेष ड्राइविंग स्कूल के रूप में समझें, लेकिन कारों को पैरेलल पार्क करना सिखाने के बजाय, यह उन्हें एक बहुत ही विशिष्ट, उच्च-दबाव वाली स्थिति को संभालने के लिए प्रशिक्षित करता है: एक वास्तविक दुनिया के बिजनेस एप्लिकेशन में पेमेंट सिस्टम (विशेष रूप से अलीपे/Alipay) को एकीकृत करना। शोधकर्ताओं ने वास्तविक प्रोजेक्ट्स पर आधारित 18 अलग-अलग "ड्राइविंग परिदृश्यों" के साथ एक प्लेग्राउंड बनाया। उन्होंने इन्हें दो स्तरों में विभाजित किया: बेसिक (Basic), जहाँ एआई को बस पैसे को बिंदु A से बिंदु B तक पहुँचाना होता है, और एडवांस्ड (Advanced), जहाँ एआई को ट्रैफिक जाम, फर्जी टिकटों और सुरक्षा गार्डों (डुप्लिकेट भुगतान, रिफंड और सुरक्षा जांच जैसे जोखिमों को संभालने) से निपटना पड़ता है।

टीम ने छह अलग-अलग एआई मॉडल्स को इस टेस्ट के माध्यम से परखा। वे मुख्य रूप से दो चीजें देखना चाहते थे: अकेले काम करने में ये एआई कितने अच्छे हैं, और क्या उन्हें एक "चीट शीट" (एक संरचित मार्गदर्शिका जिसे alipay-payment-integration कहा जाता है) देने से उन्हें बेहतर करने में मदद मिलती है? परिणाम बताने वाले थे। चीट शीट के बिना, एआई संघर्ष करते थे, अक्सर ऐसा कोड बनाते थे जो दिखने में तो सही लगता था लेकिन जब आप वास्तव में पैसा खर्च करने की कोशिश करते तो विफल हो जाता था। हालाँकि, जब शोधकर्ताओं ने एआई को वह संरचित मार्गदर्शिका दी, तो सफलता दर औसतन लगभग 10.31 प्रतिशत अंक बढ़ गई। सबसे अच्छा प्रदर्शन करने वाला एआई, Claude Opus 4.8, गाइड के साथ 91.37% की सफलता दर तक पहुँच गया, जबकि सबसे कम प्रदर्शन करने वाला, MiniMax M3, 68.58% पर रहा।

लेकिन कहानी का सबसे दिलचस्प हिस्सा यहाँ है: टेस्ट ने खुलासा किया कि "अच्छा दिखना" और "काम करना" एक समान नहीं है। शोधकर्ताओं ने एक बहु-स्तरीय निरीक्षण प्रणाली का उपयोग किया। उन्होंने जांचा कि क्या कोड वहाँ मौजूद है (स्टैटिक चेक), क्या यह चल सकता है (इंटीग्रेशन टेस्ट), और क्या यह पैसे के नियमों का पालन करता है (सुरक्षा और लॉजिक चेक)। उन्होंने एक बड़ा अंतर पाया: एक एआई ऐसा कोड लिख सकता था जो "क्या यह मौजूद है?" वाले चेक में शानदार स्कोर (संरचना पर 90% से अधिक) करता था, लेकिन वास्तव में भुगतान संसाधित करने की कोशिश करने पर बुरी तरह विफल (निष्पादन पर 40% से कम) हो जाता था। यह एक ऐसे छात्र की तरह है जिसने सभी कार के पुर्जों की परिभाषाएं रट ली हैं लेकिन जैसे ही वे गाड़ी चलाने की कोशिश करते हैं, दुर्घटनाग्रस्त हो जाते हैं। अध्ययन सुझाव देता है कि हालांकि ये एआई एजेंट बेहतर हो रहे हैं, उन्हें अभी भी उन गहरे, अदृश्य सुरक्षा और लॉजिक के नियमों को समझने में मदद की आवश्यकता है जो वास्तविक दुनिया के मनी सिस्टम को बिखरने से बचाते हैं। "चीट शीट" ने न केवल उन्हें तेज़ बनाया; इसने उन्हें सबसे खतरनाक गलतियों से बचने में भी मदद की, जिससे यह सिद्ध हुआ कि कोडिंग एजेंट्स की दुनिया में, एक अच्छा नक्शा होना उतना ही महत्वपूर्ण है जितना कि एक तेज़ इंजन होना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →