← नवीनतम पेपर
🤖 machine learning

Benchmarking Web API Integration Code Generation

यह शोध पत्र WAPIIBench पेश करता है, जो एक ऐसा डेटासेट और मूल्यांकन पाइपलाइन है जो यह प्रकट करता है कि वर्तमान ओपन-सोर्स लार्ज लैंग्वेज मॉडल्स सही वेब API इंटीग्रेशन कोड जेनरेट करने में काफी संघर्ष करते हैं, जो हैलुसिनेटेड एंडपॉइंट्स और गलत आर्गुमेंट उपयोग जैसी समस्याओं के कारण 40% से भी कम सफलता प्राप्त करते हैं।

मूल लेखक: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, अच्छी तरह से पढ़ा-लिखा रोबोट को एक विशाल, जटिल रेस्टोरेंट मेनू से एक विशिष्ट भोजन ऑर्डर करना सिखाने की कोशिश कर रहे हैं। वह मेनू केवल व्यंजनों की सूची नहीं है; यह आपके ऑर्डर को लिखने, बटन दबाने और सटीक रूप से सामग्री (ingredients) सूचीबद्ध करने के बारे में नियमों का एक सख्त समूह है। यदि आप एक भी विवरण गलत करते हैं, तो किचन आपका ऑर्डर अस्वीकार कर देगा।

यह शोध पत्र इस बारे में है कि ये "रोबोट" (जो वास्तव में लार्ज लैंग्वेज मॉडल्स या LLMs हैं—वही तकनीक जो AI चैटबॉट्स के पीछे है) वास्तविक दुनिया की वेब सेवाओं (जैसे Google Calendar, Slack, या Asana) को भेजने के लिए कोड लिखने में कितने कुशल हैं।

यहाँ एक सरल उपमाओं का उपयोग करते हुए बताया गया है कि शोधकर्ताओं ने क्या किया और उन्हें क्या मिला:

समस्या: "जादू" अभी तक जादू नहीं बना है

डेवलपर्स "Web APIs" का उपयोग विभिन्न सॉफ़्टवेयर को एक-दूसरे से बात करने के लिए करते हैं। यह लेगो ब्लॉक्स (Lego blocks) को जोड़ने जैसा है। आमतौर पर, इंसानों को इन ब्लॉक्स को आपस में जोड़ने के निर्देश लिखने होते हैं। उम्मीद यह थी कि AI इसे स्वचालित रूप से कर सकेगा।

शोधकर्ताओं ने पूछा: क्या एक AI "मेरे कैलेंडर में एक नया इवेंट जोड़ें" जैसे सरल अनुरोध को देखकर, ऐसा करने के लिए एकदम सही, त्रुटि-मुक्त कोड लिख सकता है?

प्रयोग: AI के लिए एक "ड्राइविंग टेस्ट" बनाना

यह जानने के लिए, टीम ने WAPIIBench नामक एक विशेष परीक्षण बनाया। इसे AI के लिए एक "ड्राइविंग टेस्ट" समझें।

  1. कोर्स: उन्होंने चार लोकप्रिय वास्तविक दुनिया की सेवाओं (Asana, Google Calendar, Google Sheets, और Slack) का उपयोग करके 395 विशिष्ट "ड्राइविंग परिदृश्य" बनाए।
  2. नियम: उन्होंने इन सेवाओं के आधिकारिक "ड्राइवर मैनुअल" (OpenAPI स्पेसिफिकेशन) का उपयोग किया ताकि यह पता चल सके कि एक सही ऑर्डर कैसा दिखता है।
  3. परीक्षण: उन्होंने AI को एक प्रॉम्प्ट दिया (जैसे, "एक नया कैलेंडर बनाएं") और उसे कोड लिखने के लिए कहा।
  4. जांच: केवल कोड को यह देखने के लिए पढ़ने के बजाय कि वह कैसा दिखता है, उन्होंने वास्तव में इसे एक सुरक्षित, नियंत्रित सैंडबॉक्स में चलाने की कोशिश की। यदि कोड ने किसी गैर-मौजूद पते पर ऑर्डर भेजने की कोशिश की या गलत सामग्री का उपयोग किया, तो परीक्षण विफल हो गया।

परिणाम: AI अक्सर रास्ता भटक जाता है

परिणाम उन लोगों के लिए निराशाजनक थे जो तत्काल स्वचालन (automation) की उम्मीद कर रहे थे।

  • स्कोर: यहाँ तक कि सबसे अच्छे ओपन-सोर्स AI मॉडल भी केवल 30% से 40% कार्यों को पूरी तरह से सही कर पाए। सबसे अच्छे व्यावसायिक मॉडल (GPT-4o) ने बेहतर प्रदर्शन किया, लगभग 60-77% तक पहुँचा, लेकिन इसका मतलब यह भी है कि वह लगभग एक तिहाई समय विफल रहा।
  • "हैलुसिनेशन" (Hallucinations): यह सबसे बड़ी समस्या है। AI अक्सर चीजें बनाता था।
    • फर्जी पते: AI ऐसे URL पते बना देता था जो अस्तित्व में नहीं थे (जैसे, जब रेस्टोरेंट वास्तव में "456 Main St" पर हो, तो टैक्सी ड्राइवर को "123 Fake Street" पर जाने के लिए कहना)। यह 39% मामलों में हुआ।
    • गलत सामग्री: AI में ऐसे पैरामीटर्स (सामग्री) शामिल होते थे जिन्हें सेवा स्वीकार नहीं करती थी, या वह उन चीजों को छोड़ देता था जो आवश्यक थीं।
  • आंशिक सफलता: AI कोड के सामान्य आकार को याद रखने में अच्छा था (जैसे, यह जानना कि उसे POST मेथड का उपयोग करना चाहिए, जो कि यह जानने जैसा है कि आपको "ऑर्डर रद्द करने" के बजाय "ऑर्डर देना" है)। लेकिन जब बात विशिष्ट विवरणों की आई कि इसे कहाँ भेजना है और बिल्कुल क्या कहना है, तो वह टुकड़ों को सही ढंग से जोड़ने में संघर्ष करता रहा।

कुछ आश्चर्यजनक मोड़

  • बड़ा होना हमेशा बेहतर नहीं होता: कभी-कभी, एक मध्यम आकार का AI मॉडल एक बहुत छोटे और एक बहुत बड़े मॉडल दोनों से खराब प्रदर्शन करता था। यह एक ऐसे छात्र की तरह है जिसने गलत परीक्षा के लिए बहुत अधिक पढ़ाई की और भ्रमित हो गया।
  • याददाश्त बनाम समझ: AI ने अपने प्रशिक्षण डेटा से मैनुअल के हिस्सों को "याद" कर लिया था। वह कुछ URL और तर्क (arguments) के नाम जानता था, लेकिन वह एक नए, विशिष्ट समस्या को हल करने के लिए उन्हें विश्वसनीय रूप से संयोजित नहीं कर सका। यह एक छात्र की तरह था जिसने पिछले साल के गणित टेस्ट के उत्तर रट लिए थे लेकिन इस साल की समस्याओं को हल नहीं कर सका।
  • "खाली स्थान भरें" वाली ट्रिक: जब शोधकर्ताओं ने AI को सही पता (URL) दिया और केवल बाकी हिस्सा भरने के लिए कहा, तो AI ने बहुत बेहतर प्रदर्शन किया। इससे पता चलता है कि यदि AI को पहले से गंतव्य का अनुमान नहीं लगाना पड़ता है, तो वह निर्देशों का पालन करने में अच्छा है।

मुख्य निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI कोड लिखने में अच्छा हो रहा है, लेकिन यह मानवीय पर्यवेक्षण के बिना सॉफ़्टवेयर सिस्टम को स्वचालित रूप से जोड़ने के लिए अभी तक पर्याप्त विश्वसनीय नहीं है। यदि आप अभी अपने व्यावसायिक ऐप्स को इंटरनेट से जोड़ने के लिए AI को कोड लिखने देंगे, तो वह लगभग 60% से 70% बार आपका डेटा गलत जगह भेज देगा या कनेक्शन तोड़ देगा।

शोधकर्ताओं का कहना है कि हमें इन कनेक्शनों को अपने आप बनाने के लिए भरोसा करने से पहले बेहतर सुरक्षा जांच और AI को वास्तविक समय में नियमों को "देखने" (याददाश्त पर निर्भर रहने के बजाय) में मदद करने के नए तरीकों की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →