← नवीनतम पेपर
🤖 machine learning

Mitigating Errors in LLM-Generated Web API Invocations via Retrieval-Augmented Generation and Constrained Decoding

यह शोध पत्र LLM-जनित वेब API इनवोकेशन की शुद्धता में सुधार करने के लिए पूरक रणनीतियों के रूप में रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) और कंस्ट्रेंड डिकोडिंग (CD) का प्रस्ताव और मूल्यांकन करता है, जिसमें यह पाया गया है कि जबकि RAG फुल इनवोकेशन जनरेशन में मतिभ्रम (hallucinations) को प्रभावी ढंग से कम करता है, वहीं CD अवैध मापदंडों (parameters) को रोकने के लिए अधिक विश्वसनीय प्रावधान प्रदान करता है और विभिन्न परिदृश्यों में समग्र शुद्धता को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक घर बनाने की कोशिश कर रहे हैं, लेकिन एक मास्टर आर्किटेक्ट को काम पर रखने के बजाय, आप एक बहुत ही बुद्धिमान, सुशिक्षित, लेकिन थोड़े बिखराव वाले सहायक (लार्ज लैंग्वेज मॉडल, या LLM) से आपके लिए ब्लूप्रिंट लिखने के लिए कहते हैं।

समस्या यह है कि इस घर को बनाने के "नियम" सहायक के दिमाग के अंदर नहीं हैं। वे एक विशाल, जटिल मैनुअल में लिखे गए हैं जिसे ओपनएपीआई स्पेसिफिकेशन (OpenAPI Specification) कहा जाता है (एक ऐसा दस्तावेज़ जो बताता है कि कौन से दरवाजे खोलने हैं, कौन सी चाबियाँ इस्तेमाल करनी हैं और कितनी आकार की ईंटें ऑर्डर करनी हैं)।

यदि आप केवल सहायक से "एक दरवाजा बनाने" के लिए कहते हैं, तो वह गलत आकार का दरवाजा चुन सकता है, गलत चाबी का उपयोग कर सकता है, या एक ऐसा दरवाजा बना सकता है जो मैनुअल में मौजूद ही नहीं है। इसे हैलुसिनेशन (Hallucination) कहा जाता है।

यह शोध पत्र उस सहायक को दो विशिष्ट उपकरण देने के बारे में है ताकि वह नियम बनाने के बजाय मैनुअल का पूरी तरह से पालन करना शुरू कर दे।

समस्या: "अनुमान लगाने का खेल"

शोधकर्ताओं ने पाया कि जब उन्होंने AI मॉडल्स से वेब सेवाओं (जैसे स्लैक पर संदेश भेजना या गूगल कैलेंडर चेक करना) से जुड़ने के लिए कोड लिखने को कहा, तो AI लगातार गलतियाँ करता रहा।

  • वह गलत "दरवाजा" (एंडपॉइंट) चुन लेता था।
  • वह ऐसी चाबी का उपयोग करने की कोशिश करता था जो मौजूद ही नहीं थी।
  • वह ऐसी विशेषताएं बना देता था जो मैनुअल में नहीं थीं।

समाधान: दो नए उपकरण

शोधकर्ताओं ने वास्तविक दुनिया के कोडिंग कार्यों के एक डेटासेट का उपयोग करके, इसे ठीक करने के दो अलग-अलग तरीकों का परीक्षण किया।

टूल 1: "चीट शीट" (रिट्रीवल-ऑग्मेंटेड जनरेशन - RAG)

उपमा: कल्पना कीजिए कि आप एक परीक्षा दे रहे हैं, लेकिन आपको कमरे में पाठ्यपुस्तक का एक विशिष्ट पृष्ठ साथ ले जाने की अनुमति है। AI अपना उत्तर लिखने से पहले, एक रोबोट लाइब्रेरियन (रिट्रीवर) विशाल मैनुअल में से उस सटीक पन्ने को ढूंढता है जो उस "दरवाजे" के बारे में है जिसकी आपको आवश्यकता है, और उसे AI के पास थमा देता है।

  • यह कैसे काम करता है: शोधकर्ताओं ने एक सिस्टम बनाया जो API मैनुअल के प्रासंगिक हिस्से को पकड़ता है और उसे AI के प्रॉम्प्ट में पेस्ट कर देता है।
  • परिणाम: यह मिला-जुला रहा।
    • अच्छा: जब AI को नहीं पता होता था कि कौन सा दरवाजा चुनना है, तो चीट शीट ने उसे सही दरवाजा खोजने में मदद की। इसने AI को नकली दरवाजे बनाने से रोक दिया।
    • बुरा: जब AI पहले से ही जानता था कि कौन सा दरवाजा चुनना है, तो चीट शीट ने कभी-कभी उसे भ्रमित कर दिया। AI ने चीट शीट में 20 संभावित चाबियों की सूची देखी और सोचा, "मुझे शायद उन सभी का उपयोग करना चाहिए!" भले ही कार्य के लिए केवल एक की आवश्यकता थी। इसने कोड को अव्यवस्थित और गलत बना दिया।
    • निर्णय: यह सही रास्ता खोजने में मदद करता है, लेकिन यह AI को उन अतिरिक्त विकल्पों का उपयोग करने के लिए "अति-उत्साही" बना सकता है जिनकी उसे आवश्यकता नहीं है।

टूल 2: "ट्रेन ट्रैक्स" (कन्स्ट्रेंड डिकोडिंग - CD)

उपमा: कल्पना कीजिए कि AI एक ट्रेन है। आमतौर पर, ट्रेन मानचित्र पर कहीं भी जा सकती है, यहाँ तक कि पटरियों से उतरकर दलदल में भी जा सकती है (हैलुसिनेशन)। कन्स्ट्रेंड डिकोडिंग (Constrained Decoding) स्टील की पटरियाँ बिछाने जैसा है जो केवल वैध गंतव्यों तक जाती हैं। ट्रेन भौतिक रूप से पटरियों से बाहर नहीं जा सकती।

  • यह कैसे काम करता है: शोधकर्ताओं ने मैनुअल को नियमों के एक सेट (जैसे एक भूलभुलैया) में बदल दिया। जैसे ही AI कोड का अगला शब्द टाइप करने की कोशिश करता, सिस्टम जांचता: "क्या यह शब्द नियमों द्वारा अनुमत है?" यदि AI एक नकली दरवाजा या गलत चाबी टाइप करने की कोशिश करता, तो सिस्टम उसे ब्लॉक कर देता और AI को एक वैध विकल्प चुनने के लिए मजबूर करता।
  • परिणाम: यह स्पष्ट विजेता था।
    • शून्य हैलुसिनेशन: AI एक भी नकली URL, मेथड या आर्गुमेंट नहीं बना सका। यह गणितीय रूप से असंभव था कि वह नियमों को तोड़ दे।
    • बेहतर सटीकता: क्योंकि वह चीजें मनगढ़ंत नहीं बना सकता था, इसलिए उसके द्वारा लिखा गया कोड सही होने की बहुत अधिक संभावना थी।
    • निर्णय: यह सबसे विश्वसनीय उपकरण है। यह AI को मैनुअल के प्रति आज्ञाकारी होने के लिए मजबूर करता है।

कॉम्बो: "चीट शीट" + "ट्रेन ट्रैक्स"

शोधकर्ताओं ने इन दोनों उपकरणों को एक साथ उपयोग करने का प्रयास किया।

  • परिणाम: यह कुछ मॉडल्स के लिए बहुत अच्छा रहा, जिससे उच्चतम स्कोर मिले। हालाँकि, यह सुसंगत नहीं था। कभी-कभी "चीट शीट" AI को बहुत सारे विकल्पों का उपयोग करने के लिए उकसाती थी, और भले ही "ट्रेन ट्रैक्स" ने उसे अवैध चालें चलने से रोका, फिर भी इसने उसे अनावश्यक चालें चलाने के लिए प्रेरित किया।
  • निर्णय: यह शक्तिशाली है, लेकिन अकेले "ट्रेन ट्रैक्स" अधिक सुरक्षित और सुसंगत है।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हालांकि AI कोड लिखने में बहुत अच्छा है, लेकिन यह अपने आप जटिल, बाहरी नियमों की किताब का पालन करने में बहुत खराब है।

  • RAG (चीट शीट) AI को संदर्भ पुस्तक देने जैसा है। यह मदद करता है, लेकिन बहुत अधिक जानकारी से AI विचलित हो सकता है।
  • CD (ट्रेन ट्रैक्स) AI के चारों ओर एक पिंजरा बनाने जैसा है जो केवल वैध चालों की अनुमति देता है। यह AI को नियम बनाने से रोकने का सबसे प्रभावी तरीका है।

शोधकर्ता कहते हैं कि यदि आप चाहते हैं कि AI बिना टूटे वेब सेवाओं से जुड़ने के लिए कोड लिखे, तो आपको केवल AI की याददाश्त पर भरोसा नहीं करना चाहिए। आपको या तो उसे सही मैनुअल देना होगा (RAG) या, और भी बेहतर, उसे नियमों का सख्ती से पालन करने के लिए मजबूर करना होगा (CD)। "ट्रेन ट्रैक्स" वाला दृष्टिकोण यह सुनिश्चित करने का सबसे विश्वसनीय तरीका है कि कोड वास्तव में काम करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →