← नवीनतम पेपर
💻 computer science

From Ranking to Reasoning: Explainable Web API Recommendation via Semantic Reasoning

यह शोध पत्र WAR-R1 प्रस्तुत करता है, जो एक हल्का (lightweight) LLM पर आधारित एक व्याख्यात्मक (explainable) Web API अनुशंसा ढांचा है, जो अनुशंसा सटीकता में सुधार करने और पारदर्शी औचित्य प्रदान करने के लिए समान रूप से सिमेंटिक रीजनिंग, विशेष टोकन के माध्यम से अनुकूली परिवर्तनीय-कार्डिनैलिटी जनरेशन और सुदृढीकरण शिक्षण (reinforcement learning) के साथ एक दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करता है।

मूल लेखक: Zishuo Xu, Dezhong Yao, Yao Wan

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zishuo Xu, Dezhong Yao, Yao Wan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नया, जटिल व्यंजन (एक "मैशअप") बनाने की कोशिश कर रहे हैं। आपके पास हजारों सामग्रियों (Web APIs) से भरी एक विशाल पेंट्री है, लेकिन आपको नहीं पता कि उनमें से किसे चुनना है। कुछ व्यंजनों के लिए केवल नमक और काली मिर्च की आवश्यकता होती है; कुछ के लिए एक दर्जन विदेशी मसालों की।

वर्षों तक, शेफ को सामग्री चुनने में मदद करने वाले "स्मार्ट असिस्टेंट" के पास दो बड़ी समस्याएं थीं:

  1. वे कठोर थे: वे हमेशा आपको सामग्रियों की एक निश्चित संख्या (जैसे, ठीक 5) देते थे, भले ही आपके नुस्खे में केवल 1 या 15 की आवश्यकता हो। इससे या तो रसोई बिखरी हुई और अव्यवस्थित हो जाती थी या मुख्य स्वाद गायब हो जाते थे।
  2. वे मौन थे: वे बिना यह बताए बस सूची थमा देते थे कि उन्होंने उन विशिष्ट वस्तुओं को क्यों चुना। आपको अंदाजा लगाना पड़ता था कि "नमक" वास्तव में चीनी तो नहीं है या "मसाला" आपके व्यंजन को खराब तो नहीं कर देगा।

यह पेपर WAR-R1 पेश करता है, जो एक नया, अधिक स्मार्ट असिस्टेंट है जो इन दोनों समस्याओं को हल करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "परिवर्तनीय-आकार" की टोकरी (Adaptive Recommendation)

सामग्रियों की एक निश्चित संख्या थोपने के बजाय, WAR-R1 एक लचीली शॉपिंग बास्केट की तरह काम करता है।

  • यह कैसे काम करता है: यदि आप एक साधारण सलाद मांगते हैं, तो टोकरी केवल कुछ ही चीजें देगी। यदि आप एक जटिल स्टू (stew) मांगते हैं, तो टोकरी कई अधिक चीजें रखने के लिए फैल जाएगी।
  • सीक्रेट सॉस: शोधकर्ताओं ने AI को विशेष "स्टार्ट" (शुरू) और "स्टॉप" (रुकें) सिग्नल (जैसे अदृश्य टैग) सिखाए। जब AI "स्टार्ट" टैग देखता है, तो वह सामग्रियां सूचीबद्ध करना शुरू कर देता है। जब उसे लगता है कि उसने पर्याप्त चीजें ढूंढ ली हैं, तो वह "स्टॉप" टैग पर रुक जाता है। यह इसे आपकी आवश्यकता की जटिलता के अनुसार स्वचालित रूप से अनुकूलित होने की अनुमति देता है।

2. "तर्क करने वाला शेफ" (Semantic Reasoning)

WAR-R1 आपको केवल टोकरी ही नहीं थमाता; यह एक सु-शेफ (sous-chef) की तरह काम करता है जो अपने हर चुनाव की व्याख्या करता है।

  • उपमा: यदि AI "Google Maps" का सुझाव देता है, तो यह केवल "Google Maps" नहीं कहता। यह कहता है, "मैंने Google Maps को इसलिए चुना क्योंकि आपके नुस्खे को उपयोगकर्ताओं को यह दिखाने की आवश्यकता है कि गोताखोरी (dive) स्थल कहाँ स्थित हैं।"
  • यह क्यों मायने रखता है: यह पारदर्शिता विश्वास पैदा करती है। आप तुरंत देख सकते हैं कि क्या सुझाव आपकी विशिष्ट आवश्यकताओं के लिए सही है, बजाय इसके कि आप केवल एक रैंक की गई सूची का आँख मूंदकर पालन करें।

3. "दो-चरणीय प्रशिक्षण" (सीखना कि खाना कैसे बनाएं)

पेपर बताता है कि उन्होंने इस AI को कैसे सिखाया, जो एक नए शेफ को प्रशिक्षित करने जैसा है:

  • चरण 1: कुकबुक (Supervised Fine-Tuning):
    सबसे पहले, उन्होंने AI को हजारों पिछले व्यंजनों और उनमें उपयोग की गई सटीक सामग्रियों वाली एक विशाल कुकबुक खिलाई। उन्होंने इसमें एक विशेषज्ञ द्वारा लिखे गए "नोट्स" भी जोड़े, जो समझाते थे कि वे सामग्रियां क्यों चुनी गईं। AI ने इस पैटर्न की नकल करना सीखा, यानी सामग्रियां सूचीबद्ध करना और "क्यों" वाले नोट्स लिखना, दोनों एक साथ सीखा।

  • चरण 2: स्वाद परीक्षण (Reinforcement Learning):
    केवल कुकबुक पढ़ना पर्याप्त नहीं है; आपको भोजन चखने की भी आवश्यकता होती है। इस चरण में, AI ने कई अलग-अलग सामग्रियों की सूचियाँ और स्पष्टीकरण उत्पन्न करने का प्रयास किया।

    • पुरस्कार प्रणाली: शोधकर्ता न्यायाधीशों के रूप में कार्य करते थे। यदि AI ने सही सामग्रियां चुनीं और एक अच्छा स्पष्टीकरण दिया, तो उसे एक "ट्रीट" (पुरस्कार) मिलता था। यदि उसने गलत सामग्रियां चुनीं या कोई अस्पष्ट बहाना दिया, तो उसे कोई ट्रीट नहीं मिलता था।
    • परिणाम: समय के साथ, AI ने न केवल सही सामग्रियां अनुमान लगाना सीखा, बल्कि उन्हें पूरी तरह से न्यायसंगत (justify) बनाना भी सीखा, जिससे सटीकता और स्पष्ट तर्क के बीच संतुलन बना।

4. परिणाम: एक बेहतर रसोई

शोधकर्ताओं ने हजारों व्यंजनों (ProgrammableWeb डेटासेट) के वास्तविक दुनिया के डेटाबेस का उपयोग करके अन्य स्मार्ट असिस्टेंट के मुकाबले WAR-R1 का परीक्षण किया।

  • सटीकता: WAR-R1 मौजूदा सर्वोत्तम तरीकों की तुलना में अधिक सटीक था, जिसने सही सामग्रियां खोजने की "हिट रेट" में 10.89% तक सुधार किया।
  • विश्वास: इसने लगातार उच्च गुणवत्ता वाले स्पष्टीकरण प्रदान किए जो इसके द्वारा चुनी गई सामग्रियों से मेल खाते थे।
  • दक्षता: भले ही यह अधिक काम करता है (अपने विकल्पों की व्याख्या करना), फिर भी यह व्यावहारिक रहने के लिए पर्याप्त तेज़ है, जो मानक कंप्यूटर हार्डवेयर पर चलता है।

सारांश

संक्षेप में, WAR-R1 एक नया टूल है जो डेवलपर्स को सही Web API खोजने में मदद करता है, क्योंकि यह:

  1. अनुकूलित (Adapt) होता है कि उन्हें वास्तव में कितने उपकरणों की आवश्यकता है (निश्चित संख्या नहीं थोपता)।
  2. स्पष्ट करता है (Explain) कि प्रत्येक उपकरण को क्यों चुना गया था।
  3. सीखता (Learn) है, जो उदाहरणों के अध्ययन और फीडबैक के साथ अभ्यास का एक संयोजन है।

यह एक 'ब्लैक-बॉक्स' अनुशंसा प्रणाली को एक पारदर्शी, सहायक साथी में बदल देता है जो कहता है, "यहाँ वह है जिसकी आपको आवश्यकता है, और यहाँ बताया गया है कि यह आपके प्रोजेक्ट के लिए बिल्कुल सही क्यों है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →