← नवीनतम पेपर
💬 NLP

KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning

KG-Reasoner एक एंड-टू-एंड फ्रेमवर्क है जो नॉलेज ग्राफ के भीतर गतिशील रूप से अन्वेषण (explore) और बैकट्रैक करने के लिए एक रीजनिंग LLM को प्रशिक्षित करने हेतु रीइन्फोर्समेंट लर्निंग का लाभ उठाता है, जिससे जटिल ज्ञान-गहन कार्यों पर बेहतर प्रदर्शन प्राप्त करने के लिए पारंपरिक मल्टी-हॉप रीजनिंग पाइपलाइनों की कठोरता और विखंडन को दूर किया जा सके।

मूल लेखक: Shuai Wang, Yinan Yu

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuai Wang, Yinan Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत ही पेचीदा रहस्य सुलझाने की कोशिश कर रहे हैं। सुराग एक जगह नहीं हैं; वे एक विशाल, धूल भरी लाइब्रेरी में बिखरे हुए हैं जहाँ हर किताब अदृश्य धागों से दूसरी किताबों से जुड़ी हुई है। यह लाइब्रेरी एक नॉलेज ग्राफ (Knowledge Graph - KG) है।

आपका काम एक जटिल प्रश्न का उत्तर खोजना है जैसे कि: "वह कौन सा समुद्र है जो उस देश की सीमा से सटा है जो हंगरी के साथ भूमि सीमा साझा करता है और यूरो (Euro) का उपयोग करता है?"

इसे हल करने के लिए, आपको करना होगा:

  1. हंगरी के पड़ोसियों को खोजना।
  2. यह देखना कि कौन सा पड़ोसी यूरो का उपयोग करता है।
  3. यह देखना कि क्या वह पड़ोसी समुद्र से सटा हुआ है।

वर्तमान में अधिकांश AI जासूस एक टूटी हुई असेंबली लाइन की तरह काम करते हैं। वे एक सवाल पूछते हैं, एक जवाब पाते हैं, रुकते हैं, फिर एक नया सवाल पूछते हैं, रुकते हैं, और फिर से ऐसा करते जाते हैं। यदि वे पहले चरण में गलती करते हैं, तो वे उस गलती पर ही आगे बढ़ते रहते हैं, और अंत तक पहुँचते-पहुँचते उनका पूरा उत्तर गलत हो जाता है। यह एक घर बनाने जैसा है जहाँ आप एक ईंट रखते हैं, फिर कॉफी पीने के लिए चले जाते हैं, वापस आते हैं और अगली ईंट रखते हैं, और भूल जाते हैं कि आप आखिर बना क्यों रहे थे।

KG-Reasoner एक नया तरह का जासूस है जो खेल बदल देता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. "एक बड़ा विचार" बनाम "रुकना और चलना" (The "One Big Thought" vs. The "Stop-and-Go")

रुकने और शुरू करने के बजाय, KG-Reasoner एक एकल, निरंतर "सोचने के सत्र" (thinking session) का उपयोग करता है।

कल्पना कीजिए कि एक जासूस एक शांत कमरे में बैठा है जिसके सामने दीवार पर एक विशाल नक्शा लगा है। हर बार किसी सड़क का नाम चेक करने के लिए सहकर्मी को फोन करने के बजाय, वह बस ज़ोर से सोचता है, नक्शे पर अपनी उंगली से रेखाओं का पीछा करता है, और आगे बढ़ता रहता है।

  • पुराना तरीका: "मुझे लगता है कि हंगरी की सीमा स्लोवाकिया से लगती है। सहकर्मी को कॉल करें। ठीक है, स्लोवाकिया यूरो का उपयोग करता है। सहकर्मी को कॉल करें। क्या स्लोवाकिया का कोई समुद्र है? नहीं। सहकर्मी को कॉल करें। ठीक है, मैं गलत था, मुझे स्लोवाकिया के बजाय स्लोवेनिया को देखना चाहिए..." (यह धीमा है और इसमें लय खोने का डर रहता है)।
  • KG-Reasoner का तरीका: जासूस सोचता है, "हंगरी की सीमा स्लोवाकिया से लगती है (कोई समुद्र नहीं)। रुको, मुझे पीछे मुड़कर देखना चाहिए। हंगरी की सीमा स्लोवेनिया से भी लगती है। स्लोवेनिया यूरो का उपयोग करता है और एड्रियाटिक सागर से सटा हुआ है। मिल गया!" यह सब एक ही प्रवाह में होता है।

2. "जादुई बैकट्रैकिंग" (The "Magic Backtracking" - द अनडू बटन)

पुराने AI के साथ सबसे बड़ी समस्या यह है कि यदि वे गलत मोड़ ले लेते हैं, तो उन्हें अक्सर अंत तक पता नहीं चलता है, और फिर वे गलत उत्तर देते हैं।

KG-Reasoner के पास एक सुपरपावर है: बैकट्रैकिंग (Backtracking)
इसे एक वीडियो गेम खेलने की तरह समझें। यदि आप एक बंद गुफा में चले जाते हैं, तो आप केवल आगे बढ़ने की उम्मीद में चलते नहीं रहते कि शायद कोई दरवाज़ा मिल जाए। आप "बैकट्रैक" (या अनडू बटन दबाते हैं) और पिछले चौराहे पर वापस जाते हैं ताकि दूसरा रास्ता आज़माया जा सके।

  • पेपर के उदाहरण में, AI ने पहले स्लोवाकिया (हंगरी के एक पड़ोसी) के बारे में सोचा। उसे एहसास हुआ कि स्लोवाकिया का कोई समुद्र नहीं है। घबराने या हार मानने के बजाय, उसने तुरंत कहा, "रुको, यह रास्ता बंद है," और नक्शे पर वापस जाकर स्लोवेनिया को देखा। वह यह सब स्वचालित रूप से और तुरंत करता है।

3. "इनाम के साथ प्रशिक्षण" (Training with "Rewards" - द वीडियो गेम कोच)

उन्होंने AI को यह कैसे सिखाया? उन्होंने इसे केवल एक पाठ्यपुस्तक नहीं दी। उन्होंने रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक एक विधि का उपयोग किया, जो एक कुत्ते को प्रशिक्षित करने या वीडियो गेम खेलने जैसा है।

  • खेल: AI रहस्य सुलझाने की कोशिश करता है।
  • कोच: जब भी AI सही रास्ता चुनता है, उसे एक "पॉइंट" (इनाम) मिलता है। यदि वह गलत रास्ता चुनता है, तो उसे कोई पॉइंट नहीं मिलता। यदि वह अपने उत्तर को सही प्रारूप (format) में देता है, तो उसे बोनस पॉइंट मिलते हैं।
  • परिणाम: हजारों प्रयासों के बाद, AI सीख जाता है, "हे, जब मैं किसी डेड एंड (dead end) पर पहुँचता हूँ, तो मुझे पीछे जाना चाहिए और किसी दूसरे पड़ोसी को आज़माना चाहिए।" यह एक अंधे व्यक्ति की तरह अंदाज़ा लगाने के बजाय एक स्मार्ट खोजकर्ता बनना सीख जाता है।

4. "स्मार्ट लेंस" (The "Smart Lens" - GNN)

कभी-कभी लाइब्रेरी इतनी बड़ी होती है कि जासूस बहुत अधिक किताबों से घबरा जाता है।
KG-Reasoner एक विशेष स्मार्ट लेंस (जिसे ग्राफ न्यूरल नेटवर्क या GNN कहा जाता है) का उपयोग करता है। जब जासूस किसी देश को देखता है, तो यह लेंस पास के सबसे महत्वपूर्ण सुरागों को हाइलाइट करता है और अप्रासंगिक चीज़ों को धुंधला कर देता है। यह AI को शोर से विचलित हुए बिना सही पड़ोसियों पर ध्यान केंद्रित करने में मदद करता है।

यह क्यों मायने रखता है?

  • गति और दक्षता: इसे एक समस्या को हल करने के लिए कंप्यूटर को सैकड़ों अलग-अलग कॉल करने की आवश्यकता नहीं है। यह इसे एक बार में ही कर देता है।
  • सटीकता: क्योंकि यह सोचते समय गलतियों को सुधारने के लिए "बैकट्रैक" कर सकता है, इसलिए यह कम गलतियाँ करता है।
  • वास्तविक दुनिया में उपयोग: यह चिकित्सा, कानून या विज्ञान जैसे जटिल प्रश्नों के लिए बहुत अच्छा है जहाँ सच्चाई खोजने के लिए आपको कई बिंदुओं को जोड़ने की आवश्यकता होती है।

संक्षेप में:
KG-Reasoner एक ऐसे जासूस के अपग्रेड जैसा है जो कागज के टुकड़ों पर नोट्स लिखता है और उन्हें खो देता है, से बदलकर एक ऐसे जासूस में बदल गया है जिसके पास एकदम सटीक याददाश्त, एक जादुई "अनडू" बटन और एक निरंतर, स्मार्ट बातचीत के माध्यम से पूरे रहस्य को सोचने की क्षमता है। यह एक भोंडे, चरण-दर-चरण प्रक्रिया को खोज की एक सहज, बुद्धिमान यात्रा में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →