← नवीनतम पेपर
💬 NLP

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

यह शोध पत्र एक्सप्लोर-ऑन-ग्राफ (EoG) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो पाथ-रिफाइंड रिवॉर्ड मॉडलिंग के साथ सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाता है ताकि लार्ज लैंग्वेज मॉडल्स को नॉलेज ग्राफ पर विविध रीजनिंग पाथ्स को स्वायत्त रूप से एक्सप्लोर करने के लिए प्रोत्साहित किया जा सके, जिससे पूर्व विधियों की सीमाओं को दूर किया जा सके और KGQA बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Explore-on-Graph (EoG)" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

🕵️‍♂️ समस्या: "सावधान पर्यटक" बनाम "साहसी खोजकर्ता"

कल्पल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसे सवाल पूछने में बहुत मज़ा आता है। यह सुनिश्चित करने के लिए कि वह मनगढ़ंत बातें न बनाए (hallucinate), आप उसे दुनिया का एक विशाल, विस्तृत नक्शा देते हैं जिसे नॉलेज ग्राफ (Knowledge Graph) कहा जाता है। यह नक्शा तथ्यों को जोड़ता है जैसे "Apple" → "is a company" → "Steve Jobs" → "lives in California."

पुराना तरीका (नियम-आधारित और नकल):
पिछले तरीके एक सख्त टूर गाइड की स्क्रिप्ट देने की तरह थे।

  • नियम-आधारित (Rule-Based): "आप केवल इन विशिष्ट पक्की राहों पर ही चल सकते हैं। यदि आप घास पर कदम रखते हैं, तो आप मुसीबत में पड़ जाएंगे।"
  • नकल-आधारित (Imitation-Based): "देखो मैं इस रास्ते पर तीन बार कैसे चलता हूँ, फिर ठीक वैसे ही मेरी नकल करो।"

खामी: ये रोबोट स्क्रिप्ट का पालन करने में बहुत अच्छे हैं, लेकिन अगर सवाल के लिए ऐसे रास्ते की आवश्यकता होती है जो उन्होंने पहले कभी नहीं देखा (जैसे जंगल के बीच से कोई छिपा हुआ रास्ता), तो वे अटक जाते हैं या गलत अनुमान लगाते हैं। वे बने-बनाए रास्तों से बाहर निकलने में डरते हैं। उनमें सामान्यीकरण (generalization) की कमी है।

🚀 समाधान: "एक्सप्लोर-ऑन-ग्राफ" (EoG)

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे Explore-on-Graph (EoG) कहा जाता है। एक सख्त टूर गाइड देने के बजाय, वे रोबोट को एक साहसी खोजकर्ता (adventurous explorer) में बदल देते हैं, जिसे खजाना (सही उत्तर) खोजने के लिए पुरस्कृत किया जाता है, भले ही इसके लिए उसे किसी अजीब या अज्ञात रास्ते से गुजरना पड़े।

वे इसे दो मुख्य चरणों में करते हैं:

चरण 1: "स्कूल" (सुपरवाइज्ड फाइन-ट्यूनिंग)

उसे जंगल में भेजने से पहले, वे रोबोट को एक क्लासरूम में रखते हैं।

  • क्या होता है: वे रोबोट को हजारों उदाहरण दिखाते हैं कि नक्शे का उपयोग करके समस्याओं को कैसे हल किया जाए, जिससे उसे चरण-दर-चरण सोचने (Chain of Thought) की शिक्षा मिलती है।
  • उपमा: यह एक छात्र को अकेले हाइकिंग पर भेजने से पहले उसे नक्शा पढ़ना और दिशा-सूचक यंत्र (compass) का उपयोग करना सिखाने जैसा है। वे बुनियादी बातें सीख लेते हैं ताकि वे तुरंत रास्ता न भटकें।

चरण 2: "गेम" (रीइन्फोर्समेंट लर्निंग)

यही असली जादू है। अब रोबोट को अपने आप नक्शे की खोज करने के लिए भेजा जाता है, लेकिन एक विशेष स्कोरिंग सिस्टम के साथ।

1. "खजाना" इनाम (Outcome Reward)

  • कैसे काम करता है: यदि रोबट अपनी यात्रा के अंत में सही उत्तर खोज लेता है, तो उसे एक बड़ा गोल्ड स्टार मिलता है। यदि वह रास्ता भटक जाता है या गलत उत्तर पाता है, तो उसे कुछ नहीं मिलता।
  • उपमा: यह एक वीडियो गेम की तरह है जहाँ आपको अंक तभी मिलते हैं जब आप अंतिम बॉस (final boss) तक पहुँचते हैं। यह रोबोट को सिखाता है कि उसे किस चीज़ को लक्ष्य बनाना है।

2. "रास्ता" इनाम (The Secret Sauce)

  • समस्या: कभी-कभी, एक रोबोट भाग्यशाली हो सकता है और एक पागलपन भरे, बेतुके रास्ते से सही उत्तर तक पहुँच सकता है। या, वह सही उत्तर खोजने से पहले घंटों तक चक्कर काट सकता है। यह अक्षम है।
  • समाधान: लेखकों ने दूसरा इनाम जोड़ा: द पाथ रिवॉर्ड (The Path Reward)
  • कैसे काम करता है: सिस्टम रोबोट की यात्रा की जाँच करता है। क्या उसने सही मोहल्लों से होकर रास्ता तय किया? क्या उसने तार्किक रूप से सही बिंदुओं को जोड़ा? भले ही उत्तर सही हो, लेकिन यदि रास्ता अव्यवized था या इसमें महत्वपूर्ण चरण छूट गए थे, तो रोबोट को छोटा इनाम मिलता है।
  • उपमा: एक GPS की कल्पना करें।
    • पुराना तरीका: "आप पहुँच गए! बहुत बढ़िया।" (भले ही आपने कार को दलदल में फँसा दिया हो)।
    • EoG का तरीका: "आप पहुँच गए! बहुत बढ़िया। लेकिन आपने दलदल के माध्यम से चक्कर लगाया। अगली बार, उस सुंदर रास्ते का प्रयास करें जो वास्तव में तर्कसंगत है।"
    • यह रोबोट को केवल भाग्यशाली अनुमान लगाने के बजाय कुशल, तार्किक और सार्थक रास्ते खोजने के लिए प्रोत्साहित करता है।

🌟 यह क्यों मायने रखता है: "आउट-ऑफ-डिस्ट्रीब्यूशन" (O.O.D.) सुपरपावर

EoG की सबसे बड़ी जीत आउट-ऑफ-डिस्ट्रीब्यूशन (O.O.D.) समस्याओं को संभालना है।

  • परिदृश्य: कल्पना कीजिए कि रोबोट ने केवल न्यूयॉर्क के नक्शे देखे हैं। यदि आप उससे टोक्यो की एक छिपी हुई गली के बारे में पूछते हैं, तो एक "नियम-आधारित" रोबोट जम जाएगा क्योंकि उसने वह सड़क कभी नहीं देखी है।
  • EoG रोबोट: क्योंकि इसे केवल रास्तों को रटने के बजाय खोजने और रास्तों को सत्यापित करने के लिए प्रशिक्षित किया गया था, यह टोक्यो के नक्शे को देख सकता है, तर्क को समझ सकता है और कह सकता है, "हे, भले ही मैं यहाँ कभी नहीं आया हूँ, मैं शहर के नियमों के आधार पर यह निष्कर्ष निकाल सकता हूँ कि यह सड़क उस दूसरी सड़क से जुड़ती है।"

🏆 परिणाम: दिग्गजों को मात देना

पेपर ने इसे पांच अलग-अलग "भूलभुलैया" (डेटासेट) पर टेस्ट किया और इसकी तुलना निम्नलिखित से की:

  1. अन्य स्मार्ट ओपन-सोर्स रोबोट्स।
  2. सबसे शक्तिशाली, महंगे "क्लोज्ड-सोर्स" रोबोट्स (जैसे GPT-5 और Gemini 2.5 Pro)।

परिणाम: EoG रोबोट, जो छोटे, ओपन-सोर्स मॉडल्स पर बना है, दिग्गजों को पछाड़ते हुए आगे निकल गया। इसने महंगे मॉडल्स से बेहतर जटिल पहेलियाँ सुलझाईं, जो यह साबित करता है कि रोबोट को केवल एक बड़ा दिमाग देने के बजाय उसे खोजने की क्षमता देना अधिक शक्तिशाली है।

🧠 एक वाक्य में सारांश

EoG AI को पुराने नक्शों की अंधाधुंध नकल करना बंद करने और एक साहसी खोजकर्ता की तरह कार्य करना सिखाता है, जो उसे न केवल खजाना खोजने के लिए, बल्कि वहां तक पहुँचने के लिए सबसे स्मार्ट और तार्किक रास्ता चुनने के लिए भी पुरस्कृत करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →