KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning
यह शोध पत्र KG-Hopper को पेश करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो कॉम्पैक्ट 7B ओपन-सोर्स LLMs को एक ही इन्फरेंस राउंड में एकीकृत मल्टी-हॉप नॉलेज ग्राफ रीजनिंग करने में सक्षम बनाता है, जो कई बेंचमार्क पर बड़े अनुक्रमिक (sequential) सिस्टमों और प्रोप्राइटरी मॉडल्स से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ KG-Hopper पेपर का सरल भाषा, रचनात्मक उपमाओं और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी समस्या: "कदम-दर-कदम" वाला जाल (The "Step-by-Step" Trap)
कल्पना कीजिए कि आप एक जटिल रहस्य सुलझाने की कोशिश कर रहे हैं, जैसे कि "ट्रॉपिकल स्टॉर्म फैबियो (Tropical Storm Fabio) द्वारा प्रभावित क्षेत्र का आधिकारिक फूल" खोजना।
पुराना तरीका (पारंपरिक AI):
पारंपरिक AI को एक भुलक्कड़ या अनाड़ी जासूस के रूप में सोचें जिसे हर एक सुराग के लिए एक फॉर्म भरना पड़ता है।
- पहले, वह पूछता है, "फैबियो कौन था?" फॉर्म कहता है "हवाई (Hawaii)"।
- फिर, वह एक नया फॉर्म भरता है: "हवाई का फूल क्या है?"
- यदि वह चरण 1 में एक छोटी सी गलती करता है (मान लीजिए वह सोचता है कि फैबियो मेक्सिको से टकराया था), तो पूरा अन्वेषण ढह जाता है। वह चरण 1 को ठीक करने के लिए वापस नहीं जा सकता क्योंकि वह पहले ही चरण 2 पर आगे बढ़ चुका है।
- इसे एरर कैस्केडिंग (Error Cascading) कहा जाता है। एक छोटी सी चूक पूरे उत्तर को बर्बाद कर देती है। साथ ही, यदि डेटाबेस में जानकारी का कोई हिस्सा गायब है (जैसे फूल का नाम), तो जासूस या तो हार मान लेता है या गलत अनुमान लगा देता है।
नया समाधान: KG-Hopper
इस पेपर के लेखकों ने KG-Hopper बनाया है। इसे एक जासूस के रूप में न देखें जो फॉर्म भर रहा है, बल्कि एक अति-बुद्धिमान जासूस के रूप में देखें जो एक लंबे, निरंतर मोनोलॉग (स्वगत भाषण) में ज़ोर से सोचता है।
हर सुराग के बाद रुकने के बजाय, KG-Hopper एक "रीज़निंग LLM" (एक स्मार्ट कंप्यूटर दिमाग) है जो सब कुछ सोचने के एक ही दौर (single round of thinking) में करता है।
"सोचने" का चरण (The "Thinking" Phase)
कल्पना कीजिए कि AI के पास एक विशेष "सोचने वाली टोपी" (Thinking Hat) है (अंतिम उत्तर देने से पहले का एक चरण)। इस टोपी को पहनते समय, वह यह कर सकता है:
- लाइब्रेरी की खोज करना: वह नॉलेज ग्राफ (तथ्यों का एक विशाल डिजिटल मानचित्र) में तथ्यों को खोज सकता है।
- अपनी राय बदलना: यदि वह "मेक्सिको" के लिए खोज करता है और उसे एहसास होता है, "रुको, यह गलत है, फैबियो हवाई से टकराया था," तो वह तुरंत पीछे हट सकता है और हवाई के लिए खोज कर सकता है।
- कड़ियों को जोड़ना: वह केवल अगले कदम को देखने के बजाय पूरी तस्वीर को एक साथ देखता है।
उन्होंने AI को कैसे सिखाया (प्रशिक्षण/Training)
आप केवल एक बुद्धिमान AI को यह नहीं कह सकते कि "बेहतर बनो।" आपको इसे एक वीडियो गेम के किरदार के स्तर बढ़ाने (leveling up) की तरह प्रशिक्षित करना होगा। लेखकों ने रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - RL) नामक विधि का उपयोग किया।
यहाँ बताया गया है कि उन्होंने KG-Hopper को कैसे प्रशिक्षित किया:
कोल्ड स्टार्ट (ट्यूटोरियल):
सबसे पहले, उन्होंने AI को 500 उदाहरण दिखाए कि अपने "सर्च टूल" का सही उपयोग कैसे किया जाए। यह एक बच्चे को निबंध लिखने के लिए कहने से पहले पेंसिल पकड़ना सिखाने जैसा है। इससे AI को तथ्य खोजने का एक बुनियादी विचार मिल गया।वीडियो गेम मोड (Reinforcement Learning):
एक बार जब AI बुनियादी बातें जान गया, तो उन्होंने इसे एक खेल खेलने दिया जहाँ सही काम करने पर उसे पॉइंट्स (अंक) मिलते हैं। उन्होंने चार प्रकार के पॉइंट्स के साथ एक "स्कोरकार्ड" बनाया:
- सर्च पॉइंट्स: "तथ्य खोजने के लिए शाबाश!" (लेकिन बहुत अधिक नहीं, वरना आप आलसी हो जाएंगे)।
- फॉर्मेट पॉइंट्स: "अपने विचारों को व्यवस्थित रखने के लिए शाबाश।"
- रीज़निंग पॉइंट्स: "तार्किक रूप से सोचने के लिए शाबाश, भले ही आपको अभी सही उत्तर न मिला हो।" (यह सबसे महत्वपूर्ण हिस्सा है—यह केवल परिणाम के लिए नहीं, बल्कि प्रक्रिया को पुरस्कृत करता है)।
- आंसर पॉइंट्स: "आपको सही उत्तर मिल गया!"
यदि AI गलती करता है, तो उसके अंक कट जाते हैं। यदि वह एक कठिन रास्ता खोज लेता है, तो उसे बोनस मिलता है। समय के साथ, AI अपने स्कोर को अधिकतम करने के तरीके से "सोचना" सीख जाता है।
यह एक बड़ी बात क्यों है?
पेपर की तुलना अन्य प्रणालियों से की गई और इसमें कुछ आश्चर्यजनक परिणाम मिले:
- छोटा लेकिन शक्तिशाली: KG-Hopper एक अपेक्षाकृत छोटा दिमाग (7-बिलियन पैरामीटर मॉडल) उपयोग करता है। आमतौर पर, इन कठिन पहेलियों को हल करने के लिए आपको एक विशाल, महंगे दिमाग (70 बिलियन पैरामीटर) की आवश्यकता होती है। KG-Hopper ने साबित कर दिया कि एक छोटा, ओपन-सोर्स दिमाग दिग्गजों को हरा सकता है यदि उसे पता हो कि कैसे सोचना है।
- बड़े दिग्गजों को मात देना: इसने इन विशिष्ट तर्क पहेलियों पर कुछ सबसे प्रसिद्ध, महंगे व्यावसायिक मॉडलों (जैसे GPT-4o-mini) से बेहतर प्रदर्शन किया।
- "हैलुसिनेशन" (भ्रम) का अंत: क्योंकि यह उत्तर देने से पहले नॉलेज ग्राफ में तथ्यों की जाँच करता है, इसलिए यह कम झूठ बोलता है।
"एक-राउंड" का जादू (The "One-Round" Magic)
सबसे शानदार बात इसकी गति और दक्षता है।
- पुराना तरीका: AI एक सवाल हल करने के लिए 5 बार कंप्यूटर को कॉल करता है (खोज -> सोच -> खोज -> सोच -> उत्तर)। यह धीमा और महंगा है।
- KG-Hopper: AI एक ही बार में कंप्यूटर को कॉल करता है। उस एक कॉल के भीतर, वह सारी खोज, सोच, बैकट्रैकिंग और उत्तर देने का काम करता है। यह रसोई में पाँच अलग-अलग चक्कर लगाने के बजाय एक ही बार में पूरा भोजन ऑर्डर करने जैसा है।
सारांश उपमा
- पारंपरिक AI एक रिले रेस टीम की तरह है जहाँ एक धावक दूसरे को बैटन (डंडा) सौंपता है। यदि पहला धावक बैटन गिरा देता है, तो दौड़ खत्म हो जाती है।
- KG- Hopper एक मैराथन धावक की तरह है जो पूरी दौड़ को अपने दिमाग में लेकर चलता है। यदि वह लड़खड़ाता है, तो वह उठता है, अपनी चाल को समायोजित करता है, और बिना दौड़ रोके आगे बढ़ता रहता है।
परिणाम: एक संक्षिप्त, ओपन और मुफ्त AI जो जटिल तर्क पहेलियों को एक ही बार में "सोचकर" हल कर सकता है, जिससे यह कई वर्तमान दिग्गजों की तुलना में अधिक स्मार्ट, तेज़ और विश्वसनीय बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।