SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
SAKE एक सुदृढीकरण शिक्षण (reinforcement learning) द्वारा संचालित एजेंटिक फ्रेमवर्क है जो छोटे, ओपन-वेट LLMs को एंटिटी एक्सट्रैक्शन, ग्रुप फ़िल्टरिंग और एसोसिएटिव रीजनिंग के लिए स्ट्रक्चर्ड नॉलेज ग्राफ टूल्स को स्वायत्त रूप से इंटरलीव करके जटिल ज्ञान एक्सट्रपलेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम बनाता है, जिससे वे बड़े मॉडलों से भी बेहतर प्रदर्शन करते हुए टोकन के उपयोग को काफी कम कर देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत ही पेचीदा रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास इंटरनेट के बजाय केवल सुरागों की एक छोटी, थोड़ी क्षतिग्रस्त नोटबुक (एक नॉलेज ग्राफ) है। सुराग वहां मौजूद हैं, लेकिन वे बिंदुओं को पूरी तरह से जोड़ नहीं पाते हैं। आपको उन पैटर्न के आधार पर स्मार्ट अनुमान लगाकर उत्तर का पता लगाने की आवश्यकता है जो आप देखते हैं।
यह बिल्कुल वही समस्या है जिसे SAKE नामक पेपर आर्टिफिशियल इंटेलिजेंस (AI) के लिए हल करने की कोशिश कर रहा है।
यहाँ SAKE की कहानी है, जिसे सरल रूप में समझाया गया है:
समस्या: "अधूरी लाइब्रेरी"
कल्पना कीजिए कि एक AI एक चिकित्सा प्रश्न का उत्तर देने की कोशिश कर रहा है जैसे: "क्या मेलाटोनिन अनिद्रा (insomnia) के इलाज में मदद कर सकता है?"
AI अपनी "लाइब्रेरी" (तथ्यों के डेटाबेस) को देखता है। उसे पता चलता है कि "मेलाटोनिन" एक हार्मोन है और "अनिद्रा" एक मानसिक विकार है। लेकिन लाइब्रेरी में यह सीधा तथ्य नहीं है कि "हार्मोन मानसिक विकारों का इलाज करते हैं।"
पुराने AI मॉडल या तो:
- भ्रमित हो जाते हैं (Hallucinate): वे एक फर्जी तथ्य बना लेते हैं क्योंकि वे गलत होते हुए भी आत्मविश्वासी होते हैं।
- हार मान लेते हैं: वे कहते हैं "मुझे नहीं पता" क्योंकि वह सटीक वाक्य किताब में नहीं है।
- जरूरत से ज्यादा सोचते हैं (Overthink): वे पूरी लाइब्रेरी को हजारों बार पढ़ने की कोशिश करते हैं, जो धीमा और महंगा है।
समाधान: SAKE (स्मार्ट डिटेक्टिव)
लेखकों ने SAKE (स्ट्रक्चर्ड एजेंटिक नॉलेज एक्सट्रपलेशन) बनाया है। SAKE को केवल एक ऐसे रोबोट के रूप में न सोचें जो केवल पढ़ता है, बल्कि एक विशेष उपकरणों वाले जासूस के रूप में देखें जो अनुभव और त्रुटियों (Reinforcement Learning) के माध्यम से सीखता है।
SAKE केवल पढ़ता नहीं है; यह कार्य करता है। रहस्य को सुलझाने के लिए यह तीन-चरणीय "जासूसी दिनचर्या" का पालन करता है:
चरण 1: सही सुराग चुनना (एंटिटी एक्सट्रैक्शन)
जासूस प्रश्न को देखता है और मुख्य शब्दों को चुनता है।
- उपमा: पूरी किताब पढ़ने के बजाय, जासूस "मेलाटोनिन" और "अनिद्रा" को हाइलाइट करता है और उन्हें एक स्टिकी नोट पर रख देता है।
चरण 2: पड़ोस ढूंढना (ग्रुप कंस्ट्रक्शन)
जासूस उन स्टिकी नोट्स को लेता है और एक टूल से पूछता है: "इन शब्दों के पड़ोसी लाइब्रेरी में कौन हैं?"
- उपमा: टूल कहता है, "खैर, 'मेलाटोनिन' एक प्रकार का हार्मोन है। और 'अनिद्रा' एक प्रकार का मानसिक विकार है।"
- जासूस के पास अब संबंधित अवधारणाओं का एक समूह है: {मेलाटोनिन, हार्मोन} और {अनिद्रा, मानसिक विकार}।
चरण 3: बिंदुओं को जोड़ना (एसोसिएटिव रीजनिंग)
यही जादू वाला हिस्सा है। जासूस लाइब्रेरी को फिर से देखता है, लेकिन इस बार समूहों के बीच संबंध तलाश रहा है।
- खोज: लाइब्रेरी कहती है: "हार्मोन मानसिक विकारों का इलाज करते हैं।"
- एक्सट्रपलेशन: जासूस को एहसास होता है: "आहा! यदि हार्मोन मानसिक विकारों का इलाज करते हैं, और मेलाटोनिन एक हार्मोन है और अनिद्रा एक मानसिक विकार है... तो मेलाटोनिन अनिद्रा का इलाज कर सकता है!"
- AI ने दो मौजूदा तथ्यों को जोड़कर एक नया तथ्य बना लिया है, भले ही वह विशिष्ट तथ्य वहां लिखा न गया हो।
यह कैसे सीखता है? (ट्रेनिंग कैंप)
आप पूछ सकते हैं, "AI इतना अच्छा जासूस कैसे बनता है?"
लेखकों ने इसे हजारों उदाहरण दिखाकर नहीं सिखाया (जो धीमा और महंगा है)। इसके बजाय, उन्होंने रिनफोर्समेंट लर्निंग (जैसे इनाम देकर कुत्ते को प्रशिक्षित करना) का उपयोग किया।
- खेल: AI एक खेल खेलता है जहाँ वह सवालों को हल करने की कोशिश करता है।
- इनाम: यदि वह उत्तर सही पाता है, तो उसे एक "इनाम" (उच्च स्कोर) मिलता है। यदि वह चरणों में गलती करता है या गलत उत्तर देता है, तो उसे कोई इनाम नहीं मिलता।
- पाठ्यक्रम (Curriculum): शुरू में, AI केवल नियमों का पालन करना सीखता है (सही टूल्स का उपयोग करना)। बाद में, वह उत्तर सही पाने के लिए सीखता है।
- परिणाम: हजारों प्रयासों के माध्यम से, AI समझ जाता है: "हे, अगर मैं बेकार के सुरागों को हटा दूँ और सही समूहों पर ध्यान केंद्रित करूँ, तो मुझे अधिक इनाम मिलेंगे!"
यह एक बड़ी बात क्यों है?
1. यह अत्यंत कुशल है ("एक पन्ने" बनाम "पूरी किताब")
पुराने तरीके (जैसे GIVE या ToG) ऐसे हैं जैसे किसी इंसान को पूरी लाइब्रेरी पढ़ने, उसका सारांश लिखने, फिर से पढ़ने और फिर से सारांश लिखने के लिए कहना। वे बहुत अधिक कंप्यूटर पावर (टोकन) का उपयोग करते हैं।
SAKE एक ऐसे जासूस की तरह है जो सीधे सही शेल्फ पर जाता है, प्रासंगिक किताब उठाता है, और केस सुलझा लेता है।
- आंकड़ा: SAKE पिछले सर्वोत्तम तरीकों की तुलना में 90% कम कंप्यूटर पावर का उपयोग करता है। यह तेज़ और सस्ता है।
2. छोटे मॉडल बड़े मॉडलों से अधिक स्मार्ट हो सकते हैं
आमतौर पर, कठिन समस्याओं को हल करने के लिए आपको एक विशाल, महंगे AI मस्तिष्क की आवश्यकता होती है। SAKE ने साबित किया कि इस "डिटेक्टिव मेथड" के साथ प्रशिक्षित एक छोटा, सस्ता AI (Qwen2.5-7B), चिकित्सा और सामान्य ज्ञान के प्रश्नों पर एक बहुत बड़े, प्रसिद्ध AI (GPT-3.5-Turbo) को हरा सकता है।
- रूपक: यह एक कुशल शतरंज खिलाड़ी द्वारा एक विशाल, अप्रशिक्षित कंप्यूटर को हराने जैसा है क्योंकि छोटा खिलाड़ी चालों को नहीं, बल्कि रणनीति को जानता है।
3. यह तब भी काम करता है जब जानकारी गायब हो
वास्तविक दुनिया अव्यवस्थित है। हमारे पास शायद ही कभी कोई सटीक डेटाबेस होता है। SAKE विशेष रूप से तब के लिए डिज़ाइन किया गया है जब जानकारी गायब हो। यह सीखता है कि यह कहना, "मुझे उत्तर नहीं दिख रहा है, लेकिन मैं अनुमान लगा सकता हूँ कि चीजें कैसे काम करती हैं" के आधार पर कैसे काम किया जाए।
सारांश
SAKE AI को मानव जासूस की तरह सोचने के लिए सिखाने का एक नया तरीका है। तथ्यों को रटने के बजाय, यह सुराग खोजने, उन्हें समूहों में रखने और समस्याओं को हल करने के लिए स्मार्ट कनेक्शन बनाने के लिए टूल्स का उपयोग करना सीखता है। यह इसे कुशलतापूर्वक, सस्ते में और आश्चर्यजनक रूप से बेहतर तरीके से करता है, यहाँ तक कि छोटे कंप्यूटरों के साथ भी।
संक्षेप में: SAKE AI को केवल "पढ़ना" बंद करने और "बिंदुओं को जोड़ना" शुरू करने के लिए सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।