GraphDancer: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training
GraphDancer एक दो-चरणीय पोस्ट-ट्रेनिंग फ्रेमवर्क है जो एक ग्राफ-अवेयर करिकुलम का लाभ उठाता है ताकि छोटे भाषा मॉडलों को प्राकृतिक भाषा और फंक्शन कॉल्स के बीच अंतर-प्रवाह (interleaved) के माध्यम से विषम ग्राफों (heterogeneous graphs) पर प्रभावी ढंग से अन्वेषण और तर्क करने के लिए प्रशिक्षित किया जा सके, जिससे मजबूत क्रॉस-डोमेन सामान्यीकरण प्राप्त होता है जो बड़े बेसलाइन मॉडलों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ GRAPHDANCER पेपर का स्पष्टीकरण दिया गया है, जिसे रोज़मर्रा के उदाहरणों के साथ सरल अवधारणाओं में विभाजित किया गया है।
बड़ी तस्वीर: एक रोबोट को भूलभुलैया (Maze) में नेविगेट करना सिखाना
कल्प Imagine कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट (एक Large Language Model, या LLM) है जो किताबें पढ़ने से बहुत सारे तथ्य जानता है। हालाँकि, कुछ सबसे महत्वपूर्ण जानकारी किताबों में नहीं होती; यह कनेक्शनों के एक विशाल, जटिल मकड़ी के जाल (ग्राफ) में होती है। इस जाल में, चीजें विशिष्ट नियमों द्वारा जुड़ी होती हैं (जैसे, "लेखक A ने पुस्तक B लिखी," "पुस्तक B को प्रकाशक C द्वारा प्रकाशित किया गया था")।
समस्या यह है कि यह रोबोट टेक्स्ट पढ़ने में तो बहुत अच्छा है लेकिन इस मकड़ी के जाल में रास्ता खोजने में खराब है। यदि आप उससे कोई प्रश्न पूछते हैं, तो वह उत्तर का अनुमान लगा सकता है या जाल में खो सकता है।
GRAPHDANCER एक नया प्रशिक्षण तरीका (training method) है जो इस रोबोट को सही उत्तर खोजने के लिए, कदम-दर-कदम, इस मकड़ी के जाल के माध्यम से "नाचना" (dance) सिखाता है। यह दो मुख्य चरणों में यह काम करता है, जिसमें एक विशेष "प्रशिक्षण अनुसूची" (training schedule) का उपयोग किया जाता है जो रोबोट के बेहतर होने के साथ-साथ कठिन होता जाता है।
समस्या: मानक रोबोट क्यों विफल होते हैं
आमतौर पर, जब हम रोबोट से कोई प्रश्न पूछते हैं, तो वह समान शब्दों को खोजकर उत्तर खोजने की कोशिश करता है (जैसे सर्च इंजन का उपयोग करना)। लेकिन एक ग्राफ में, आप केवल "समान शब्दों" को नहीं खोज सकते। आपको विशिष्ट रास्तों का पालन करना पड़ता है।
- चुनौती: यह एक ऐसी लाइब्रेरी में होने जैसा है जहाँ किताबें शेल्फ पर नहीं बल्कि अदृश्य धागों से जुड़ी हुई हैं। उत्तर खोजने के लिए, रोबोट को:
- सही किताब चुननी होगी।
- एक विशिष्ट धागे का पीछा करते हुए पड़ोसी किताब तक पहुँचना होगा।
- उस पड़ोसी के एक विशिष्ट विवरण को पढ़ना होगा।
- इस प्रक्रिया को कई बार दोहराना होगा।
- विफलता: बिना प्रशिक्षण के, रोबोट अक्सर गलत धागा खींच लेता है, एक ऐसा कनेक्शन बना देता है जो मौजूद ही नहीं है, या बहुत जल्दी हार मान लेता है।
समाधान: दो चरणों वाली डांस क्लास
लेखकों ने इस समस्या को ठीक करने के लिए एक दो-चरणीय प्रशिक्षण कार्यक्रम बनाया है। इसे किसी को डांस सिखाने जैसा समझें।
चरण 1: "PPO" बूट कैंप (कदम सीखना)
- क्या होता है: रोबोट को ग्राफ में डाल दिया जाता है और उसे प्रश्नों के उत्तर देने के लिए कहा जाता है।
- कोच: एक सख्त कोच (PPO) उसकी हर हरकत पर नज़र रखता है।
- यदि रोबोट एक वैध चाल चलता है (सही फंक्शन कॉल करता है), तो उसे एक छोटा "अच्छा काम किया" पॉइंट मिलता है।
- यदि वह गलती करता है (ऐसा फंक्शन कॉल करता है जो मौजूद नहीं है) या गलत उत्तर देता है, तो उसे दंड (penalty) मिलता है।
- लक्ष्य: रोबोट बुनियादी नियम सीखता है: "कनेक्शनों की कल्पना मत करो," "स्कीमा (schema) का पालन करो," और "उत्तर मिलने तक चलते रहो।"
- उपमा: यह एक डांस इंस्ट्रक्टर की तरह है जो आपके फुटवर्क को सुधार रहा है। "नहीं, तुम यहाँ कदम नहीं रख सकते! तुम्हें पहले यहाँ कदम रखना होगा।"
चरण 2: "DPO" रिफाइनमेंट (स्टाइल सीखना)
- क्या होता है: अब रोबोट बुनियादी कदम सीखने में अच्छा है, लेकिन शायद वह अनाड़ी है या बहुत अधिक कदम ले रहा है।
- कोच: एक अलग कोच (DPO) रोबोट द्वारा एक ही समस्या को हल करने के दो अलग-अलग प्रयासों को देखता है।
- प्रयास A: रोबोट ने 3 स्टेप्स में उत्तर खोज लिया, वैध चालें चलीं, और सही उत्तर दिया।
- प्रयास B: रोबोट ने 10 स्टेप्स में उत्तर खोजा, कुछ अवैध चालें चलीं, लेकिन अंततः सही उत्तर दिया।
- सबक: कोच रोबोट को बताता है, "मुझे प्रयास A पसंद है। अगली बार, तेज़ और साफ (clean) बनने की कोशिश करें।"
- उपमा: यह एक डांस जज की तरह है जो दो प्रदर्शनों की तुलना करता है। दोनों डांसरों ने रूटीन पूरा किया, लेकिन जज उस डांसर को चुनता है जो अधिक सहज (smooth) था और डगमगाया नहीं, जिससे डांसर को अधिक कुशल (efficient) बनना सिखाया जाता है।
गुप्त नुस्खा: "ग्राफ-अवेयर" करिकुलम (Curriculum)
इस पेपर का सबसे अनूठा हिस्सा यह है कि वे इस प्रशिक्षण को कैसे व्यवस्थित करते हैं। वे केवल रोबोट को रैंडम सवाल नहीं देते। वे पथ की जटिलता (complexity of the path) के आधार पर एक करिकुलम (पाठ योजना) का उपयोग करते हैं।
- आसान स्तर: उत्तर केवल एक कदम दूर है। (जैसे, "यह पुस्तक किसने लिखी?")
- मध्यम स्तर: इसके लिए एक पड़ोसी को देखने की आवश्यकता है। (जैसे, "इस पुस्तक का प्रकाशक कौन है जो इस लेखक ने लिखी है?")
- कठिन स्तर: इसके लिए वेब के माध्यम से कई बार कूदने की आवश्यकता है। (जैसे, "उस व्यक्ति का मित्र कौन है जिसने उस पेपर के लेखक द्वारा लिखी गई पुस्तक की समीक्षा की है?")
रणनीति:
- आसान से शुरू करें: रोबोट समतल ज़मीन पर चलना सीखता है।
- कठिन होता जाए: धीरे-धीरे, रोबोट को ऐसे प्रश्न दिए जाते हैं जिनमें अंतराल (gaps) के ऊपर से कूदने और पहाड़ियों पर चढ़ने की आवश्यकता होती है।
- यह क्यों काम करता है: यदि आप किसी बच्चे को पहले दिन ही मैराथन दौड़ना सिखाने की कोशिश करेंगे, तो वह असफल हो जाएगा। यदि आप उन्हें पहले चलना, फिर जॉगिंग करना और फिर दौड़ना सिखाते हैं, तो वे सफल होते हैं। GRAPHDANCER दोनों चरणों (Boot Camp और Refinement) के लिए इसी "आसान-से-कठिन" शेड्यूल का उपयोग करता है।
परिणाम: छोटा रोबोट, बड़ी जीत
शोधकर्ताओं ने इसका परीक्षण एक 3-बिलियन-पैरामीटर वाले मॉडल पर किया (जो AI की दुनिया में अपेक्षाकृत छोटा और "लाइटवेट" है)।
- परीक्षण: उन्होंने रोबोट को केवल Academic डेटा (जैसे शोध पत्र और लेखक) पर प्रशिक्षित किया।
- आश्चर्य: फिर उन्होंने इसका परीक्षण पूरी तरह से अलग दुनिया में किया जिसे उसने पहले कभी नहीं देखा था: E-commerce (शॉपिंग), Literature (किताबें), Healthcare (मेडिकल), और Legal (कानून)।
- परिणाम: भले ही यह एक छोटा रोबोट था जिसे केवल एक विषय पर प्रशिक्षित किया गया था, इसने बहुत बड़े और अधिक शक्तिशाली रोबोटों से बेहतर प्रदर्शन किया जिन्हें केवल "प्रॉम्प्ट" (अच्छे से पूछना) किया गया था।
- क्यों? इसने केवल तथ्यों को याद नहीं किया; इसने ग्राफ में नेविगेट करने का कौशल सीखा। इसने अन्वेषण करना, अपने काम की जाँच करना और नियमों का पालन करना सीखा, जिसे यह किसी भी नए "विश्व" में लागू कर सकता है।
सारांश
GRAPHDANCER एक ऐसा तरीका है जो AI मॉडल्स को जटिल, जुड़े हुए डेटा स्ट्रक्चर को एक्सप्लोर करना सिखाता है:
- उन्हें चरणों में प्रशिक्षित करके: पहले नियम सीखना, फिर कुशल बनना।
- एक स्मार्ट शेड्यूल का उपयोग करके: आसान पहेलियों से शुरू करना और धीरे-धीरे कठिनाई बढ़ाना।
- सामान्यीकरण (Generalizing): यह साबित करना कि यदि आप एक मॉडल को ग्राफ के माध्यम से सोचने का तरीका सिखाते हैं, तो वह उन क्षेत्रों में भी समस्याओं को हल कर सकता है जिन्हें उसने पहले कभी नहीं देखा है, भले ही वह मॉडल स्वयं छोटा हो।
पेपर निष्कर्ष निकालता है कि ग्राफ-आधारित तर्क (graph-based reasoning) के लिए, केवल रोबोट को बड़ा या अधिक स्मार्ट बनाने के बजाय व्यवहार को प्रशिक्षित करना (रोबोट को डांस करना सिखाना) अधिक महत्वपूर्ण है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।