LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation
LoongReflect एक प्रशिक्षण ढांचा है जो प्रतिबिंब (reflection) को एक मेमोरी-कंट्रोल पॉलिसी के रूप में स्वरूपित करके और स्थानीय चिंतन संबंधी निर्णयों को वैश्विक कार्य परिणामों के साथ संरेखित करने के लिए एक डुअल-चैनल डिस्टिलेशन तंत्र का उपयोग करके सर्च एजेंटों में लॉन्ग-होरिज़न रीजनिंग को बढ़ाता है, जिससे यह आउटकम-आधारित सुदृढीकरण लर्निंग (reinforcement learning) की स्पार्स सुपरविजन चुनौतियों पर विजय प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, बहुत ही उत्सुक रोबोट को एक विशाल, बहु-चरणीय रहस्य सुलझाने के लिए सिखा रहे हैं। यह रोबोट, जो एक लार्ज लैंग्वेज मॉडल (LLM) द्वारा संचालित है, एक जासूस की तरह है जो लाखों किताबें पढ़ सकता है, सवाल पूछ सकता है, और सुरागों को जोड़कर एक पहेली सुलझा सकता है। लेकिन यहाँ एक पेच है: जब जासूस अटक जाता है या किसी गलत रास्ते पर निकल पड़ता है, तो उसे अक्सर तब तक एहसास नहीं होता जब तक कि वह बकवास का एक पूरा अध्याय न लिख दे। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "लॉन्ग-होरिज़न रीजनिंग" (long-horizon reasoning) कहा जाता है। यह एक लंबी यात्रा की योजना बनाने की क्षमता है, न कि केवल एक एकल कदम उठाने की।
सबसे बड़ी समस्या यह सिखाने में है कि रोबोट को यह कहने के लिए कैसे प्रेरित किया जाए, "रुको, मैं गलत दिशा में जा रहा हूँ, चलो वापस चलते हैं," जो कि अविश्वसनीय रूप से कठिन है। आमतौर पर, रोबोट को कहानी के बिल्कुल अंत में एक ग्रेड मिलता है: "आपने रहस्य सुलझा लिया!" या "आप असफल रहे।" यदि रोबोट ने तीन घंटे पहले कोई गलती की थी, तो उसे पता भी नहीं चलेगा कि वह विशिष्ट क्षण ही समस्या का कारण था। यह एक छात्र की तरह है जिसे अंतिम परीक्षा में कम अंक मिलते हैं और उसे पता ही नहीं चलता कि किस होमवर्क असाइनमेंट के कारण उसकी परेशानी हुई। यह शोध पत्र ठीक इसी हताशा को संबोधित करता है: हम एक AI को अपना काम देखने, अपनी गलतियों को पहचानने और पूरे प्रोजेक्ट को बर्बाद करने से पहले "अनडू" (undo) बटन दबाने के लिए कैसे सिखाएं?
मिलिए LoongReflect से, एक नया ट्रेनिंग फ्रेमवर्क जिसे AI एजेंटों को आत्म-सुधार करने वाले जासूसों में बदलने के लिए डिज़ाइन किया गया है। बीजिंग यूनिवर्सिटी के शोधकर्ताओं ने महसूस किया कि जटिल पहेलियों को सुलझाने के लिए AI को केवल "फिर से प्रयास करें" बटन से अधिक की आवश्यकता है; इसे अपने इतिहास को रोकने, सोचने और फिर से लिखने के एक संरचित तरीके की आवश्यकता है।
AI की विचार प्रक्रिया को एक सीधी रेखा के रूप में नहीं, बल्कि एक विशाल, प्रतिवर्ती वृक्ष (reversible tree) के रूप में सोचें। जैसे-जैसे AI एक समस्या का अन्वेषण करता है, यह शाखाएँ विकसित करता है। अधिकांश समय, यह एक शाखा पर चलता है, तथ्य इकट्ठा करता है। लेकिन कभी-कभी, यह एक मृत अंत (dead end) पर पहुँच जाता है या उसे ऐसा सुराग मिलता है जो मेल नहीं खाता। अतीत में, AI बस चलता रहता, उस गलत सुराग को अपने साथ खींचता रहता जब तक कि पूरी कहानी ढह नहीं जाती। LoongReflect AI को दो महाशक्तियाँ देता है:
लेकिन आप एक AI को यह कैसे सिखाते हैं? शोध पत्र एक पेचीदा "लर्निंग सिग्नल डिलेमा" (learning signal dilemma) की पहचान करता है। यदि आप केवल AI को तभी पुरस्कृत करते हैं जब वह अंतिम उत्तर सही पाता है, तो उसे 'रिफ्लेक्शन' (reflection) करने के तरीके पर बहुत कम मदद मिलती है। यह कार चलाने सीखने जैसा है जहाँ आपको केवल तब हॉर्न सुनाई देता है जब आप दुर्घटनाग्रस्त हो जाते हैं। AI को यह नहीं पता चलता कि दुर्घटना का कारण मोड़ था, गति थी, या बारिश थी।
इसे ठीक करने के लिए, लेखकों ने एक दो-चैनल प्रशिक्षण प्रणाली (two-channel training system) बनाई है, जो दो कोचों के एक साथ काम करने जैसा है:
फास्ट कोच (द टीचर): यह कोच AI का एक "प्रिविलेज्ड" (privileged) संस्करण है जो छात्र के कदम उठाने से पहले संभावनाओं के पूरे वृक्ष और अंतिम परिणाम को देख सकता है। यह छात्र की स्थानीय शाखा को देखता है और कहता है, "हे, तुम यहाँ एक महत्वपूर्ण सुराग को अनदेखा कर रहे हो," या "तुम्हें अभी बैकट्रैक करना चाहिए।" महत्वपूर्ण बात यह है कि यह कोच अंतिम उत्तर नहीं बताता (ताकि छात्र तर्क प्रक्रिया को बायपास न कर सके); यह केवल कैसे सोचना है और कब पीछे हटना है इस पर संकेत देता है। यह AI को उसके रिफ्लेक्शन कौशल पर सघन, तत्काल फीडबैक प्रदान करता है।
स्लो कोच (द आउटकम): यह कोच यात्रा के बिल्कुल अंत तक प्रतीक्षा करता है। यह अंतिम परिणाम को देखता है और कहता है, "पहेली सुलझाने के लिए शानदार काम!" या "आप असफल रहे।" यह अंतिम स्कोर का उपयोग यह सुनिश्चित करने के लिए करता है कि AI के स्थानीय निर्णय वास्तव में वास्तविक दुनिया में सफलता की ओर ले जाएं।
जादू तब होता है जब ये दोनों कोच समन्वय करते हैं। "फास्ट कोच" स्थानीय तर्क के आधार पर एक दिशा का सुझाव देता है, और "स्लो कोच" यह जाँचता है कि क्या वह दिशा वास्तव में जीत की ओर ले जाती है। यदि वे असहमत हैं, तो सिस्टम फास्ट कोच के सुझाव को समायोजित करने के लिए एक चतुर "लुक-अहेड" (look-ahead) पद्धति का उपयोग करता है ताकि वह AI को गलत रास्ते पर न ले जाए। यह एक GPS की तरह है जो शॉर्टकट का सुझाव देता है, लेकिन एक ट्रैफिक कंट्रोलर यह जाँचता है कि क्या वह शॉर्टकट वास्तव में आपको आपके गंतव्य तक तेज़ी से पहुँचाता है।
परिणाम उत्साहजनक हैं। शोधकर्ताओं ने कठिन बहु-चरणीय प्रश्नों (जैसे कई दस्तावेजों में छिपे विशिष्ट तथ्य को खोजना) और गणित की समस्याओं पर LoongReflect का परीक्षण किया। उन्होंने पाया कि इस पद्धति से प्रशिक्षित एजेंट अन्य शीर्ष-स्तरीय AI एजेंटों से लगातार बेहतर प्रदर्शन करते हैं। उदाहरण के लिए, एक 3-बिलियन पैरामीटर वाले मॉडल पर, औसत स्कोर लगभग 31% से बढ़कर 46% से अधिक हो गया, जो एक महत्वपूर्ण उछाल है। इससे भी अधिक प्रभावशाली बात यह है कि AI ने जो कौशल इन रीडिंग कार्यों पर सीखा, वह उन गणितीय समस्याओं में भी स्थानांतरित हुआ जिन्हें उसने पहले कभी नहीं देखा था, जिससे पता चलता है कि उसने वास्तव में रिफ्लेक्शन की कला सीखी है, न कि केवल उत्तरों को रटना।
संक्षेप में, LoongReflect यह सुझाव देता है कि AI एजेंटों को रुकने, अपनी गलतियों का निदान करने और अपनी गलतियों को स्पष्ट रूप से सुधारने का एक संरचित तरीका देकर, हम उन्हें उन जटिल, लॉन्ग-होरिज़न समस्याओं को हल करने में बहुत बेहतर बना सकते हैं जो वर्तमान में उन्हें उलझा देती हैं। यह AI को केवल चलते रहने वाले रोबोट से बदलकर एक ऐसे जासूस में बदल देता है जो जानता है कि कब रुकना है, सोचना है और एक अलग रास्ता आज़माना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।