ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
यह शोध पत्र ABSeeker को प्रस्तुत करता है, जो एक नवीन 'आंसर-बैकट्रैक्ड क्रेडिट असाइनमेंट' (ABC) फ्रेमवर्क के माध्यम से प्रशिक्षित एक लॉन्ग-होरिज़न सर्च एजेंट है, जो विरल ट्राजेक्टरी परिणामों को सघन स्टेप-लेवल रिवॉर्ड्स में परिवर्तित करता है ताकि उपयोगी कार्यों को त्रुटियों से अलग किया जा सके, जिससे एक संक्षिप्त 4B मॉडल जटिल सर्च बेंचमार्क पर समान आकार के एजेंटों से बेहतर प्रदर्शन करने और बहुत बड़े 30B मॉडलों को टक्कर देने में सक्षम हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक विशाल, बहु-चरणीय रहस्य सुलझाने के लिए प्रशिक्षित कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "सर्च एजेंट" (search agent) को प्रशिक्षित करना कहा जाता है। ये एजेंट डिजिटल जासूसों की तरह होते हैं जो केवल एक तथ्य नहीं ढूँढते; उन्हें इंटरनेट पर घूमना पड़ता है, दर्जनों वेबसाइटों को पढ़ना पड़ता है, कड़ियों को जोड़ना पड़ता है और एक जटिल उत्तर को जोड़कर तैयार करना पड़ता है। इसे एक खजाने की खोज की तरह समझें जहाँ नक्शा गायब है, और रोबोट को सवाल पूछकर, सुरागों की जाँच करके और कभी-कभी यह महसूस करके कि वह गोल-गोल घूम रहा है, रास्ता पता लगाना होगा। सबसे बड़ी चुनौती जो वैज्ञानिक सामना करते हैं, वह यह है कि इन रोबोटों को इस खोज में बेहतर कैसे बनाया जाए। आमतौर पर, जब एक रोबोट अपनी खोज पूरी करता है, तो शिक्षक केवल एक सरल "अच्छा काम किया!" या "फिर से कोशिश करो!" देता है, जो इस बात पर आधारित होता है कि अंतिम खजाना मिला या नहीं। लेकिन यह एक छात्र को उसके पूरे सेमेस्टर के आधार पर ग्रेड देने जैसा है, जबकि उसके द्वारा की गई कड़ी मेहनत को अनदेखा कर दिया जाता है यदि उसने अंत में एक छोटी सी गलती कर दी हो, या यदि उसने बिना किसी वास्तविक काम के पहली बार में ही सही उत्तर का अनुमान लगा लिया हो।
यह शोध पत्र, जिसका शीर्षक "ABSeeker" है, ठीक इसी समस्या का समाधान करता है। शंघाई जियाओ टोंग विश्वविद्यालय के शोधकर्ताओं ने महसूस किया कि सर्च एजेंटों को वास्तव में स्मार्ट बनाने के लिए, हमें उनके द्वारा उठाए गए हर एक कदम को देखना होगा, न कि केवल अंतिम परिणाम को। वे एक नई प्रशिक्षण विधि प्रस्तावित करते हैं जिसे "आंसर-बैकट्रैक्ड क्रेडिट असाइनमेंट" (Answer-Backtracked Credit Assignment - ABC) कहा जाता है। केवल यह कहने के बजाय कि "तुम्हें उत्तर मिल गया, इसलिए तुम्हारा हर कदम अच्छा था," उनका सिस्टम सही उत्तर से पीछे की ओर काम करता है ताकि यह पता लगाया जा सके कि रास्ते में कौन से विशिष्ट सुराग मिलने चाहिए थे। फिर, यह रोबोट की यात्रा के माध्यम से वापस जाता है और उन सुरागों को खोजने के लिए श्रेय (credit) देता है, भले ही रोबोट अंततः भटक गया हो, और उन कदमों के लिए "टाइम-आउट" देता है जिन्होंने समय बर्बाद किया या अच्छे सुरागों को अनदेखा किया, भले ही वह रोबोट अंत में गलती से सही उत्तर तक पहुँच गया हो। उन्होंने इसे एक अपेक्षाकृत छोटे AI मॉडल (4 बिलियन पैरामीटर्स) पर परखा और पाया कि यह बड़े मॉडलों की तुलना में जटिल खोज पहेलियों को बेहतर ढंग से हल कर सकता है, जो यह साबित करता है कि रोबोट को केवल बड़ा बनाने के बजाय उसे चरण-दर-चरण कैसे सोचना है, यह सिखाना अधिक महत्वपूर्ण है।
"सब-कुछ-या-कुछ-नहीं" वाले ग्रेड का रहस्य
आइए समझते हैं कि यह कैसे काम करता है। कल्पना कीजिए कि आप एक कुत्ते को एक विशाल पार्क में एक विशिष्ट छिपे हुए खिलौने को खोजने के लिए प्रशिक्षित कर रहे हैं। पुराने तरीके में प्रशिक्षण देने में (जिसे पेपर में "ट्रैजेक्टरी-लेवल सुपरविजन" कहा गया है), आप कुत्ते को तभी ट्रीट देंगे जब वह खिलौना लेकर आपके पास वापस आएगा। यदि कुत्ता खिलौना ढूँढ लेता है लेकिन वापस आते समय उसे पानी के गड्ढे में गिरा देता है, तो आप उसे कोई ट्रीट नहीं देंगे। यदि कुत्ता भटक जाता है, गोल-गोल घूमता है, और फिर गलती से खिलौने से टकरा जाता है, तो भी आप उसे ट्रीट देंगे। यह कुत्ते के लिए भ्रमित करने वाला है! उसे यह समझ नहीं आता कि खिलौना मिलना अच्छा था, या गोल-गोल घूमना बुरा था।
इस पेपर के लेखक तर्क देते हैं कि यह "सब-कुछ-या-कुछ-नहीं" वाला दृष्टिकोण AI सर्च एजेंटों को प्रशिक्षित करने में एक बड़ी खामी है। उन्होंने देखा कि भले ही एक AI अंतिम उत्तर खोजने में विफल रहता है, वह अक्सर रास्ते में कई सही कदम उठाता है—जैसे सही वेबसाइट ढूँढना या सही पैराग्राफ पढ़ना। इसके विपरीत, एक AI भाग्य से या एक अजीब शॉर्टकट लेकर सही उत्तर तक पहुँच सकता है जो महत्वपूर्ण तथ्यों को छोड़ देता है। पेपर का तर्क है कि हमें AI द्वारा किए गए हर एक कदम को ग्रेड देने के एक तरीके की आवश्यकता है, न कि केवल अंतिम स्कोर की।
"बैकट्रैकिंग" करने वाला जासूस
इसे ठीक करने के लिए, शोधकर्ताओं ने एक चतुर तकनीक बनाई जिसे आंसर-बैकट्रैक्ड क्लू रिकवरी (Answer-Backtracked Clue Recovery) कहा जाता है। यहाँ उपमा है: कल्पना कीजिए कि AI एक जासूस है जिसने अभी-अभी एक अपराध सुलझाया है और उसे अपराधी का नाम पता है (वास्तविक उत्तर या "ग्राउंड-ट्रूथ आंसर")। पेपर सुझाव देता है कि केवल जीत का जश्न मनाने के बजाय, जासूस को पीछे की ओर काम करना चाहिए। "ठीक है, मैं जानता हूँ कि अपराधी जॉन है। इसे साबित करने के लिए, मुझे उसके फिंगरप्रिंट, उसका अलबी (alibi) और उसकी कार मिलनी चाहिए थी।"
AI के मामले में, सिस्टम सही उत्तर लेता है और एक शक्तिशाली AI का उपयोग करके पीछे की ओर (backtrack) जाता है और उन सभी मध्यवर्ती सुरागों की सूची बनाता है जो उस उत्तर तक पहुँचने के लिए खोजे जाने ही चाहिए थे। उदाहरण के लिए, यदि उत्तर एक विशिष्ट ब्रांड का शैम्पू है, तो सुराग "वह कंपनी जो इसका स्वामित्व रखती है," "संस्थापक किस वर्ष स्नातक हुआ," और "सामग्री की सूची" हो सकते हैं। ये सुराग प्रदर्शन को ग्रेड देने के लिए "मानचित्र" बन जाते हैं।
कदमों की स्कोरिंग
एक बार जब सुरागों का मानचित्र तैयार हो जाता है, तो सिस्टम क्लू-एंकोर्ड स्टेप स्कोरिंग (Clue-Anchored Step Scoring) की ओर बढ़ता है। यहीं पर असली जादू होता है। AI की यात्रा को फिर से खेला जाता है, और प्रत्येक कदम की जांच सुराग मानचित्र के विरुद्ध की जाती है।
- अच्छे कदम: यदि AI एक सुराग (जैसे सामग्री की सूची) पाता है, तो उसे उच्च स्कोर मिलता है, भले ही AI अंततः हार मान ले और पूरा पहेली सुलझाने में विफल रहे।
- बुरे कदम: यदि AI एक सुराग को अनदेखा करता है या एक अच्छे सुराग को फेंक देता है, तो उसे दंड (penalty) मिलता है, भले ही वह बाद में किसी तरह सही उत्तर तक पहुँच गया हो।
- तटस्थ (Neutral) कदम: बिना कुछ खोजे इधर-उधर घूमना एक तटस्थ स्कोर प्राप्त करता है।
यह एक साधारण "पास/फेल" ग्रेड को प्रत्येक चाल के विस्तृत रिपोर्ट कार्ड में बदल देता है जो AI ने चली थी। पेपर दिखाता है कि यह विधि AI को बहुत तेज़ी से अपनी गलतियों से सीखने की अनुमति देती है क्योंकि उसे पता होता है कि वास्तव में कौन सी चाल गलत थी, बजाय इसके कि उसे केवल यह पता चले कि पूरा प्रयास विफल रहा।
छोटा दिमाग, बड़ी जीत
शोधकर्ताओं ने इस पद्धति का उपयोग करके ABSeeker नामक एक नया सर्च एजेंट बनाया। उन्होंने Qwen3.5-4B नामक एक मॉडल के साथ शुरुआत की, जो AI की दुनिया में अपेक्षाकृत छोटा है (इसे एक पीएचडी-स्तर के सुपरकंप्यूटर की तुलना में एक बुद्धिमान हाई स्कूल छात्र के रूप में सोचें)। उन्होंने इसे केवल 8,500 उदाहरणों पर प्रशिक्षित किया—जो आमतौर पर आवश्यक लाखों उदाहरणों की तुलना में बहुत कम है।
परिणाम आश्चर्यजनक थे। एक कठिन परीक्षण पर, जिसे BrowseComp कहा जाता है, जहाँ AI को वेब पर जटिल, बहु-भाग वाले प्रश्नों के उत्तर खोजने होते हैं, ABSeeker ने 37.3% स्कोर किया। जब उन्होंने AI को अपनी मेमोरी प्रबंधित करने में मदद करने के लिए एक फीचर (जिसे "कॉन्टेक्स्ट मैनेजमेंट" कहा जाता है) जोड़ा, तो स्कोर बढ़कर 55.3% हो गया।
संदर्भ के लिए, पेपर की तुलना ABSeeker को बहुत बड़े AI एजेंटों (लगभग 30 बिलियन पैरामीटर्स, जो पेशेवर जासूसों की तरह हैं) से की गई है। ABSeeker, जो कि "हाई स्कूल छात्र" है, कई कठिन परीक्षणों पर इन बड़े एजेंटों को हराने या उनके बराबर पहुँचने में सफल रहा। उदाहरण के लिए, परीक्षण के चीनी संस्करण (BrowseComp-ZH) पर, इसने 52.9% स्कोर किया, जो कम स्कोर करने वाले बड़े मॉडलों से बेहतर प्रदर्शन करता है।
यह क्यों मायने रखता है
पेपर सुझाव देता है कि असली सफलता केवल AI को बड़ा बनाने में नहीं है; बल्कि इसे यह सिखाने में है कि अपनी प्रगति का मूल्यांकन कैसे किया जाए। "आंसर-बैकट्रैक्ड क्रेडिट असाइनमेंट" का उपयोग करके, AI उपयोगी कार्यों को महत्व देना और बेकार कार्यों से बचना सीखता है, चाहे वह अंततः खेल जीते या हारे। शोधकर्ताओं ने पाया कि असफल प्रयासों में भी, लगभग 10% कदम वास्तव में उच्च गुणवत्ता वाली खोजें थीं जिन्हें पुरस्कृत किया जाना चाहिए था। पुराने सिस्टम के तहत, उन अच्छे कदमों को दंडित किया जाता क्योंकि अंतिम उत्तर गलत था।
संक्षेप में, यह पेपर दिखाता है कि यदि आप एक AI को एक विस्तृत मानचित्र देते हैं कि एक "अच्छा सफर" कैसा दिखता है, तो वह इंटरनेट पर बहुत अधिक कुशलता से नेविगेट करना सीख सकता है, भले ही वह एक छोटे दिमाग से शुरुआत करे। शोधकर्ताओं का मानना है कि यह दृष्टिकोण भविष्य के AI एजेंटों को जटिल समस्याओं को हल करने के लिए प्रशिक्षित करने के लिए एक गेम-चेंजर हो सकता है, केवल अनुमान लगाने के बजाय, हर कदम के माध्यम से सावधानीपूर्वक सोचने के माध्यम से।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।