Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling
यह शोध पत्र BranPO को प्रस्तुत करता है, जो एक वैल्यू-फ्री सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) विधि है जो कंट्रास्टिव डायनेमिक ब्रांच सैंपलिंग का उपयोग करके ट्राजेक्टरी टेल्स (trajectory tails) से स्टेप-लेवल सुपरविजन उत्पन्न करके लॉन्ग-होराइजन सेटिंग्स में मल्टी-टर्न सर्च एजेंटों में सुधार करती है, जिससे स्पार्स रिवार्ड्स और कम्प्यूटेशनल अक्षमताओं पर काबू पाते हुए प्रश्न-उत्तर बेंचमार्क पर बेहतर सटीकता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य चित्र: एक जासूस को रहस्य सुलझाना सिखाना
कल्पना कीजिए कि आप एक जूनियर डिटेक्टिव (एक AI एजेंट) को जटिल रहस्यों को सुलझाने के लिए प्रशिक्षित कर रहे हैं, जिसमें कई चरणों की आवश्यकता होती है: प्रश्न पूछना, सुराग इकट्ठा करना और अंत में एक रिपोर्ट लिखना।
यह पेपर उस समस्या का समाधान करता है जिसे यह सवाल उठता है कि कैसे इस डिटेक्टिव को सिखाया जाए जब आपको फीडबैक केवल अंत में मिलता है: "मामला सुलझ गया" या "मामला विफल रहा।"
यदि डिटेक्टिव रिपोर्ट के अंतिम वाक्य में गलती करता है, तो पुराने प्रशिक्षण तरीके कहेंगे, "आप विफल रहे," और डिटेक्टिव को उनके पहले के सभी कार्यों के लिए दंडित करेंगे, भले ही जांच का शुरुआती 90% हिस्सा एकदम सही रहा हो। यह एक छात्र को फाइनल एग्जाम में 'F' ग्रेड देने जैसा है क्योंकि उसने अपना नाम लिखने में गलती की, भले ही उसने गणित के हर सवाल का सही जवाब दिया हो। यह भ्रमित करने वाला और अक्षम है।
मुख्य समस्या: लंबे कार्यों में "दोष मढ़ने का खेल" (The Blame Game)
AI की दुनिया में, इसे क्रेडिट असाइनमेंट प्रॉब्लम (Credit Assignment Problem) कहा जाता है।
- पुराना तरीका (GRPO): AI शुरुआत से अंत तक एक पूरा रास्ता आज़माता है। यदि वह अंत में विफल हो जाता है, तो AI सोचता है, "शायद मुझे वह पहला सवाल नहीं पूछना चाहिए था।" लेकिन शायद वह पहला सवाल एकदम सही था! गलती वास्तव में अंतिम चरण में हुई थी।
- ट्री मेथड (The Tree Method): कुछ शोधकर्ताओं ने हर कदम पर संभावनाओं का एक "पेड़" (tree) बनाने की कोशिश की ताकि देखा जा सके कि क्या होता है। लेकिन यह हर मोड़ पर 100 डिटेक्टिवों को हर संभव रास्ते को आज़माने के लिए भेजने जैसा है। यह अविश्वसनीय रूप से महंगा और धीमा है।
खोज: गलतियाँ वास्तव में कहाँ होती हैं
लेखकों ने हजारों इन AI डिटेक्टिव कहानियों का विश्लेषण किया और एक पैटर्न पाया:
- शुरुआत आमतौर पर ठीक होती है: AI जांच शुरू करने और पहले कुछ सवाल पूछने में अच्छा होता है।
- अंत वह जगह है जहाँ यह टूटता है: गलतियाँ लगभग हमेशा अंतिम चरणों में होती हैं—या तो AI बहुत जल्दी हार मान लेता है, या अंतिम उत्तर लिखते समय वह "हैलुसिनेशन" (तथ्य गढ़ना) करने लगता है।
उपमा (Analogy): कल्पना कीजिए कि आप केक बना रहे हैं। AI बैटर (घोल) मिलाने और उसे ओवन में रखने में माहिर है (शुरुआती चरण)। लेकिन अक्सर, वह केक जला देता है या फ्रॉस्टिंग लगाना भूल जाता है (बाद के चरण)। यदि आप पूरे केक को इसलिए फेंक देते हैं क्योंकि वह जल गया है, तो आप उस बेहतरीन मिक्स किए हुए बैटर को बर्बाद कर देते हैं।
समाधान: BranPO (Branching Relative Policy Optimization)
लेखक एक नया प्रशिक्षण तरीका प्रस्तावित करते हैं जिसे BranPO कहा जाता है। यह कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:
1. "रिवाइंड और फिर से प्रयास करें" की रणनीति
AI को हर बार शून्य से शुरू करने के बजाय, BranPO कहता है: "आइए अच्छे हिस्सों को बनाए रखें।"
- कार्रवाई: जब AI कोई कार्य पूरा करता है, तो सिस्टम अंत को देखता है। यदि उत्तर गलत है, तो यह अंतिम कुछ चरणों को ट्रंकेट (truncate) यानी काट देता है।
- ब्रांच (Branch): यह "प्रिफिक्स" (अच्छे शुरुआती चरणों) को बिल्कुल वैसा ही रखता है जैसा वे हैं, और फिर AI को केवल अंतिम चरणों को रीसैंपल (resample) (फिर से प्रयास) करने के लिए कहता है।
- परिणाम: यह एक "कॉन्ट्रास्टिव" (तुलनात्मक) जोड़ी बनाता है:
- पथ A: मूल प्रयास (जो अंत में विफल रहा)।
- पथ B: नया प्रयास (जो उसी शुरुआत का उपयोग करके अंत में सफल रहा)।
उपमा: कल्पना कीजिए कि आप एक निबंध लिख रहे हैं। आपने एक शानदार प्रस्तावना और मुख्य पैराग्राफ लिखे हैं, लेकिन आपका निष्कर्ष बहुत खराब है। पूरे निबंध को फिर से लिखने के बजाय, आप पहले 90% को रखते हैं और बस 10 अलग-अलग निष्कर्ष लिखने की कोशिश करते हैं। फिर आप AI को सिखाते हैं: "देखो? शुरुआत अच्छी थी। समस्या केवल अंत में थी। अगली बार, एक अलग अंत लिखने की कोशिश करो।"
2. स्मार्ट सैंपलिंग (कठिनाई-जागरूक)
सभी कार्यों को एक समान मदद की आवश्यकता नहीं होती है।
- आसान कार्य: यदि AI आसानी से उत्तर सही पाता है, तो सिस्टम समय बर्बाद नहीं करता है। वह बस आगे बढ़ जाता है।
- कठिन कार्य: यदि AI संघर्ष कर रहा है, तो सिस्टम आक्रामक हो जाता है। यह कार्य को अलग-अलग बिंदुओं पर काट देता है और AI को कई अलग-अलग अंत खोजने के लिए मजबूर करता है जो काम कर सकें।
- उपमा: एक कोच के बारे में सोचें। यदि खिलाड़ी आसानी से गोल करता है, तो कोच कहता है "अच्छा काम किया, अगला प्ले!" लेकिन यदि खिलाड़ी बार-बार चूक जाता है, तो कोच खेल को रोकता है, कहता है "चलिए इस विशिष्ट शॉट को 10 बार आजमाते हैं," और केवल उस विशिष्ट मूवमेंट को ठीक करने पर ध्यान केंद्रित करता है।
3. "रिडंडेंट स्टेप" फ़िल्टर (अनावश्यक चरण फ़िल्टर)
कभी-कभी, AI उत्तर पा लेता है लेकिन अनावश्यक रूप से अधिक जानकारी खोजने के लिए खोज जारी रखता है (जैसे एक जासूस जिसने अपराधी को ढूंढ लिया है लेकिन 10 मिनट और घर की तलाशी लेता रहता है)।
- समाधान: सिस्टम के पास एक "रिडंडेंट स्टेप मास्क" होता है। यदि AI उत्तर ढूंढ लेता है, लेकिन फिर वहां तक पहुँचने के लिए अतिरिक्त कदम उठाता है, तो सिस्टम प्रशिक्षण के दौरान उन अतिरिक्त कदमों को अनदेखा कर देता है। यह AI को सिखाता है कि काम पूरा होते ही खोजना बंद कर दें।
- उपमा: यह एक छात्र को यह बताने जैसा है, "आपने 5 मिनट में गणित का सवाल हल कर लिया। बहुत बढ़िया! लेकिन फिर आपने इसे दोबारा चेक करने में 10 मिनट और बिताए। अगली बार, 5 मिनट पर ही रुक जाइए। हमें उन अतिरिक्त 10 मिनटों की आवश्यकता नहीं है।"
यह बेहतर क्यों है?
- सटीकता (Precision): यह AI को देर से होने वाली गलतियों के लिए अपने शुरुआती, सही निर्णयों को दोष देने से रोकता है।
- दक्षता (Efficiency): यह पूरे सफर को फिर से सिम्युलेट करने में पैसा और समय बर्बाद नहीं करता है। यह केवल उस हिस्से को सिम्युलेट करता है जिसे ठीक करने की आवश्यकता है (अंत)।
- स्थिरता (Stability): एक ही शुरुआत को रखते हुए एक "अच्छे अंत" की तुलना "बुरे अंत" से करके, AI ठीक समझ पाता है कि उसे क्या बदलना है।
परिणाम
लेखकों ने विभिन्न प्रश्न-उत्तर बेंचमार्क (जैसे बहु-चरणीय पहेलियों को हल करना) पर इसका परीक्षण किया।
- परिणाम: BranPO ने अन्य मजबूत तरीकों को लगातार पछाड़ दिया।
- मुख्य जीत: इसने मानक तरीकों की तुलना में अधिक कंप्यूटिंग पावर या समय की आवश्यकता के बिना, लंबे और जटिल कार्यों में उल्लेखनीय सुधार किया।
एक वाक्य में सारांश
BranPO AI एजेंटों को उनके अच्छे शुरुआती काम को बनाए रखकर और केवल उन्हें उनके बिखरे हुए अंतिम चरणों को फिर से प्रयास करने के लिए मजबूर करके सिखाता है, जिससे प्रभावी रूप से उन्हें दिखाया जाता है कि वे कहाँ गलत हुए बिना जो उन्होंने पहले से सही किया है उसे दोबारा करने में समय बर्बाद किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।