Vector Policy Optimization: Training for Diversity Improves Test-Time Search
यह शोध पत्र वेक्टर पॉलिसी ऑप्टिमाइज़ेशन (VPO) को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो वेक्टर-मान वाले पुरस्कारों (vector-valued rewards) का लाभ उठाकर भाषा मॉडलों को विविध समाधान उत्पन्न करने के लिए प्रशिक्षित करता है, जिससे मानक स्केलर रिवॉर्ड ऑप्टिमाइज़ेशन की तुलना में टेस्ट-टाइम सर्च प्रक्रियाओं में उनके प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शेफ हैं जो एक नए प्रशिक्षु (apprentice) को एक बहुत ही नखरेबाज फूड क्रिटिक (खाद्य समीक्षक) के लिए खाना बनाना सिखा रहे हैं। वह क्रिटिक केवल "एक अच्छा भोजन" नहीं चाहता; उसकी विशिष्ट इच्छाओं का एक जटिल मेनू है: शायद वह स्टेक को 'रेयर' (raw/pink) चाहता हो, सॉस को तीखा चाहता हो, सब्जियां कुरकुरी चाहता हो, और प्रेजेंटेशन कलात्मक चाहता हो।
पुराना तरीका: "एक ही आकार सबके लिए" वाला शेफ (The "One-Size-Fits-All" Chef)
अतीत में, AI (जैसे लार्ज लैंग्वेज मॉडल्स) को प्रशिक्षित करने के लिए, हम एक विधि का उपयोग करते थे जिसे स्केलर रिवॉर्ड ऑप्टिमाइज़ेशन (जिसे पेपर में GRPO द्वारा दर्शाया गया है) कहा जाता था।
इसे इस तरह समझें जैसे आप प्रशिक्षु को कह रहे हों: "आपका लक्ष्य उच्चतम संभव स्कोर प्राप्त करना है जो एक एकल संख्या पर आधारित है: 50% स्टेक की गुणवत्ता + 50% सॉस की गुणवत्ता।"
प्रशिक्षु जल्दी ही समझ जाता है कि उच्चतम स्कोर पाने के लिए, उसे प्रयोग करना बंद कर देना चाहिए। वह बार-बार एक ही "परफेक्ट" स्टेक-सॉस कॉम्बिनेशन बनाना शुरू कर देता है। वह एक विशिष्ट व्यंजन का मास्टर बन जाता है।
- समस्या: जब क्रिटिक वास्तव में आता है, तो वह कह सकता है, "वास्तव में, आज मैं स्टेक को मीडियम-रेयर और सॉस को मीठा चाहता हूँ।" प्रशिक्षु, जिसने केवल एक विशिष्ट रेसिपी का अभ्यास किया है, को पता ही नहीं होता कि क्या करना है। उसके पास केवल एक ही उत्तर है, और वह आज के मूड के लिए गलत है।
नया तरीका: वेक्टर पॉलिसी ऑप्टिमाइज़ेशन (VPO)
पेपर एक नई प्रशिक्षण विधि प्रस्तावित करता है जिसे वेक्टर पॉलिसी ऑप्टिमाइज़ेशन (VPO) कहा जाता है।
एक एकल स्कोर देने के बजाय, ट्रेनर कहता है: "मैं तुम्हें अलग-अलग लक्ष्यों की एक सूची दूंगा। कभी मैं चाहता हूँ कि तुम स्टेक पर ध्यान केंद्रित करो, कभी सॉस पर, कभी सब्जियों पर। मैं चाहता हूँ कि तुम एक ही बार में विभिन्न व्यंजनों का एक 'प्लैटर' (थाली) तैयार करो, जहाँ प्रत्येक व्यंजन अलग-अलग संयोजनों का एक उत्कृष्ट नमूना हो।"
प्रशिक्षु विभिन्न समाधानों का एक विविध सेट बनाना सीखता है:
- डिश A: परफेक्ट स्टेक, साधारण सॉस।
- डिश B: हल्का स्टेक, जटिल तीखा सॉस।
- डिश C: कुरकुरी सब्जियां, कलात्मक प्लेटिंग।
वे एक ही "सर्वश्रेष्ठ" डिश खोजने की कोशिश नहीं कर रहे हैं। वे संभावित स्वादिष्ट संयोजनों के पूरे "मैप" (नक्शे) को कवर करने की कोशिश कर रहे हैं (जिसे पेपर में पारेटो फ्रंटियर/Pareto Frontier कहा गया है)।
"टेस्ट-टाइम सर्च" (जब क्रिटिक आता है)
यहीं पर जादू होता है। पेपर का तर्क है कि आधुनिक AI सिस्टम में, AI केवल एक उत्तर नहीं देता और उम्मीद नहीं करता; बल्कि, सिस्टम उपयोग के समय (इंफरेंस के दौरान) एक सर्च इंजन की तरह कार्य करता है।
जब क्रिटिक अपनी विशिष्ट, अनूठी मांग (जैसे, "मुझे स्टेक रेयर लेकिन सॉस मीठा चाहिए") के साथ आता है, तो सिस्टम AI से एक नया व्यंजन शून्य से बनाने के लिए नहीं कहता। इसके बजाय, यह प्रशिक्षु द्वारा तैयार किए गए विविध व्यंजनों के प्लैटर को देखता है।
- पुराना शेफ (GRPO): क्रिटिक प्लैटर को देखता है। यह 100 एक जैसे "स्टेक-सॉस #1" व्यंजनों से भरा है। क्रिटिक को उसमें वह नहीं मिल पाता जो वह चाहता है।
- VPO शेफ: क्रिटिक प्लैटर को देखता है। वहां एक डिश है जिसमें रेयर स्टेक और मीठा सॉस है! सिस्टम उसी को चुन लेता है।
यह क्यों महत्वपूर्ण है
पेपर ने चार अलग-अलग "किचन" (कार्य जैसे लॉजिक पहेलियाँ सुलझाना, भूलभुलैया में रास्ता खोजना और कोड लिखना) पर इसका परीक्षण किया।
- अधिक उम्मीदवार = बेहतर परिणाम: जैसे-जैसे सिस्टम को अधिक व्यंजनों (एक बड़ा "सर्च बजट") को देखने की अनुमति दी गई, VPO शेफ सबसे सटीक मिलान खोजने में बेहतर और बेहतर होता गया। पुराने शेफ का प्रदर्शन एक सीमा पर आकर रुक गया क्योंकि उनके पास केवल एक ही प्रकार का व्यंजन पेश करने का विकल्प था।
- असंभव को हल करना: एक बहुत कठिन कोडिंग चुनौती (LiveCodeBench) में, पुराना शेफ कितनी भी कोशिश करे, समस्या को हल नहीं कर सका। हालाँकि, VPO शेफ के पास विविध "प्रयासों" का एक सेट था, जो एक सर्च टूल के साथ मिलकर समस्या को सुलझाने में सफल रहा।
- "डाइवर्सिटी ट्रैप" (विविधता का जाल): पेपर नोट करता है कि यदि लक्ष्य लगभग एक जैसे हैं (जैसे, "इसे लाल बनाओ" और "इसे नीला बनाओ" जहाँ लाल और नीला एक ही चीज़ हैं), तो VPO मदद नहीं करता। यह तभी चमकता है जब लक्ष्य वास्तव में अलग हों और उनमें ट्रेड-ऑफ (समझौता) की आवश्यकता हो।
निचोड़ (The Bottom Line)
पेपर का दावा है कि यदि आप एक ऐसे सिस्टम के भीतर AI का उपयोग करने की योजना बना रहे हैं जो सबसे अच्छे विकल्प को खोजने के लिए कई विकल्पों में खोज करता है, तो आपको AI को एक "विशेषज्ञ" के रूप में प्रशिक्षित नहीं करना चाहिए जो एक पूर्ण उत्तर दे सके। इसके बजाय, आपको इसे एक ऐसे जनरलिस्ट (सामान्यवादी) के रूप में प्रशिक्षित करना चाहिए जो उच्च-गुणवत्ता वाले विकल्पों का एक विविध पोर्टफोलियो तैयार करे।
प्रशिक्षण के दौरान AI को समाधानों के विभिन्न "फ्लेवर्स" (स्वादों) को एक्सप्लोर करने की अनुमति देकर, आप टेस्ट-टाइम सर्च सिस्टम को चुनने के लिए एक बहुत समृद्ध मेनू प्रदान करते हैं, जिससे अधिक स्मार्ट और अनुकूलनीय परिणाम मिलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।