Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
यह शोध पत्र लेंथ-अनबायस्ड सीक्वेंस पॉलिसी ऑप्टिमाइजेशन (LUSPO) को प्रस्तुत करता है, जो एक नवीन एल्गोरिदम है जो ग्रुप सीक्वेंस पॉलिसी ऑप्टिमाइजेशन (GSPO) में लंबाई के पूर्वाग्रह (लेंथ बायस) का सैद्धांतिक रूप से विश्लेषण और सुधार करता है ताकि रिस्पॉन्स लेंथ कोलैप्स को रोका जा सके, जिससे गणितीय और मल्टीमॉडल रीजनिंग कार्यों में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र (एक AI मॉडल) को जटिल गणित और तर्क पहेलियों को हल करने के लिए प्रशिक्षित कर रहे हैं। उन्हें सिखाने में मदद करने के लिए, आप एक विधि का उपयोग करते हैं जिसे Reinforcement Learning with Verifiable Rewards (RLVR) कहा जाता है। इसे एक कोच की तरह समझें जो छात्र को एक समस्या देता है, उसे हल करने की कोशिश करने देता है, और फिर उत्तर की जाँच करता है। यदि उत्तर सही है, तो उन्हें एक गोल्ड स्टार मिलता है; यदि गलत है, तो उन्हें धीरे से "फिर से प्रयास करें" कहा जाता है।
समय के साथ, छात्र लंबी और गहरी सोच विकसित करना सीखता है, बड़े कार्यों को छोटे चरणों में तोड़ता है। इस "ज़ोर से सोचने" (thinking out loud) की प्रक्रिया का महत्व कठिन कार्यों को हल करने के लिए अत्यंत महत्वपूर्ण है।
हालाँकि, इस शोध पत्र के लेखकों ने पाया कि वर्तमान कोचिंग विधियाँ (विशेष रूप से GRPO और GSPO जैसे एल्गोरिदम) छात्रों को ग्रेड देने के तरीके में एक छिपा हुआ दोष था।
समस्या: "छोटा उत्तर" का जाल (The "Short Answer" Trap)
कल्पना कीजिए कि कोच एक टेस्ट को ग्रेड दे रहा है।
- दोष: वर्तमान ग्रेडिंग प्रणाली अनजाने में उन छात्रों को दंडित करती है जो लंबे, विस्तृत स्पष्टीकरण लिखते हैं, भले ही वे स्पष्टीकरण सही हों। यह एक ऐसे शिक्षक की तरह है जो एक छात्र को जिसने एक आदर्श 5-पेज का निबंध लिखा है, उसे एक छात्र की तुलना में कम स्कोर देता है जिसने 1-पेज का निबंध लिखा है, केवल इसलिए क्योंकि ग्रेडिंग फॉर्मूले का गणित छोटे पेपर के पक्ष में है।
- परिणाम: छात्र (AI मॉडल) जल्दी ही समझ जाते हैं कि सर्वोत्तम स्कोर प्राप्त करने के लिए, उन्हें गहराई से सोचना बंद कर देना चाहिए और बस संक्षिप्त, त्वरित उत्तर देने चाहिए।
- पतन (The Collapse): शोध के प्रयोगों में, एक लोकप्रिय विधि (GSPO) के कारण AI की प्रतिक्रियाएं "कोलैप्स" हो गईं। AI बहुत संक्षिप्त, आलसी उत्तर देने लगा, जिससे जटिल समस्याओं के माध्यम से तर्क करने की उसकी क्षमता समाप्त हो गई। यह एक मैराथन धावक की तरह था जिसने अचानक चलना शुरू कर दिया क्योंकि हर बार लंबी छलांग लगाने पर फिनिश लाइन को और करीब खिसका दिया जा रहा था।
समाधान: LUSPO (एक निष्पक्ष कोच)
लेखकों, फैनफैन लियू और उनकी टीम (Meituan से) ने Length-Unbiased Sequence Policy Optimization (LUSPO) नामक एक नई विधि प्रस्तावित की है।
LUSPO को एक नए, निष्पक्ष कोच के रूप में समझें जो ग्रेडिंग फॉर्मूले को ठीक करता है।
- सुधार: नया कोच कहता है, "इससे कोई फर्क नहीं पड़ता कि आपका उत्तर 10 शब्द का है या 1,000 शब्दों का। यदि तर्क सही है, तो आपको पूरे अंक मिलेंगे।" वे गणित को इस तरह से समायोजित करते हैं ताकि उत्तर की लंबाई स्कोर को अनुचित रूप से बढ़ा या घटा न सके।
- उपमा: यदि पुराना तरीका किसी भाषण को इस आधार पर आंकने जैसा था कि आपने कितने कम शब्दों का उपयोग किया, तो LUSPO इस आधार पर आंकने जैसा है कि आपने अपने विचारों को कितनी अच्छी तरह संप्रेषित किया, चाहे आपने 5 मिनट तक बात की हो या 30 मिनट तक।
जब उन्होंने इसे आज़माया तो क्या हुआ?
टीम ने इस नए "निष्पक्ष कोच" का परीक्षण विभिन्न प्रकार के AI मॉडल (कुछ जो केवल टेक्स्ट पढ़ते हैं, और कुछ जो चित्रों और चार्ट्स को भी देख सकते हैं) पर किया।
- AI ने लंबा सोचना शुरू किया: अपने उत्तरों को छोटा करने के बजाय, मॉडल लंबे, अधिक विस्तृत स्पष्टीकरण लिखने लगे। वे समस्या के माध्यम से "सोचने" के लिए समय लेने को तैयार थे।
- बेहतर स्कोर: क्योंकि मॉडल अधिक गहराई से सोच रहे थे, वे कठिन गणित और तर्क पहेलियों को हल करने में बेहतर हो गए। परीक्षणों में, LUSPO-प्रशिक्षित मॉडलों ने पुराने तरीकों के मुकाबले उच्च स्कोर प्राप्त किया।
- उदाहरण के लिए, एक कठिन गणित टेस्ट (AIME24) पर, नई विधि ने एक मॉडल पर 6.9% और दूसरे पर 2.9% तक सुधार किया।
- विजुअल पहेलियों (चार्ट और ग्राफ देखना) पर भी, इसने पिछले सर्वश्रेष्ठ तरीकों को पछाड़ दिया।
- स्थिरता (Stability): प्रशिक्षण प्रक्रिया बहुत अधिक स्थिर हो गई। मॉडल भ्रमित नहीं हुए या आलसी उत्तर देने लगे; वे तर्क करने की अपनी क्षमता में लगातार सुधार करते रहे।
निचोड़ (The Bottom Line)
यह शोध पत्र दिखाता है कि जिस तरह से हम वर्तमान में AI को "सोचने" के लिए प्रशिक्षित करते हैं, उसमें एक छिपा हुआ बग है जो उन्हें आलसी और संक्षिप्त होने के लिए प्रेरित करता है। LUSPO के साथ इस बग को ठीक करके, AI एक अधिक मेहनती छात्र बन जाता है, जो जटिल समस्याओं के लिए लंबे, विस्तृत और सटीक समाधान लिखने के लिए तैयार रहता है। यह गणित में एक सरल बदलाव है जो बहुत स्मार्ट AI व्यवहार की ओर ले जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।