← नवीनतम पेपर
💬 NLP

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

यह शोधपत्र RELEX को प्रस्तुत करता है, जो एक कंप्यूट-कुशल विधि है जो इस खोज का लाभ उठाती है कि RLVR वेट प्रक्षेपवक्र (weight trajectories) अत्यधिक पूर्वानुमेय और लो-रैंक होते हैं, ताकि भविष्य के मॉडल चेकपॉइंट्स का लीनियर रिग्रेशन के माध्यम से अनुमान लगाया जा सके, जिससे स्टोकेस्टिक ऑप्टिमाइज़ेशन शोर को फ़िल्टर करके केवल कुछ ही चरणों में पूर्ण प्रशिक्षण के तुलनीय या उससे बेहतर प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories" का सरल भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: AI को प्रशिक्षित करना एक पहाड़ चढ़ने जैसा है

कल्पना कीजिए कि आप एक लार्ज लैंग्वेज मॉडल (एक AI) को जटिल गणितीय समस्याओं को हल करना सिखाना चाहते हैं। वर्तमान में, इसे करने का सबसे अच्छा तरीका RLVR (वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग) नामक एक प्रक्रिया है।

RLVR को "गणित के जीनियस" की चोटी तक पहुँचने के लिए AI को एक बहुत लंबी, महंगी हाइकिंग (पहाड़ की चढ़ाई) पर भेजने के रूप में सोचें।

  • लागत: यह हाइक शक्तिशाली कंप्यूटर समय (GPU घंटों) के कई दिनों तक चलती है।
  • प्रक्रिया: AI हर चेकपॉइंट पर अपने काम की जाँच करते हुए हजारों छोटे कदम उठाता है।
  • लक्ष्य: आप चाहते हैं कि AI बिल्कुल शीर्ष पर पहुँचे (सर्वश्रेष्ठ प्रदर्शन), लेकिन हाइक इतनी लंबी और महंगी है कि आप चाहेंगे कि आप आधे रास्ते में ही रुक जाएँ और बस "अनुमान" लगा लें कि चोटी कहाँ है।

खोज: हाइक आश्चर्यजनक रूप से सीधी है

इस शोध पत्र के शोधकर्ताओं ने गौर किया कि AI कैसे सीखता है। उन्होंने इस हाइक के दौरान छोड़े गए "पदचिह्नों" (AI के मस्तिष्क के भार/weights में बदलाव) को देखा।

उन्होंने दो अद्भुत चीजें पाईं:

  1. रास्ता एक सीधी रेखा है: भले ही AI एक विशाल, जटिल 3D स्थान के माध्यम से आगे बढ़ रहा हो, सुधार का उसका वास्तविक पथ अविश्वसनीय रूप से सरल है। यह एक घने जंगल में चलने जैसा है लेकिन आप केवल एक ही एकल, सीधी दिशा में आगे बढ़ रहे हैं।
  2. गति अनुमानित है: जिस गति से AI उस सीधी रेखा पर सुधार करता है, वह लगभग पूरी तरह से रैखिक (linear) है। यदि आप इसके प्रगति का ग्राफ खींचते हैं, तो यह एक टेढ़ी-मेढ़ी, अराजक वक्र के बजाय एक स्केल (रूलर) की तरह सीधी रेखा दिखाई देता है।

उपमा: कल्पना कीजिए कि आप कोहरे से भरे शहर में कार चला रहे हैं। आमतौर पर, आप उम्मीद करते हैं कि सड़क घुमावदार और टेढ़ी-मेढ़ी होगी। लेकिन शोधकर्ताओं ने पाया कि इस विशिष्ट प्रकार के AI प्रशिक्षण के लिए, सड़क वास्तव में एक पूरी तरह से सीधी हाईवे है, और कार एक स्थिर, अनुमानित दर पर गति कर रही है।

समाधान: RELEX ("क्रिस्टल बॉल" विधि)

इस खोज के आधार पर, लेखकों ने RELEX (REinforcement Learning EXtrapolation) नामक एक विधि बनाई।

AI को पूरी 500-स्टेप की हाइक पूरी करने देने के बजाय, RELEX कहता है: "आइए हम केवल पहले 75 स्टेप्स देखें (यात्रा का लगभग 15%)। चूंकि हम जानते हैं कि रास्ता एक सीधी रेखा है और गति स्थिर है, इसलिए हम गणितीय रूप से भविष्यवाणी कर सकते हैं कि कार स्टेप 500, 1,000 या यहाँ तक कि 2,000 पर कहाँ होगी।"

यह कैसे काम करता है ("डिनॉयज़िंग" ट्रिक):
AI की सीखने की प्रक्रिया थोड़ी शोर भरी (noisy) होती है, जैसे रेडियो पर स्टेटिक (खुरखराहट)।

  • शोर (Noise): AI के मस्तिष्क में होने वाले अधिकांश छोटे, यादृच्छिक उतार-चढ़ाव केवल "स्टेटिक" या गलतियाँ हैं जो उसे स्मार्ट बनाने में मदद नहीं करती हैं।
  • सिग्नल (Signal): असली "जीनियस" उस एक सीधी रेखा (जिसे Rank-1 trajectory कहा जाता है) में छिपा हुआ है।
  • जादू: RELEX एक गणितीय फ़िल्टर (SVD) का उपयोग करता है ताकि वह सभी शोर वाले स्टेटिक को अनदेखा कर सके और केवल उस एक सीधी रेखा पर ध्यान केंद्रित कर सके। फिर यह शुरुआती चरणों के माध्यम से एक सीधी रेखा खींचता है और इसे आगे की ओर बढ़ाता है।

परिणाम: तेज़, सस्ता और उतना ही अच्छा

शोधकर्ताओं ने इसका परीक्षण तीन अलग-अलग AI मॉडलों (Qwen2.5-Math, Qwen3-4B, और Qwen3-8B) पर किया।

  • दावा: सामान्य समय के केवल 15% से 20% तक प्रशिक्षण देकर, RELEX एक ऐसा चेकपॉइंट प्रेडिक्ट कर सकता है जो पूरी तरह से प्रशिक्षित मॉडल के बराबर या कभी-कभी उससे भी बेहतर प्रदर्शन करता है।
  • प्रमाण: उन्होंने इन "प्रेडिक्टेड" मॉडलों का गणित परीक्षणों पर परीक्षण किया। प्रेडिक्टेड मॉडलों ने लगभग ठीक वैसा ही स्कोर किया जैसा कि उन मॉडलों ने किया जिन्होंने वास्तव में पूरी, महंगी हाइक पूरी की थी।
  • बोनस: क्योंकि यह विधि "शोर" को फ़िल्टर करती है, इसलिए प्रेडिक्टेड मॉडल पूरी तरह से प्रशिक्षित मॉडलों की तुलना में नई, अनदेखी गणितीय समस्याओं (आउट-ऑफ-डोमेन बेंचमार्क) के लिए बेहतर सामान्यीकरण (generalize) कर सकते हैं।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  • कोई नया सीखना आवश्यक नहीं: RELEX को भविष्य की भविष्यवाणी करने के लिए एक नया AI प्रशिक्षित करने की आवश्यकता नहीं है। यह केवल उसके पास मौजूद डेटा पर एक साधारण गणितीय गणना (लीनियर रिग्रेशन) करता है।
  • यह "मिनिमलिस्ट" है: यह शोध पत्र सिद्ध करता है कि आपको जटिल, फैंसी भविष्यवाणियों की आवश्यकता नहीं है। एक साधारण सीधी रेखा पर्याप्त है क्योंकि AI का सीखने का पथ स्वाभाविक रूप से इतना सरल है।
  • स्पेक्ट्रल डिनॉयज़िंग (Spectral Denoising): यह विधि इतनी अच्छी तरह से काम करती है क्योंकि यह एक 'नॉइज़-कैंसलिंग हेडफ़ोन' की तरह कार्य करती है। यह प्रशिक्षण के यादृच्छिक, अराजक हिस्सों को हटा देती है जो आमतौर रूप से भविष्यवाणियों को खराब कर देते हैं, जिससे केवल सुधार का शुद्ध सिग्नल बचता है।

सारांश

कल्पना कीजिए कि आप एक रॉकेट लॉन्च देख रहे हैं। आमतौर पर, आपको यह जानने के लिए कि क्या यह सफल रहा, इसे अंतरिक्ष तक पूरा देखना होगा। यह शोध पत्र कहता है: "रुको। रॉकेट एक सीधी रेखा में और एक स्थिर गति से उड़ रहा है। यदि हम पहले एक मिनट तक देखते हैं, तो हम गणना कर सकते हैं कि एक घंटे में वह कहाँ होगा, और वह उतना ही सफल होगा जितना कि यदि हमने पूरी अवधि तक प्रतीक्षा की होती।"

RELEX वही कैलकुलेटर है। यह यह जानकर बहुत सारा समय और पैसा बचाता है कि AI प्रशिक्षण, अराजक दिखने के बावजूद, वास्तव में एक बहुत ही सरल और अनुमानित पथ का अनुसरण कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →