← नवीनतम पेपर
🤖 machine learning

Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

यह शोध पत्र SHIFT को प्रस्तुत करता है, जो 'वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) के लिए एक ट्रेनिंग-मुक्त डेटा चयन पद्धति है, जो एकल इन्फरेंस रोलआउट के दौरान रीजनिंग-प्रेरित हिडन-स्टेट शिफ्ट को मापकर उच्च-उपयोगिता वाले इंस्टेंस की पहचान करती है, जिससे लेबल या रिवॉर्ड सिग्नल तक पहुंच के बिना प्रभावी मॉडल प्रशिक्षण सक्षम होता है।

मूल लेखक: Jianghao Wu, Jianfei Cai, Weiqiang Wang, Jin Ye, Daniel F. Schmidt, Yasmeen George

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianghao Wu, Jianfei Cai, Weiqiang Wang, Jin Ye, Daniel F. Schmidt, Yasmeen George

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अप्रशिक्षित छात्र (एक AI मॉडल) है जो एक बहुत ही कठिन परीक्षा देने वाला है। आपके पास हजारों अभ्यास प्रश्नों का एक विशाल पुस्तकालय है, लेकिन आपके पास केवल पांच प्रश्नों को पढ़ने के लिए ही समय और पैसा है।

बड़ी समस्या यह है कि वे पांच प्रश्न कौन से होने चाहिए?

यदि आप गलत प्रश्न चुनते हैं, तो छात्र कुछ भी नहीं सीखता। यदि आप सही प्रश्न चुनते हैं, तो वह परीक्षा में उत्कृष्ट प्रदर्शन कर सकता है। यह RLVR (वैरिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग) की चुनौती है: बहुत कम उदाहरणों से भारी सुधार प्राप्त करना। लेकिन आमतौर पर, यह पता लगाने के लिए कि कौन से उदाहरण "गोल्डन टिकट" हैं, या तो:

  1. आपको हर एक प्रश्न की उत्तर कुंजी (answer key) चाहिए (जो महंगी और कठिन है)।
  2. आपको छात्र को पहले सभी प्रश्नों को पढ़ने देने की आवश्यकता होती है ताकि यह देखा जा सके कि वे किस तरह मदद करते हैं (जो गणनात्मक रूप से बहुत अधिक संसाधनों की बर्बादी है)।

इस शोध पत्र के लेखक, SHIFT कहते हैं: "रुको, हम उत्तर देखे बिना और छात्र को उन्हें पहले से पढ़ने दिए बिना सबसे अच्छे पांच प्रश्न चुन सकते हैं।"

वे इसे कैसे करते हैं, यहाँ एक सरल उपमा (analogy) दी गई है:

"मानसिक खिंचाव" (Mental Stretch) की उपमा

कल्पना कीजिए कि आपका छात्र एक रबर बैंड है।

  • प्रश्न: कागज का एक टुकड़ा जिस पर एक पहेली लिखी है।
  • सोचने की प्रक्रिया: छात्र पहेली को पढ़ता है और जोर से सोचना शुरू करता है (इसे "रीज़निंग ट्रेस" कहा जाता है)।
  • "हिडन स्टेट" (Hidden State): यह छात्र की आंतरिक मस्तिष्क अवस्था (internal brain state) है, सोचने की प्रक्रिया शुरू करने से पहले और सोचने की प्रक्रिया पूरी करने के बाद

लेखकों ने पाया कि जब एक छात्र एक अच्छे प्रश्न को हल करता है, तो उसका मस्तिष्क एक महत्वपूर्ण "मानसिक खिंचाव" से गुजरता है। वह एक मानसिक अवस्था से शुरू होता है और पूरी तरह से एक अलग, अधिक जटिल अवस्था में समाप्त होता है। यदि समस्या बहुत आसान या उबाऊ है, तो उसका मस्तिष्क बहुत कम हिलता है।

SHIFT इस प्रकार कार्य करता है:

  1. वन-शॉट टेस्ट: पुस्तकालय के प्रत्येक प्रश्न के लिए, सिस्टम छात्र को एक बार (बिना ग्रेड दिए, चुपचाप) समस्या पर विचार करने के लिए कहता है।
  2. खिंचाव को मापना: यह छात्र के विचार की प्रक्रिया के बिल्कुल शुरुआत और अंत के बीच की दूरी को मापता है। इस दूरी को रीज़निंग-इंड्यूस्ड रिप्रेजेंटेशन शिफ्ट (RIRS) कहा जाता है।
    • बड़ा खिंचाव? वह प्रश्न संभवतः एक "उच्च-प्रभाव" वाला उदाहरण है जो छात्र को बहुत कुछ सिखाएगा।
    • छोटा खिंचाव? वह प्रश्न प्रशिक्षण के लिए बेकार हो सकता है।
  3. सबसे अच्छा मिश्रण चुनना: सिस्टम केवल सबसे बड़े खिंचाव वाले 5 प्रश्न नहीं चुनता है। यह यह भी सुनिश्चित करता है कि वे 5 प्रश्न एक-दूसरे से अलग हों (विभिन्न विषयों को कवर करें), ताकि छात्र को एक संतुलित वर्कआउट मिले।

यह एक बड़ी बात क्यों है?

अन्य अधिकांश तरीके एक ऐसे कोच की तरह हैं जो कहता है, "चलो 1,000 प्रश्न आजमाते हैं, देखते हैं कि छात्र किन पर सही उत्तर देता है, और फिर विजेताओं को चुनते हैं।" इसमें बहुत समय लगता है और बहुत खर्च होता है।

SHIFT एक ऐसे कोच की तरह है जो छात्र के सोचने के दौरान उसकी आँखों और मुद्रा (posture) को देखता है और कहता है, "यह वाला देखकर लग रहा है कि यह वास्तव में उसके दिमाग को कड़ी मेहनत करवा रहा है। चलिए इसे चुनते हैं।"

उन्होंने क्या पाया?

शोध पत्र ने दो बहुत कठिन विषयों पर इसका परीक्षण किया: गणित और चिकित्सा संबंधी प्रश्न

  • परिणाम: भले ही बजट बहुत कम था (उपलब्ध प्रश्नों के केवल 2% या 0.1% को चुनना), SHIFT द्वारा चुने गए प्रश्नों पर प्रशिक्षित AI ने यादृच्छिक (random) प्रश्नों या अन्य "स्मार्ट" तरीकों द्वारा चुने गए प्रश्नों पर प्रशिक्षित AI की तुलना में बेहतर प्रदर्शन किया।
  • आश्चर्य: कभी-कभी, केवल कुछ SHIFT-चुने गए प्रश्नों पर प्रशिक्षण देना पूरे पुस्तकालय के प्रश्नों पर प्रशिक्षण देने से भी बेहतर रहा। यह सुझाव देता है कि गुणवत्ता (सही मानसिक खिंचाव) मात्रा से बेहतर है।
  • जांच: उन्होंने सिद्ध किया कि यह "खिंचाव" केवल इसलिए नहीं था क्योंकि प्रश्न लंबे थे या उत्तर अधिक विस्तृत थे। यह वास्तव में सोचने की प्रक्रिया की जटिलता के बारे में था।

संक्षेप में

यह शोध पत्र SHIFT को पेश करता है, जो AI के लिए सबसे अच्छे प्रशिक्षण उदाहरणों को चुनने का एक उपकरण है, जो यह मापकर काम करता है कि पहली बार किसी समस्या पर विचार करते समय AI का "मस्तिष्क" कितना खिंचता है। यह बिना किसी उत्तर कुंजी या महंगे ट्रायल-एंड-एरर प्रशिक्षण के किया जाता है, जिससे बहुत कम डेटा के साथ शक्तिशाली AI मॉडल को बेहतर ढंग से सोचने (reasoning) के लिए प्रशिक्षित करना संभव हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →