← नवीनतम पेपर
🤖 machine learning

SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization

यह शोध पत्र SPINE का प्रस्ताव करता है, जो एक टोकन-चयनात्मक टेस्ट-टाइम सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो केवल उच्च-एन्ट्रॉपी वाले निर्णय-महत्वपूर्ण टोकन को एंट्रॉपी-बैंड नियमितीकरण के साथ अपडेट करके रीजनिंग मॉडल के प्रदर्शन में सुधार करता है, जिससे बाहरी लेबल या रिवॉर्ड मॉडल की आवश्यकता के बिना रिस्पॉन्स कोलैप्स को रोका जा सकता है और स्थिरता बढ़ाई जा सकती है।

मूल लेखक: Jianghao Wu, Yasmeen George, Jin Ye, Yicheng Wu, Daniel F. Schmidt, Jianfei Cai

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianghao Wu, Yasmeen George, Jin Ye, Yicheng Wu, Daniel F. Schmidt, Jianfei Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र (AI) है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन जब भी वह किसी ऐसे नए प्रकार के परीक्षा प्रश्न का सामना करता है जिसे उसने पहले नहीं देखा है, तो वह कभी-कभी भ्रमित हो जाता है। इसे "डिस्ट्रीब्यूशन शिफ्ट" (distribution shift) कहा जाता है।

आमतौर पर, इस छात्र को बेहतर बनाने में मदद करने के लिए, आपको एक शिक्षक की आवश्यकता होगी जिसके पास उत्तर कुंजी (लेबल वाला डेटा) हो, जो उसे ठीक-ठीक बता सके कि उसने क्या सही किया और क्या गलत। लेकिन वास्तविक दुनिया में, हमारे पास अक्सर उत्तर कुंजियाँ नहीं होती हैं। हमारे पास केवल प्रश्न होते हैं।

समस्या: "ग्रुपथिंक" (Groupthink) का जाल

शोधकर्ताओं ने टेस्ट-टाइम रीइन्फोर्समेंट लर्निंग (TTRL) नामक एक चतुर तकनीक का परीक्षण किया। यह इस प्रकार काम करती थी:

  1. AI एक ही प्रश्न के लिए कई अलग-अलग उत्तर उत्पन्न करता है।
  2. वह उन सभी उत्तरों को देखता है और पूछता है, "उनमें से अधिकांश किस बात पर सहमत हैं?" (इसे बहुमत मतदान या majority voting कहा जाता है)।
  3. वह यह मान लेता है कि "बहुमत की राय" सही उत्तर है और इसी का उपयोग खुद को सिखाने के लिए करता है।

पकड़ (The Catch): यह तरीका अक्सर उल्टा असर करता है। AI एक भीड़ के भेड़ जैसा व्यवहार करने लगता है। उसे एहसास होता है कि "अच्छा स्कोर" पाने का सबसे तेज़ तरीका गहराई से सोचना बंद करना और ऐसे छोटे, सुरक्षित उत्तर देना है जिन पर सभी सहमत हों। वह विभिन्न संभावनाओं को तलाशना बंद कर देता है, आलसी हो जाता है, और अंततः गलत उत्तर देने लगता है क्योंकि वह केवल भीड़ की बुरी आदतों की नकल कर रहा होता है। यह एक ऐसे छात्र की तरह है जो पढ़ना बंद कर देता है और केवल सबसे सामान्य उत्तर का अनुमान लगाने लगता है, जिससे अंततः वह कठिन परीक्षा में असफल हो जाता है।

समाधान: SPINE (एक "स्मार्ट एडिटर")

इस शोध पत्र के लेखकों ने महसूस किया कि समस्या यह थी: AI अपने द्वारा लिखे गए हर एक शब्द से सीखने की कोशिश कर रहा था, यहाँ तक कि उन उबाऊ और स्वचालित शब्दों से भी।

कल्पना कीजिए कि आप एक कहानी लिख रहे हैं। अधिकांश शब्द बस "बह" रहे हैं (जैसे "और", "फिर", "तब")। लेकिन कभी-कभी, आप एक रास्ते के मोड़ पर पहुँचते हैं। क्या आप बाएं मुड़ेंगे या दाएं? क्या आप "हाँ" कहेंगे या "नहीं"? ये महत्वपूर्ण निर्णय बिंदु हैं।

SPINE खेल को दो सरल तरीकों से बदल देता है:

1. केवल "रास्ते के मोड़" को संपादित करें

हर बार पूरी कहानी को फिर से लिखने की कोशिश करने के बजाय, SPINE एक स्मार्ट एडिटर की तरह काम करता है जो केवल महत्वपूर्ण निर्णय बिंदुओं को छूता है।

  • रूपक (Metaphor): कल्पना कीजिए कि आप एक भूलभुलैया (maze) में रास्ता खोज रहे हैं। अधिकांश रास्ता एक सीधा गलियारा है जहाँ आप बस आगे बढ़ते रहते हैं (लो एंट्रॉपी/low entropy)। लेकिन कभी-कभी, आप एक जंक्शन पर पहुँचते हैं जहाँ आपको दिशा चुननी होती है (हाई एंट्रॉपी/high entropy)।
  • SPINE का कदम: यह सीधे गलियारों को अनदेखा करता है। यह अपनी ऊर्जा केवल उन जंक्शनों पर केंद्रित करता है जहाँ AI वास्तव में सोच रहा है और एक विकल्प चुन रहा है। यह AI के मस्तिष्क को केवल इन "निर्णय लेने वाले टोकन" (forking tokens) पर अपडेट करता है। यह AI को उबाऊ हिस्सों से भ्रमित होने से रोकता है और उसे कठिन निर्णयों पर केंद्रित रखता है।

2. "गोल्डिलॉक्स" कॉन्फिडेंस ज़ोन (The "Goldilocks" Confidence Zone)

दूसरी समस्या यह थी कि इन जंक्शनों पर AI का आत्मविश्वास अस्थिर था। कभी-कभी वह बहुत अधिक आश्वस्त (overconfident) था (जिससे गलत अनुमान लगे), और कभी-कभी वह बहुत अनिश्चित (unsure) था (जिससे रैंडम शोर पैदा हुआ)।

  • रूपक: कल्पना कीजिए कि एक रस्सी पर चलने वाला (tightrope walker) है। यदि वे बहुत आत्मविश्वासी हैं, तो वे बहुत तेज़ चल सकते हैं और गिर सकते हैं। यदि वे बहुत डरे हुए हैं, तो वे जम जाते हैं और गिर जाते हैं। उन्हें "गोल्डिलॉक्स ज़ोन" में रहने की आवश्यकता है—सावधानी की बिल्कुल सही मात्रा।
  • SPINE का कदम: यह उन महत्वपूर्ण जंक्शनों के चारों ओर अदृश्य सुरक्षा घेरे (एंट्रॉपी बैंड) लगा देता है।
    • यदि AI बहुत जल्दी बहुत आत्मविश्वासी हो जाता है, तो SPINE कहता है, "धीमे हो जाओ, तुम जल्दबाजी कर रहे हो!" (अनिश्चितता बढ़ाना)।
    • यदि AI बहुत भ्रमित हो जाता है और मतिभ्रम (hallucinating) करने लगता है, तो SPINE कहता, "शांत हो जाओ, एक दिशा चुनो!" (अनिश्चितता कम करना)।
    • यह AI की सोचने की प्रक्रिया को स्थिर रखता है और इसे उन छोटे, सुरक्षित उत्तरों में ढहने से रोकता है।

परिणाम

SPINE का उपयोग करके, AI:

  • आलसी नहीं होता: यह छोटे, सुरक्षित उत्तर देने के बजाय लंबे, विचारशील उत्तर उत्पन्न करना जारी रखता है।
  • भ्रमित नहीं होता: यह अपनी सीखने की ऊर्जा केवल वहीं केंद्रित करता है जहाँ इसकी आवश्यकता है (निर्णय के बिंदु)।
  • तेजी से सुधार करता है: यह बिना किसी मानव शिक्षक के मार्गदर्शन के कठिन गणितीय समस्याओं, चिकित्सा संबंधी प्रश्नों और दृश्य पहेलियों को हल करने में बेहतर हो जाता है।

संक्षेप में: SPINE AI को यह सिखाता है कि वह अपने द्वारा लिखे गए हर एक शब्द से सीखने की कोशिश करना बंद करे। इसके बजाय, यह AI को विकल्पों के क्षणों को पहचानने, अपने आत्मविश्वास को संतुलित रखने और केवल उन महत्वपूर्ण क्षणों से सीखने की शिक्षा देता है। यह एक छात्र द्वारा अपने पूरे निबंध को पागलों की तरह फिर से लिखने और एक ऐसे छात्र के बीच का अंतर है जो केवल उन अनुच्छेदों की सावधानीपूर्वक समीक्षा करता है जहाँ उसने अपने सबसे बड़े तर्क दिए थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →