← नवीनतम पेपर
🤖 machine learning

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

यह शोध पत्र एक टैलिस लॉस निरंतरता (Tsallis loss continuum) प्रस्तुत करता है जो रीजनिंग मॉडल्स में कोल्ड-स्टार्ट स्टालिंग (cold-start stalling) को हल करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) और घनत्व अनुमान (density estimation) के बीच मध्यस्थता करता है, जिसमें दो व्यावहारिक अनुमानकों (GARL और PAFT) का प्रस्ताव दिया गया है जो कम सफलता की संभावनाओं से बाहर निकलने की गति और प्रशिक्षण स्थिरता के बीच संतुलन बनाकर जटिल रीजनिंग बेंचमार्क पर GRPO जैसे मानक तरीकों से काफी बेहतर प्रदर्शन करते हैं।

मूल लेखक: Chu-Cheng Lin, Eugene Ie

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chu-Cheng Lin, Eugene Ie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन वर्तमान में बहुत भ्रमित छात्र को जटिल पहेलियाँ हल करना सिखा रहे हैं। आपके पास एक नोटबुक है जहाँ वे अपने विचारों को लिखने के लिए (एक "चेन ऑफ थॉट") स्क्रिबल कर सकते हैं।

आपने जो पेपर साझा किया है, वह एक विशिष्ट समस्या पर काम करता है: आप इस छात्र को कैसे सिखाते हैं जब वे शून्य से शुरुआत कर रहे होते हैं?

समस्या: "कोल्ड स्टार्ट" स्टॉल (The "Cold Start" Stall)

जब छात्र बिल्कुल नया होता है, तो वह लगभग कभी भी तुरंत सही उत्तर नहीं पाता है।

  • पुराना तरीका (RLVR/GRPO): यह तरीका एक सख्त शिक्षक की तरह है जो केवल अंतिम उत्तर के आधार पर "अच्छा काम किया!" या "फिर से कोशिश करो" देता है। यदि छात्र 99 बार लगातार गलत होता है, तो उसे कोई "अच्छा काम किया!" का संकेत नहीं मिलता। शिक्षक चमत्कार का इंतज़ार करता रहता है, लेकिन छात्र विफलता के एक लूप में फंसा रहता है। पेपर इसे "कोल्ड-स्टार्ट स्टॉलिंग" कहता है।
  • जाल: यदि आप छात्र को उन कुछ बारों से बहुत आक्रामक रूप से सीखने के लिए मजबूर करने की कोशिश करते हैं जब वे सही होते हैं, तो वे शिक्षक की गलतियों या परीक्षण प्रश्नों की विशिष्ट बारीकियों को याद करना (जिसे "नॉइज़ मेमोराइजेशन" कहा जाता है) शुरू कर सकते हैं।

समाधान: एक "कमिटमेंट" डायल (A "Commitment" Dial)

लेखक एक नया परिवार पेश करते हैं जो Tsallis Loss नामक गणितीय अवधारणा पर आधारित है। इसे एक डायल के रूप में सोचें जिसे "कमिटमेंट" (जिसे अक्षर q द्वारा दर्शाया गया है) लेबल किया गया है।

यह डायल यह नियंत्रित करता है कि शिक्षक छात्र की वर्तमान समझ के स्तर के बारे में कितना परवाह करता है बनाम किसी भी प्रयास, यहाँ तक कि एक बिखरे हुए प्रयास से भी सीखने के लिए उन्हें कितना प्रेरित करता है।

  • डायल को 0 पर सेट करना ("सुरक्षित" मोड):

    • उपमा: शिक्षक बहुत सतर्क है। वे केवल तभी ध्यान देते हैं जब छात्र पहले से ही कुछ परिचित कर रहा होता है।
    • परिणाम: शिक्षक बिखरे हुए, गलत प्रयासों को अनदेखा कर देता है। यह भ्रम (शोर) से बचने के लिए बहुत अच्छा है, लेकिन यदि छात्र शून्य ज्ञान के साथ शुरू करता है, तो शिक्षक उन्हें कभी धक्का नहीं देता। छात्र हमेशा के लिए वहीं फंसा रह जाता है।
    • पेपर का दावा: यह "कोल्ड स्टार्ट" से बाहर निकलने के लिए बहुत धीमा है।
  • डायल को 1 पर सेट करना ("आक्रामक" मोड):

    • उपमा: शिक्षक अत्यंत उत्साही है। वे हर प्रयास को, यहाँ तक कि भयानक प्रयास को भी, सीखने के एक मूल्यवान अवसर के रूप में देखते हैं। वे उन कुछ बारों से मिलने वाले संकेत को बढ़ा देते हैं जब छात्र सही होता है, चिल्लाकर कहते हैं, "देखो! तुमने कर दिखाया! इससे सीखो!"
    • परिणाम: छात्र शुरुआत में अविश्वसनीय रूप से तेजी से सीखता है। वह "कोल्ड स्टार्ट" से जल्दी बाहर निकल जाता है।
    • जोखिम: क्योंकि शिक्षक बहुत शोर मचा रहा है, छात्र शिक्षक की अपनी गलतियों या प्रश्नों के पूछने के विशिष्ट तरीके को याद करना शुरू कर सकता है।
  • डायल को 0.75 पर सेट करना ("स्वीट स्पॉट"):

    • उपमा: शिक्षक संतुलित है। वे छात्र को शुरुआती ब्लॉक से बाहर धकेलने के लिए पर्याप्त शोर मचाते हैं, लेकिन इतने भी शोर नहीं मचाते कि वे वास्तविक संकेत को शोर में डुबो दें।
    • पेपर का दावा: यह सेटिंग मॉडल को शुरुआत में तेजी से सीखने की अनुमति देती है बिना भ्रम की दीवार से टकराए।

डायल घुमाने के दो तरीके: GARL और PAFT

चूंकि गणित को पूरी तरह से गणना करना बहुत जटिल है, इसलिए लेखकों ने इस डायल को घुमाने के लिए दो व्यावहारिक उपकरण (एस्टिमेटर्स) बनाए हैं। इन्हें दो अलग-अलग शिक्षण शैलियों के रूप में समझें जो एक ही डायल का उपयोग करती हैं।

  1. GARL (द ब्रॉडकास्टर - "प्रसारक"):

    • यह कैसे काम करता है: शिक्षक छात्र से कई यादृच्छिक "विचार" (ट्रैजेक्टरीज) उत्पन्न करता है। भले ही अधिकांश गलत हों, शिक्षक उन कुछ को देखता है जो सही हैं और डायल सेटिंग के आधार पर उनके महत्व को बढ़ा (amplify) देता है।
    • पक्ष: यह बहुत तेज़ है और जब छात्र फंसा हुआ हो तो उसे आगे बढ़ने में मदद करने के लिए बेहतरीन है (कोल्ड स्टार्ट)।
    • हानि: कभी-कभी, शिक्षक बहुत उत्साहित हो जाता है, बुरे उदाहरणों को मिला देता है, और छात्र भ्रमित हो जाता है या प्रशिक्षण के दौरान क्रैश हो जाता है (अस्थिरता)।
  2. PAFT (द फ़िल्टर - "छलनी"):

    • यह कैसे काम करता है: शिक्षक कई विचार उत्पन्न करता है, लेकिन फिर वे उन्हें फ़िल्टर करते हैं। वे बिखरे हुए, गलत विचारों को फेंक देते हैं और केवल उन्हें रखते हैं जो वास्तव में सही उत्तर से मेल खाते हैं। फिर, वे केवल इन "अच्छे" उदाहरणों का उपयोग करके छात्र को सिखाते हैं, लेकिन वे डायल सेटिंग के आधार पर तीव्रता को कम (dampen) कर देते हैं।
    • पक्ष: यह बहुत स्थिर है। छात्र स्वच्छ, सुसंगत उदाहरणों से सीखता है। यह क्रैश नहीं होता।
    • हानि: यह शुरुआत में धीमा है क्योंकि यह बहुत सारा डेटा फेंक देता है।

प्रयोगों में क्या हुआ?

लेखकों ने तीन कठिन तर्क पहेलियों (FinQA, HotPotQA, और MuSiQue) पर इनका परीक्षण किया।

  • जब छात्र पूरी तरह से खोया हुआ था (कोल्ड स्टार्ट):

    • पुराने तरीके (डायल 0) पूरी तरह विफल रहे। छात्र कभी सीख नहीं पाया।
    • "ब्रॉडकास्टर" (GARL) उच्च डायल सेटिंग (0.75) के साथ सफल रहा। इसने छात्र को उस शुरुआती ब्लॉक से बाहर निकाला जहाँ अन्य विफल रहे थे।
    • दिलचस्प बात यह है कि 0.75 डायल पर "ब्रॉडकास्टर" ने डायल 1 की तुलना में बेहतर प्रदर्शन किया, जिससे साबित हुआ कि शुरुआत में थोड़ा शोर फ़िल्टर करना अच्छा है।
  • जब छात्र पहले से ही सीख रहा था (वार्म स्टार्ट):

    • कुछ पहेलियों (FinQA) पर, "ब्रॉडकास्टर" (GARL) कम डायल सेटिंग पर अच्छा काम करता है।
    • कठिन पहेलियों (HotPotQA, MuSiQue) पर, "ब्रॉडकास्टर" बहुत अधिक उत्साहित हो गया और छात्र का प्रदर्शन शून्य पर गिर गया।
    • "फ़िल्टर" (PAFT) यहाँ नायक बना। भले ही यह धीमा था, इसने छात्र को स्थिर रखा और उच्चतम अंतिम स्कोर प्राप्त किया।

मुख्य निष्कर्ष

लेखक तर्क देते हैं कि किसी तर्क मॉडल (reasoning model) को प्रशिक्षित करने का कोई एक "परफेक्ट" तरीका नहीं है।

  • यदि आपका मॉडल शून्य पर अटका हुआ है, तो आपको उच्च प्रतिबद्धता (high commitment) (उच्च डायल के साथ GARL) की आवश्यकता है ताकि इसे सीखने के लिए मजबूर किया जा सके।
  • यदि आपका मॉडल सीख रहा है लेकिन अस्थिर है, तो आपको स्थिरता (stability) (PAFT) की आवश्यकता है ताकि इसे ट्रैक पर रखा जा सके।

लेखकों ने एक "कंटीनम" (एक निरंतरता) बनाया है जो आपको इसे गतिशील रूप से समायोजित करने की अनुमति देता है, बजाय इसके कि आपको "सुरक्षित लेकिन धीमा" या "तेज़ लेकिन जोखिम भरा" में से किसी एक को चुनना पड़े। उन्होंने पाया कि एक मध्यम मार्ग (लगभग 0.75) अक्सर सबसे अच्छा परिणाम देता है: शुरुआत से बाहर निकलने के लिए पर्याप्त तेज़, लेकिन दौड़ पूरी करने के लिए पर्याप्त स्थिर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →