← नवीनतम पेपर
💬 NLP

Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning

यह शोध पत्र स्टेप-वाइज एडेप्टिव पेनलाइजेशन (SWAP) का प्रस्ताव करता है, जो एक सूक्ष्म-स्तरीय सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो सही उत्तर में उनके योगदान के आधार पर कम-महत्वपूर्ण तर्क चरणों को गतिशील रूप से लंबाई दंड (लेंथ पेनल्टी) आवंटित करता है, जिससे प्रदर्शन से समझौता किए बिना तर्क की लंबाई में 64.3% की कमी और सटीकता में 5.7% का सुधार प्राप्त होता है।

मूल लेखक: Xintong Li, Sha Li, Rongmei Lin, Hongye Jin, Linwei Li, Hejie Cui, Sarah Zhang, Chia-Yuan Chang, Kewei Cheng, Besnik Fetahu, Priyanka Nigam, Jingbo Shang, Bing Yin

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xintong Li, Sha Li, Rongmei Lin, Hongye Jin, Linwei Li, Hejie Cui, Sarah Zhang, Chia-Yuan Chang, Kewei Cheng, Besnik Fetahu, Priyanka Nigam, Jingbo Shang, Bing Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल गणितीय समस्या को हल करने के लिए एक बेहद बुद्धिमान लेकिन बहुत अधिक बोलने वाले सलाहकार (कंसल्टेंट) को काम पर रख रहे हैं।

समस्या: वह सलाहकार जो बोलना बंद नहीं करता
आपका सलाहकार अविश्वसनीय रूप से स्मार्ट है। यदि आप उनसे पूछते हैं, "मैं इस समीकरण को कैसे हल करूँ?" तो वे ज़ोर से सोचना शुरू कर देते हैं। लेकिन यहाँ एक पेंच है: वे ज़रूरत से ज़्यादा सोचने (overthink) लगते हैं। वे संख्याओं के इतिहास को समझाने में 10 मिनट बिता सकते हैं, फिर अपने काम की तीन बार जाँच करने में 5 मिनट लगा सकते हैं, और अंत में उत्तर लिखने में 2 मिनट।

हालाँकि उत्तर सही होता है, लेकिन यह "ज़ोर से सोचना" (जिसे Chain-of-Thought कहा जाता है) निम्नलिखित कारणों से समस्याग्रस्त है:

  1. महँगा: उन सभी शब्दों को उत्पन्न करने के लिए कंप्यूटर चलाना बहुत पैसा और समय खर्च करता है।
  2. जोखिम भरा: वे जितना अधिक बोलते हैं, उतनी ही अधिक संभावना होती है कि वे गलती से कुछ गलत कह दें या भ्रमित हो जाएँ (hallucinate)।
  3. अकुशल: उनमें से अधिकांश शब्द केवल "फालतू बातें" (fluff) या दोहराव होते हैं। केवल कुछ ही वाक्य वास्तव में समाधान की ओर बढ़ते हैं।

इसे ठीक करने के पिछले प्रयास एक "कुंद हथौड़े" (blunt hammer) की तरह थे। उन्होंने सलाहकार को कहा, "आप कुल 5 मिनट तक ही बोल सकते हैं।" परिणाम यह हुआ कि सलाहकार घबरा गया, समय सीमा के भीतर रहने के चक्कर में अपने सबसे अच्छे विचारों को ही बीच में ही छोड़ दिया, और गलत उत्तर दे दिया।

समाधान: SWAP (एक स्मार्ट एडिटर)
यह शोध पत्र एक नई विधि पेश करता है जिसे SWAP (Step-wise Adaptive Penalization) कहा जाता है। SWAP को एक "समय-सीमा लागू करने वाले" के रूप में नहीं, बल्कि एक सुपर-स्मार्ट एडिटर के रूप में सोचें जो वास्तविक समय में सलाहकार को सुनता है।

SWAP कैसे काम करता है, इसे एक सरल उदाहरण से समझते हैं:

1. "प्रगति मीटर" (मूल्य मापना)

कल्पना कीजिए कि सलाहकार शिखर (सही उत्तर) तक पहुँचने के लिए एक पहाड़ पर चढ़ रहा है।

  • उच्च-मूल्य वाले कदम (High-Value Steps): कुछ कदम खड़ी चढ़ाई की तरह होते हैं जो आपको शिखर के 100 फीट करीब ले जाते हैं। ये "Aha!" क्षण हैं।
  • कम-मूल्य वाले कदम (Low-Value Steps): अन्य कदम केवल गोल-गोल घूमने, अपने जूतों के फीते चेक करने, या बादलों को निहारने जैसे हैं। ये आपको शिखर के करीब नहीं ले जाते।

SWAP के पास एक विशेष मीटर है जो मापता है कि प्रत्येक वाक्य उत्तर की ओर कितनी प्रगति करता है। यदि कोई वाक्य प्रगति नहीं करता है, तो मीटर स्थिर रहता है।

2. "स्मार्ट टैक्स" (जुर्माना पुनर्वितरण)

यदि सलाहकार बहुत अधिक बोलता है, तो SWAP को उन्हें रोकने के लिए एक "पेनल्टी" (जुर्माना) लगाना होगा।

  • पुराना तरीका (कुंद हथौड़ा): जुर्माना हर वाक्य पर समान रूप से लगाया जाता है। यह "Aha!" क्षणों को भी उतना ही दंडित करता है जितना कि "जूते के फीते चेक करने" को। सलाहकार डर जाता है और बहुत जल्दी बोलना बंद कर देता है, जिससे वह समाधान खो देता है।
  • SWAP का तरीका (स्मार्ट टैक्स): SWAP "प्रगति मीटर" को देखता है।
    • यदि कोई वाक्य "जूते के फीते चेक करने" जैसा था (कम मूल्य), तो SWAP उस पर भारी जुर्माना लगाता है।
    • यदि कोई वाक्य "खड़ी चढ़ाई" जैसा था (उच्च मूल्य), तो SWAP उसे छूट देता है या बहुत मामूली जुर्माना लगाता है।

परिणाम यह है कि मॉडल जूते के फीते और बादलों के बारे में बात करना बंद करना सीख जाता है, लेकिन पहाड़ के रास्ते के बारे में बात करना जारी रखता है। वे कम शब्दों में, तेज़ गति से, और सही उत्तर के साथ शिखर तक पहुँचते हैं।

3. "सुरक्षा जाल" (परिणाम बनाम प्रक्रिया)

SWAP मॉडल को प्रशिक्षित करने के लिए दो प्रकार के फीडबैक का उपयोग करता है:

  • आउटकम रिवॉर्ड (Outcome Reward): "क्या आपने सही उत्तर प्राप्त किया?" (अंतिम ग्रेड)।
  • प्रोसेस रिवॉर्ड (Process Reward): "क्या आपने कुशल मार्ग अपनाया?" (होमवर्क की गुणवत्ता)।

SWAP इन दोनों को जोड़ता है। यह "स्मार्ट टैक्स" तभी लागू करता है जब अंतिम उत्तर सही होता है। यह सुनिश्चित करता है कि मॉडल आलसी न बने और समय बचाने के लिए बस उत्तर का अनुमान न लगाने लगे। इसे कुशल रूप से सही होना चाहिए।

परिणाम

जब शोधकर्ताओं ने गणित की समस्याओं पर इसका परीक्षण किया:

  • छोटे उत्तर: मॉडल्स ने अपने सोचने के समय को औसतन 64% कम कर दिया। कल्पना कीजिए कि एक 10 मिनट का भाषण एक संक्षिप्त 3 मिनट के स्पष्टीकरण में बदल गया।
  • बेहतर सटीकता: आश्चर्यजनक रूप से, मॉडल्स ने वास्तव में अधिक प्रश्न सही हल किए (5.7% की वृद्धि)। "फालतू बातों" को हटाकर, वे अपनी ही बड़बड़ाहट से भ्रमित होने से बच गए।

संक्षेप में

SWAP AI मॉडल्स को बिना लापरवाह हुए संक्षिप्त होना सिखाता है। यह एक कुत्ते को हर पत्ते पर भौंकने (अनावश्यक कदम) से रोकने, लेकिन गिलहरी दिखने पर भौंकने (आवश्यक तर्क) के लिए प्रशिक्षित करने जैसा है। परिणाम एक स्मार्ट, तेज़ और सस्ता AI है जो सीधे मुद्दे पर आता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →