← नवीनतम पेपर
💬 NLP

Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production

यह शोध पत्र "कैच योर ब्रेथ" (CYB) को प्रस्तुत करता है, जो एक अनुक्रमिक निर्णय समस्या के रूप में फ्रेम किया गया एक सुपरवाइज्ड लॉस फंक्शन है जो फाउंडेशन मॉडल्स को इन्फरेंस के दौरान पॉज़ टोकन को स्वायत्त और अनुकूल रूप से सम्मिलित करने में सक्षम बनाता है ताकि कंप्यूट स्टेप्स को गतिशील रूप से आवंटित किया जा सके, जिससे बिना किसी कंप्यूटेशनल या मेमोरी लागत को बढ़ाए परप्लेक्सिटी और डाउनस्ट्रीम सटीकता में सुधार किया जा सके।

मूल लेखक: Alexandre Galashov, Matt Jones, Rosemary Ke, Yuan Cao, Vaishnavh Nagarajan, Michael C. Mozer

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexandre Galashov, Matt Jones, Rosemary Ke, Yuan Cao, Vaishnavh Nagarajan, Michael C. Mozer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही तेज़ गति वाली क्विज़ (quiz) दे रहे हैं। एक मानक AI मॉडल में, नियम सरल है: जैसे ही प्रश्न दिखाई दे, आपको तुरंत उत्तर चिल्लाना होगा। यदि आप हिचकिचाते हैं, तो आप अंक हार जाएंगे। भले ही प्रश्न कठिन हो और आपको सोचने के लिए एक क्षण की आवश्यकता हो, सिस्टम आपको तुरंत अनुमान लगाने के लिए मजबूर करता है।

अब, इस क्विज़ के लिए एक नया नियम "Catch Your Breath" (CYB) के रूप में कल्पना करें।

पुराना तरीका: "Think Before You Speak" (TBYS)

इस नए पेपर से पहले, शोधकर्ताओं ने टेक्स्ट में अदृश्य ठहराव (pauses) डालकर AI मॉडलों को "सोचने का समय" देने की कोशिश की थी। उन्होंने इसे "Think Before You Speak" (TBYS) कहा।

  • समस्या: मॉडल यह तय नहीं कर सकता कि उसे कब सोचना है। उसे हर बार पूरे दो सेकंड इंतजार करना ही पड़ता है, भले ही शब्द आसान हो (जैसे "the" या "and")।
  • परिणाम: यह वैसा ही है जैसे आपको हर बार दो सेकंड तक सांस रोकने के लिए मजबूर किया जाए जब आपको इसकी आवश्यकता न हो। यह समय बर्बाद करता है और वास्तव में मॉडल को बेहतर सोचने में मदद नहीं करता क्योंकि वह खुद तय नहीं कर सकता कि वह कब उलझन में है।

नया तरीका: "Catch Your Breath" (CYB)

लेखक एक स्मार्ट सिस्टम का प्रस्ताव देते हैं। एक मजबूर ठहराव के बजाय, वे मॉडल को एक विशेष बटन देते हैं जिस पर लिखा है "I Don't Know" (मुझे नहीं पता)

यह कैसे काम करता है:

  1. विकल्प: जब मॉडल कोई शब्द देखता है, तो वह या तो तुरंत उत्तर दे सकता है या "I Don't Know" बटन दबा सकता है।
  2. ठहराव: यदि वह बटन दबाता है, तो क्विज़ रुक जाती है। मॉडल को उस विशिष्ट शब्द के बारे में सोचने के लिए एक अतिरिक्त सेकंड (या दो, या तीन) मिलता है, इससे पहले कि उसे उत्तर देना पड़े।
  3. निर्णय: मॉडल यह सीख जाता है कि बटन केवल तभी दबाना है जब वह अनिश्चित महसूस करता है। यदि शब्द आसान है, तो वह तुरंत उत्तर देता है। यदि शब्द कठिन है (जैसे कोई जटिल गणित की समस्या या कठिन मुहावरा), तो वह बटन दबाता है, एक गहरी सांस लेता है, और उस अतिरिक्त समय का उपयोग करके उसे समझने की कोशिश करता है।

यह एक बड़ी बात क्यों है?

पेपर पुराने "मजबूर ठहराव" वाले तरीके की तुलना इस नए तरीके से दो परीक्षणों का उपयोग करके करता है:

1. "Perplexity" टेस्ट (मॉडल कितना भ्रमित है?)
कल्पना कीजिए कि "परप्लेक्सिटी" (perplexity) एक माप है कि मॉडल कितना खोया हुआ महसूस कर रहा है। कम होना बेहतर है।

  • शोधकर्ताओं ने इसका परीक्षण Google के Gemma AI मॉडलों पर किया।
  • परिणाम: "Catch Your Breath" वाले मॉडल "मजबूर ठहराव" वाले मॉडलों की तुलना में बहुत कम भ्रमित थे। वास्तव में, केवल एक ठहराव वाला CYB मॉडल, तीन ठहरावों वाले पुराने तरीके वाले मॉडल से बेहतर था। यह एक ऐसे छात्र की तरह है जो जानता है कि कब कड़ी मेहनत करनी है और वह उस छात्र से बेहतर ग्रेड प्राप्त करता है जिसे हर विषय के लिए प्रतिदिन तीन घंटे अध्ययन करने के लिए मजबूर किया जाता है।

2. "Downstream" टेस्ट (क्या यह वास्तव में समस्याओं को हल कर सकता है?)
उन्होंने वास्तविक दुनिया के कार्यों जैसे बहुविकल्पीय प्रश्नों (MMLU) के उत्तर देने और गणित की समस्याओं (GSM8K) को हल करने पर इनका परीक्षण किया।

  • परिणाम: CYB मॉडलों ने अधिक प्रश्न सही हल किए। वे तर्क करने और संदर्भ को समझने में बेहतर थे।

असली मंत्र: Self-Regulation (स्व-नियमन)

इस पेपर का सबसे महत्वपूर्ण हिस्सा यह है कि मॉडल स्वयं को नियंत्रित करना सीखता है

  • इसे किसी इंसान द्वारा यह बताने की आवश्यकता नहीं है कि, "रुको, यह एक कठिन शब्द है।"
  • यह सीख जाता है कि यदि वह "I Don't Know" कहता है, तो उसे सोचने के लिए अधिक समय मिलता है, और यदि वह इस समय का बुद्धिमानी से उपयोग करता है, तो उसे बेहतर स्कोर मिलता है।
  • पेपर ने पाया कि मॉडल स्वाभाविक रूप से कठिन शब्दों (जैसे "challenges" या "applications") पर अधिक रुकता है और आसान शब्दों (जैसे "is" या "don't") पर ठहराव को छोड़ देता है। यह एक मानव पाठक की तरह है जो एक जटिल वाक्य को पढ़ने के लिए धीमा हो जाता है लेकिन एक सरल वाक्य को जल्दी से पढ़ लेता है।

यह पेपर क्या दावा नहीं करता है

यह महत्वपूर्ण है कि हम उन बातों पर टिके रहें जो लेखकों ने वास्तव में पाई हैं:

  • यह समय बचाने के बारे में नहीं है: पेपर यह दावा नहीं करता कि यह AI को तेज़ बनाता है। वास्तव में, क्योंकि मॉडल अतिरिक्त समय ले सकता है, इसलिए इसमें कभी-कभी अधिक समय लग सकता है। लक्ष्य सटीकता (accuracy) है, गति नहीं।
  • यह हर चीज़ के लिए जादुई समाधान नहीं है: पेपर विशेष रूप से इस बात पर केंद्रित है कि मॉडल को इन "पॉज" टोकन का बेहतर उपयोग करने के लिए कैसे प्रशिक्षित किया जाए। यह दावा नहीं करता कि यह सभी AI समस्याओं को हल कर देगा या इसका उपयोग चिकित्सा निदान या सेल्फ-ड्राइविंग कारों में किया जाएगा (इन अनुप्रयोगों का उल्लेख टेक्स्ट में नहीं है)।
  • यह मानवीय अर्थ में "सोचने" के बारे में नहीं है: यह पेपर मॉडल के व्यवहार की तुलना मानव पढ़ने की आदतों (जहाँ हम कठिन शब्दों पर रुकते हैं) से करता है, लेकिन यह कंप्यूटर द्वारा डेटा को प्रोसेस करने के तरीके में एक विशुद्ध गणितीय और इंजीनियरिंग सुधार है।

सारांश

यह पेपर Catch Your Breath नामक एक नई प्रशिक्षण पद्धति पेश करता है। AI को सोचने के लिए एक निश्चित समय प्रतीक्षा करने के लिए मजबूर करने के बजाय, यह AI को यह तय करने देता है कि उसे कब सोचने के लिए एक क्षण की आवश्यकता है। "I Don't Know" बटन दबाकर, AI को कठिन शब्दों को प्रोसेस करने के लिए अतिरिक्त समय मिलता है। परिणाम दिखाते हैं कि यह आत्म-नियंत्रण AI को अधिक स्मार्ट, कम भ्रमित और प्रश्नों के उत्तर देने में बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →