← नवीनतम पेपर
💬 NLP

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

यह शोध पत्र 'पेयर-इन, पेयर-आउट' (PIPO) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो लेटेंसी में महत्वपूर्ण तेजी लाने और एक अलग सत्यापनकर्ता पास (verifier pass) के बिना बड़े भाषा मॉडलों में बेहतर तर्क प्रदर्शन प्राप्त करने के लिए लेटेंट इनपुट संपीड़न (latent input compression) को मल्टी-टोकन आउटपुट प्रेडिक्शन और एक हल्के आत्मविश्वास-आधारित स्वीकृति तंत्र (confidence-based acceptance mechanism) के साथ जोड़ता है।

मूल लेखक: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े भाषा मॉडल (LLM) की कल्पना एक बहुत ही बुद्धिमान, लेकिन बहुत धीमे लेखक के रूप में करें जो एक बार में एक शब्द लिखकर कहानियाँ लिखता है। एक कठिन गणित की समस्या को हल करने या जटिल कोड लिखने के लिए, इस लेखक को अंतिम उत्तर लिखने से पहले एक लंबी "सोचने की प्रक्रिया" (chain of thought) के माध्यम से ज़ोर-शोर से सोचना पड़ता है। समस्या यह है कि एक शब्द लिखना, रुकना, सोचना और फिर अगला शब्द लिखना अविश्वसनीय रूप से धीमा और महंगा है।

यह शोध पत्र PIPO (पेयर-इन, पेयर-आउट) नामक एक नई विधि पेश करता है ताकि इस लेखक को बिना गलतियाँ किए बहुत तेज़ बनाया जा सके। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "एक-समय-पर-एक-कदम" की बाधा

वर्तमान में, लेखक एक टाइपराइटर पर टाइप करने वाले व्यक्ति की तरह काम करता है: वे एक अक्षर टाइप करते हैं, "Enter" दबाते हैं, मशीन द्वारा प्रोसेस होने का इंतज़ार करते हैं, फिर अगला अक्षर टाइप करते हैं, और इसी तरह। भले ही लेखक बुद्धिमान हो, मशीन धीमी है क्योंकि वह एक चक्र में केवल एक ही अक्षर को संभाल सकती है।

2. समाधान: "डबल-डेक" बस (PIPO)

PIPO सड़क के नियमों को बदल देता है। लेखक को एक बार में एक शब्द प्रोसेस करने के बजाय, PIPO उन्हें एक साथ दो शब्द प्रोसेस करने की अनुमति देता है।

  • पेयर-इन (कंप्रेशन/संक्षेपण): कल्पना करें कि लेखक को दो अक्षरों का एक ढेर (जैसे, "T" और "h") प्राप्त होता है। उन्हें मशीन में अलग-अलग डालने के बजाय, एक विशेष "कंप्रेसर" उन्हें एक एकल, सघन पैकेज (एक लेटेंट रिप्रेजेंटेशन) में एक साथ मोड़ देता है। यह एक बड़े मानचित्र को एक छोटी जेब वाले रूमाल की तरह मोड़ने जैसा है ताकि वह एक संकीले दरवाजे से फिट हो सके।
  • यात्रा: मशीन इस एकल "मुड़े हुए" पैकेज को प्रोसेस करती है।
  • पेयर-आउट (अनफोल्डिंग/खोलना): एक बार जब मशीन अपना काम पूरा कर लेती है, तो वह केवल एक अक्षर नहीं उगलती। इसमें एक विशेष "अनफोल्डिंग हेड" होता है जो परिणाम लेता है और तुरंत दो अक्षर बनाता है: अपेक्षित अगला शब्द और एक अनुमानित ड्राफ्ट शब्द (जैसे, "e" और " ")।

परिणाम: अब लेखक हर एक मशीन चक्र के लिए दो अक्षर लिख रहा है। यह प्रभावी रूप से लिखने की गति को दोगुना कर देता है।

3. जोखिम: "अनुमान लगाने का खेल"

एक पकड़ है। दूसरे शब्द का अनुमान लगाना एक अंदाज़ा है। यदि अंदाज़ा गलत हुआ, तो पूरा वाक्य निरर्थक हो सकता है।

  • पुराना तरीका (स्पेक्टिवल डिकोडिंग): पहले, यह जाँचने के लिए कि क्या कोई अनुमान सही था, लेखक को रुकना पड़ता था, एक विशाल "सत्यापन" परीक्षण चलाना पड़ता था (जैसे एक वरिष्ठ संपादक द्वारा पूरे ड्राफ्ट को फिर से पढ़ना), और फिर तय करना पड़ता था कि अनुमान अच्छा था या नहीं। यह सत्यापन चरण इतना धीमा था कि इसने गति के लाभों को समाप्त कर दिया।
  • PIPO का तरीका (कॉन्फिडेंस हेड): PIPO लेखक के ठीक बगल में एक छोटा, अत्यंत तेज़ "कॉन्फिडेंस मीटर" (विश्वास मीटर) स्थापित करता है। यह मीटर उन दो शब्दों को देखने और तुरंत यह कहने के लिए प्रशिक्षित है कि, "मुझे इस दूसरे शब्द के बारे में 95% यकीन है कि यह सही है," या "मुझे यकीन नहीं है, चलो इसे छोड़ देते हैं।"
    • यदि मीटर कहता है "जाओ" (Go), तो लेखक दोनों शब्दों को रखता है।
    • यदि मीटर कहता है "नहीं" (No), तो वह पहले शब्द को रखता है और दूसरे को लय बनाए रखने के लिए एक "खाली स्थान" (पैडिंग) से बदल देता है।

4. गुप्त नुस्खा: गलतियों से सीखना (ऑन-पॉलिसी डिस्टिलेशन)

यह "कॉन्फिडेंस मीटर" बिना किसी धीमे संपादक के इतना सटीक होने के लिए कैसे सीखता है?

यह शोध पत्र एक चतुर प्रशिक्षण तकनीक का उपयोग करता है जिसे ऑन-पॉलिसी डिस्टिलेशन कहा जाता है।

  • कल्पना करें कि लेखक (छात्र) एक कहानी लिखने की कोशिश करता है।
  • एक सुपर-स्मार्ट शिक्षक (एक बड़ा, पूर्व-प्रशिक्षित मॉडल) भी वही कहानी लिखता है।
  • सिस्टम छात्र के अनुमान की तुलना शिक्षक के उत्तर से करता है।
  • जादू: सिस्टम यह महसूस करता है कि "शिक्षक" पुराने तरीके में काम करने वाले "संपादक" के समान ही काम कर रहा है। इसलिए, हर बार एक धीमे संपादक की जाँच चलाने के बजाय, सिस्टम सीखने के चरण के दौरान ही शिक्षक के उत्तरों का उपयोग "कॉन्फिडेंस मीटर" को प्रशिक्षित करने के लिए करता है।
  • एक बार प्रशिक्षित होने के बाद, कॉन्फिडेंस मीटर बिल्कुल जानता है कि कब अनुमान पर भरोसा करना है और कब सावधान रहना है, और यह सब वास्तविक लेखन प्रक्रिया के दौरान धीमे संपादक की आवश्यकता के बिना किया जाता है।

5. परिणाम: तेज़ और स्मार्ट

इस शोध पत्र ने कठिन गणित और कोडिंग कार्यों (जैसे AIME गणित प्रतियोगिता और कोडिंग बेंचमार्क) पर परीक्षण किया।

  • गति: क्योंकि यह एक साथ दो शब्दों को प्रोसेस करता है और धीमे संपादक की जाँच को छोड़ देता है, PIPO मानक पद्धति की तुलना में 2 से 2.6 गुना तेज़ है। यह पहला शब्द बहुत जल्दी बाहर निकालता है और प्रवाह को बनाए रखता है।
  • सटीकता: आश्चर्यजनक रूप से, यह न केवल तेज़ हुआ; बल्कि यह बेहतर भी हुआ। एक ही स्थान में अधिक "विचार" समाहित करके (क्योंकि यह इनपुट को कंप्रेस करता है), मॉडल लंबी, अधिक पूर्ण तर्क श्रृंखलाएं उत्पन्न कर सकता है। कुछ परीक्षणों में, सफलता दर सामान्य तरीकों की तुलना में 7 अंक से अधिक बढ़ गई।

सारांश

PIPO एक डिलीवरी ट्रक को सिंगल-लेन सड़क से डबल-लेन हाईवे में अपग्रेड करने जैसा है।

  1. कार्गो को कंप्रेस करें (इनपुट) ताकि दो पैकेज एक स्लॉट में फिट हो सकें।
  2. एक साथ दो पैकेज डिलीवर करें (आउटपुट)।
  3. एक स्मार्ट सेंसर (कॉन्फिडेंस हेड) का उपयोग करें कि दूसरा पैकेज सुरक्षित है या नहीं, जिसे एक शिक्षक द्वारा प्रशिक्षित किया गया है जो पहले से ही उत्तर जानता है।

यह AI को लंबे समय तक सोचने और तेज़ी से उत्तर देने की अनुमति देता है, जिससे सामान्य मंदी के बिना जटिल समस्याओं को हल किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →