← नवीनतम पेपर
💬 NLP

AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth

AdaPonderLM एक स्व-पर्यवेक्षित (self-supervised) आवर्ती भाषा मॉडल है जो कठिन टोकन के लिए कंप्यूट को गतिशील रूप से आवंटित करने हेतु टोकन-वार अनुकूलनशील रुकने वाले गेटों (adaptive halting gates) और KV पुन: उपयोग का उपयोग करता है, जिससे फिक्स्ड-डेप्थ बेसलाइन की तुलना में प्रदर्शन से समझौता किए बिना महत्वपूर्ण दक्षता लाभ प्राप्त होता है।

मूल लेखक: Shixiang Song, He Li, Zitong Wang, Boyi Zeng, Feichen Song, Yixuan Wang, Zhiqin John Xu, Ziwei He, Zhouhan Lin

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shixiang Song, He Li, Zitong Wang, Boyi Zeng, Feichen Song, Yixuan Wang, Zhiqin John Xu, Ziwei He, Zhouhan Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक हज़ार मेहमानों के लिए एक विशाल दावत बनाने की कोशिश कर रहे हैं। एक पारंपरिक रसोई (स्टैंडर्ड AI मॉडल) में, शेफ एक सख्त रेसिपी का पालन करता है: "हर सब्जी को ठीक 30 सेकंड तक काटें, चाहे कुछ भी हो।"

यदि वह सब्जी एक नरम टमाटर है, तो 30 सेकंड समय की बर्बादी है। यदि वह एक सख्त आलू है, तो 30 सेकंड काफी नहीं है। शेफ हर चीज़ पर समान प्रयास करता है, जो अक्षम है।

AdaPonderLM एक स्मार्ट, आत्म-जागरूक शेफ की तरह है जो प्रत्येक सामग्री को व्यक्तिगत रूप से परखना सीखता है। वह पूछता है, "क्या यह टमाटर नरम है? हाँ? हो गया! आगे बढ़ो। क्या यह आलू सख्त है? काटते रहो!"

यहाँ इस पेपर के काम करने का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "एक ही आकार के लिए सभी" वाली रसोई (The "One-Size-Fits-All" Kitchen)

वर्तमान AI मॉडल (जैसे वे जिनसे आप चैट करते हैं) लेयर्स (परतों) में काम करते हैं। एक वाक्य को समझने के लिए, वे शब्दों को इन लेयर्स के माध्यम से बार-बार पास करते हैं।

  • पुराना तरीका: मॉडल को बताया जाता है कि हर एक शब्द को ठीक 4 बार लेयर्स से गुजरना होगा।
  • बर्बादी: कुछ शब्द आसान होते हैं (जैसे "the" या "and")। उन्हें 4 पास की आवश्यकता नहीं होती; उन्हें तुरंत समझ लिया जाता है। लेकिन मॉडल उन्हें प्रोसेस करने में ऊर्जा बर्बाद करता है। अन्य शब्द कठिन होते हैं (जैसे जटिल नाम या अमूर्त अवधारणाएं), और उन्हें वास्तव में 4 से अधिक पास की आवश्यकता हो सकती है, लेकिन मॉडल फिर भी रुक जाता है।

2. समाधान: "स्मार्ट स्टॉप" बटन (The "Smart Stop" Button)

लेखकों ने AdaPonderLM बनाया है, जो आसान शब्दों के लिए "स्टॉप" बटन दबाना सीखता है और कठिन शब्दों के लिए "थिंक" बटन को दबाए रखता है।

  • द्वारपाल (MLP Gate): कल्पना करें कि हर शब्द के लिए क्लब के बाहर एक बाउंसर खड़ा है। सोचने के पहले दौर के बाद, बाउंसर शब्द की जांच करता है।
    • आसान शब्द: "मैं समझ गया। तुम्हारा काम हो गया।" (शब्द की प्रोसेसिंग रुक जाती है)।
    • कठिन शब्द: "अभी नहीं, सोचते रहो।" (शब्द अगले दौर में जाता है)।
  • स्व-शिक्षित: खास बात यह है कि मॉडल यह कौशल खुद सीखता है जब वह पढ़ना सीख रहा होता है, बिना किसी मानव शिक्षक के यह कहे कि, "यहाँ रुको।" वह खुद समझ जाता है कि आसान शब्दों को गहरी सोच की आवश्यकता नहीं है।

3. जादुई ट्रिक: "फ्रोजन फोटो" (KV Reuse)

यह वह तकनीकी गुप्त सूत्र है जो इसे तेज़ बनाता है।

एक सामान्य कंप्यूटर में, यदि कोई शब्द सोचना बंद कर देता है, तो कंप्यूटर को आमतौर पर उसे अगले चरण के लिए याद रखने के लिए कुछ काम करना पड़ता है।

  • उपमा: कल्पना करें कि आप एक ग्रुप फोटो ले रहे हैं। यदि कोई व्यक्ति फ्रेम से जल्दी बाहर निकल जाता है, तो आपको आमतौर पर पूरे समूह की एक नई फोटो लेनी पड़ती है जिसमें वह व्यक्ति न हो, जो धीमा होता है।
  • AdaPontLM की ट्रिक: जैसे ही कोई शब्द सोचना बंद करता है, यह मॉडल उसका एक "स्नैपशॉट" (डेटा कैश) ले लेता है। शेष चरणों के लिए, यह बस उस स्नैपशॉट का पुन: उपयोग करता है। यह उस शब्द के लिए कुछ भी दोबारा कैलकुलेट नहीं करता है। यह ऐसा है जैसे कहना, "हम जानते हैं कि यह शब्द क्या है; आइए इसके मेमोरी को बाकी प्रक्रिया के लिए कॉपी-पेस्ट कर दें।"

इससे ऊर्जा (कंप्यूटिंग पावर) की भारी बचत होती है क्योंकि कंप्यूटर को उन शब्दों के लिए काम दोबारा नहीं करना पड़ता जो पहले ही हल हो चुके हैं।

4. परिणाम: केवल तेज़ नहीं, बल्कि स्मार्ट (Smarter, Not Just Faster)

शोधकर्ताओं ने छोटे (70 मिलियन पैरामीटर्स) से लेकर काफी बड़े (2.8 बिलियन) मॉडल्स पर इसका परीक्षण किया।

  • बचत: उन्होंने पाया कि AdaPonderLM बिना AI को कम बुद्धिमान बनाए कंप्यूटिंग कार्य को लगभग 10% कम कर सकता है।
  • व्यवहार: जब उन्होंने मॉडल के अंदर देखा, तो उन्होंने पाया कि यह बिल्कुल उम्मीद के मुताबिक काम कर रहा था:
    • आसान शब्द (जैसे "the") केवल 1 या 2 दौर के बाद रुक गए।
    • कठिन शब्द (जैसे जटिल तर्क या दुर्लभ नाम) 3 या 4 दौर तक चलते रहे।
  • तुलना: उन्होंने मॉडल को बेतरतीब ढंग से रोकने की कोशिश की (जैसे एक निश्चित नियम के तहत), लेकिन सीखा हुआ स्मार्ट स्टॉप बहुत बेहतर था। उसे पता था कि ठीक कौन से शब्दों को मदद की ज़रूरत थी।

सारांश

AdaPonderLM एक ऐसा AI है जो कुशल बनना सीखता है। हर शब्द के लिए समान मात्रा में सोचने के बजाय, यह एक अनुभवी विशेषज्ञ की तरह काम करता है: यह आसान चीजों पर एक नज़र डालता है और आगे बढ़ जाता है, लेकिन कठिन चीजों पर गहराई से विचार करने के लिए रुकता है। और एक चतुर "मेमोरी रियूज" ट्रिक के साथ, यह कंप्यूटर को धीमा किए बिना यह करता है।

यह एक ऐसे छात्र के बीच का अंतर है जो किताब के हर शब्द को एक ही गति से पढ़ता है, बनाम एक ऐसे छात्र के बीच जो आसान हिस्सों को सरसरी तौर पर पढ़ता है और कठिन अध्यायों को पढ़ने के लिए धीमा हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →