← नवीनतम पेपर
💬 NLP

Tyler: Typed Latent Reasoning for Language Models -- When to Think, What to Compute, and How Much to Allocate

यह शोधपत्र Tyler का प्रस्ताव करता है, जो एक टाइप किया हुआ और बजट-जागरूक ढांचा है जो ऑटोरेग्रेसिव डिकोडिंग के दौरान टेक्स्ट टोकन उत्सर्जित करने और विशिष्ट लेटेंट कंप्यूटेशन मॉड्यूल को इनवोक करने के बीच स्विच करना गतिशील रूप से सीखता है, जिससे मौजूदा चेन-ऑफ-थॉट और लेटेंट रीजनिंग विधियों की तुलना में तर्क सटीकता और दक्षता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Hanyu Lin, Min Cai, Jiawei Wen, Haodi Zhang

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanyu Lin, Min Cai, Jiawei Wen, Haodi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन गणित की समस्या को हल करने की कोशिश कर रहे हैं। आपके पास इसे करने के दो तरीके हैं:

  1. "बोलकर समझाने" का तरीका (चेन-ऑफ-थॉट): आप अपने सोचने के हर एक कदम को कागज पर लिखते जाते हैं। "सबसे पहले, मुझे इन संख्याओं को जोड़ना होगा। फिर, मुझे इन्हें दो से भाग देना होगा..." यह आपको सही उत्तर पाने में मदद करता है, लेकिन इसमें सब कुछ लिखने में बहुत समय लगता है, और आप बहुत सारा कागज (या कंप्यूटर प्रोसेसिंग पावर) उन कदमों पर बर्बाद कर सकते हैं जो स्पष्ट रूप से समझ में आने वाले थे।

  2. "मौन चिंतन" का तरीका (लेटेंट रीजनिंग): आप अपनी कुछ सोच को अपने दिमाग के अंदर रखते हैं, बिना उसे लिखे। यह तेज़ है और जगह बचाता है, लेकिन मौजूदा तरीके इसे करने में थोड़े अनाड़ी हैं। या तो वे रैंडम समय पर "मौन रूप से सोचने" का निर्णय लेते हैं, या वे एक सामान्य "मौन विचार" का उपयोग करते हैं जिसे यह नहीं पता होता कि वह किस तरह की सोच रहा है।

TYLER एक नया सिस्टम है जो आपको दोनों का सबसे अच्छा मिश्रण देने की कोशिश करता है। इसे एक नोटबुक के बजाय AI को एक स्मार्ट, मल्टी-टूल बैकपैक देने के रूप में समझें।

वर्तमान "मौन" चिंतन के साथ समस्या

वर्तमान मौन चिंतन के तरीके एक ऐसे कर्मचारी की तरह हैं जिसके पास हथौड़ा तो है लेकिन उसे नहीं पता कि उसका उपयोग कब करना है। वे तब भी हथौड़ा चला सकते हैं जब उन्हें बोल्ट कसना चाहिए था। उन्हें यह भी नहीं पता होता कि किसी कार्य पर कितना समय बिताना है। वे बस तब तक हथौड़ा चलाते रहते हैं जब तक उनकी ऊर्जा या समय समाप्त नहीं हो जाता।

TYLER समाधान: एक विशिष्ट टूलकिट

TYLER AI को तीन विशिष्ट "मौन उपकरण" (जिन्हें ऑपरेटर्स कहा जाता है) देता है जिन्हें वह ज़रूरत पड़ने पर बिना लिखे अपने बैकपैक से निकाल सकता है:

  1. "बड़ी तस्वीर" वाला टूल (ग्लोबल ओरिएंटेशन): जब AI अटक जाता है या भ्रमित हो जाता है, तो वह पूरी रणनीति की योजना बनाने के लिए एक कदम पीछे हटने हेतु इस टूल का उपयोग करता है। यह गाड़ी चलाने से पहले नक्शा देखने के समान है।
  2. "नोट लेने" वाला टूल (स्टेट अपडेट): जब AI को किसी विशिष्ट संख्या या तथ्य को याद रखने की आवश्यकता होती है जिसे उसने अभी-अभी कैलकुलेट किया है, तो वह अपने आंतरिक मेमोरी को अपडेट करने के लिए इस टूल का उपयोग करता है। यह आपके दिमाग के अंदर एक स्टिकी पैड पर त्वरित नोट लिखने जैसा है।
  3. "पैटर्न-मैचिंग" वाला टूल (प्रोसीजरल एब्स्ट्रैक्शन): जब AI किसी ऐसी समस्या को देखता है जिसे उसने पहले हल किया है, तो वह पिछली बार उपयोग किए गए सटीक चरणों को याद करने के लिए इस टूल का उपयोग करता है। यह यह याद करने जैसा है, "ओह, यह बिल्कुल उसी पहेली जैसा है जिसे मैंने कल हल किया था; मुझे इसका तरीका पता है।"

यह कैसे काम करता है: एक स्मार्ट मैनेजर

TYLER का जादू केवल उपकरणों के पास होना नहीं है; इसमें AI के भीतर एक स्मार्ट मैनेजर होता है।

  • कब सोचना है: मैनेजर लगातार AI के आत्मविश्वास की जांच करता रहता है। यदि AI सुनिश्चित है, तो वह उत्तर लिखता रहता है (दृश्य टेक्स्ट)। यदि AI भ्रमित है या उसे जटिल गणित करने की आवश्यकता है, तो मैनेजर कहता है, "रुको! एक टूल निकालो!"
  • कौन सा टूल? मैनेजर केवल एक रैंडम टूल नहीं उठाता। वह पूछता है, "क्या हमें एक नक्शा (ग्लोबल), एक नोट (स्टेट), या एक पैटर्न (प्रोसीजर) की आवश्यकता है?" और सही टूल चुनता है।
  • कितना समय? मैनेजर के पास एक बजट भी होता है। वह जानता है कि एक साधारण प्रश्न के लिए 10 मिनट तक मौन रूप से सोचने में समय बर्बाद नहीं करना है। वह कुशलतापूर्वक काम पूरा करने के लिए पर्याप्त "मौन समय" आवंटित करता है।

जब उन्होंने इसका परीक्षण किया तो क्या हुआ?

शोधकर्ताओं ने तीन अलग-अलग आकार के AI दिमागों (छोटे से मध्यम आकार तक) पर TYLER का परीक्षण किया और उन्हें कठिन गणित, विज्ञान और तर्क संबंधी पहेलियाँ दीं।

  • बेहतर स्कोर: TYLER ने मानक "बोलकर समझाने" वाले तरीके और अन्य "मौन चिंतन" वाले तरीकों की तुलना में काफी अधिक स्कोर प्राप्त किया। कुछ मामलों में इसने सटीकता में 14 अंक तक सुधार किया।
  • कम भूलना: जब उन्होंने AI को एक के बाद एक विभिन्न प्रकार की समस्याएं सिखाईं (जैसे कोडिंग, फिर विज्ञान, फिर गणित सीखना), तो TYLER नया सीखने के दौरान पुरानी चीजों को याद रखने में बहुत बेहतर था। वह पिछले कार्यों को करने के तरीके से भ्रमित नहीं हुआ या "भूल" नहीं गया।
  • तेज़ और स्मार्ट: भले ही यह अतिरिक्त "मौन" सोच कर रहा था, फिर भी यह अक्सर कुल मिलाकर तेज़ था क्योंकि इसने अनावश्यक कदमों को लिखने में समय बर्बाद नहीं किया।

निचोड़

TYLER एक AI को बेहतर विचारक बनने की शिक्षा देता है, जिससे वह ज़ोर से बोलने (उत्तर लिखने) और मौन रूप से सोचने (विशिष्ट मानसिक उपकरणों का उपयोग करने) के बीच स्विच कर सकता है। यह तय करता है कि कब स्विच करना है, कौन सा टूल इस्तेमाल करना है, और कितना सोचना है, जो इसे पुराने को भूले बिना स्मार्ट, तेज़ और बेहतर तरीके से सीखने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →