← नवीनतम पेपर
💬 NLP

CIRF: Tokenizing Chain-of-Thoughts into Reusable Functional Units for Efficient Latent Reasoning in Large Language Models

यह शोध पत्र CIRF का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो स्पष्ट चेन-ऑफ-थॉट (Chain-of-Thought) तर्क को पुन: प्रयोज्य कार्यात्मक इकाइयों में टोकनाइज़ करता है ताकि बड़े भाषा मॉडलों (LLMs) में कुशल, अनुकूलन योग्य और व्याख्या योग्य लेटेंट रीजनिंग (latent reasoning) को एक अनुकूल सटीकता-विलंबता ट्रेड-ऑफ के साथ सक्षम बनाया जा सके।

मूल लेखक: Yukyung Lee, Yumeng Shen, Jinhyeong Park, Hyein Yang, Jun-Hyung Park

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yukyung Lee, Yumeng Shen, Jinhyeong Park, Hyein Yang, Jun-Hyung Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CIRF (Chain-of-Thought को पुन: प्रयोज्य कार्यात्मक इकाइयों में टोकनाइज़ करना) के पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: ज़ोर से सोचना धीमा है

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट (एक Large Language Model) से गणित का एक सवाल पूछ रहे हैं। सही उत्तर पाने के लिए, रोबोट को आमतौर पर "ज़ोर से सोचना" पड़ता है। वह आपको अंतिम संख्या देने से पहले अपने तर्क के हर एक चरण को पूरे वाक्यों में लिखता है।

  • पुराना तरीका: यदि आप पूछते हैं, "120 पेज पढ़ने में कितने घंटे लगेंगे?", तो रोबोट एक पूरा पैराग्राफ लिखता है: "जॉय 20 मिनट में 8 पेज पढ़ती है। इसका मतलब है कि वह प्रति मिनट 0.4 पेज पढ़ती है। कुल समय ज्ञात करने के लिए, मुझे 120 को 0.4 से विभाजित करना होगा..."
  • समस्या: उन सभी शब्दों को लिखने में समय और कंप्यूटर की शक्ति लगती है। यह ऐसा है जैसे आप किसी शेफ से खाना परोसने से पहले हर एक गाजर काटने के बारे में एक विस्तृत डायरी लिखने के लिए कहें। यह सटीक तो है, लेकिन धीमा और बर्बादी भरा है।

समाधान: CIRF (एक "गुप्त कोड" वाली रसोई)

शोधकर्ताओं ने CIRF नामक एक नई विधि प्रस्तावित की है। रोबोट को लंबे पैराग्राफ लिखने के बजाय, वे इसे छोटे, पुन: प्रयोज्य "कार्यात्मक टोकन" (functional tokens) से बना एक गुप्त कोड उपयोग करना सिखाते हैं।

इसे एक शेफ की रसोई की तरह समझें जहाँ रोबोट रसोइया है:

  1. मेन्यू (Explicit CoT): सबसे पहले, शोधकर्ता देखते हैं कि इंसान समस्याओं को चरण-दर-चरण कैसे हल करते हैं (उस "डायरी प्रविष्टि" वाली शैली में)।
  2. अनुवाद (Tokenization): वे उन लंबे चरणों को लेते हैं और उन्हें कार्यात्मक टोकनों के एक संक्षिप्त मेन्यू में अनुवादित करते हैं।
    • बजाय इसके कि वह लिखे "मुझे 120 को 0.4 से विभाजित करना है," रोबोट बस एक एकल प्रतीक सोचता है: [DIVIDE]
    • बजाय इसके कि वह लिखे "उत्तर 5 घंटे है," वह सोचता है [ANSWER]
  3. गुप्त रेसिपी (The Codebook): वे इन प्रतीकों की एक डिक्शनरी बनाते हैं।
    • एक प्रतीक का अर्थ हो सकता है "जोड़ना (Addition)"।
    • दूसरे का अर्थ हो सकता है "कॉमन सेंस चेक (Common Sense Check)"।
    • तीसरे का अर्थ हो सकता है "गुणा (Multiplication)"।
    • महत्वपूर्ण बात यह है कि ये प्रतीक पुन: प्रयोज्य (reusable) हैं। पेजों वाले गणित के सवाल के लिए इस्तेमाल किया गया [DIVIDE] प्रतीक, पिज्जा को बांटने वाले सवाल के लिए भी बिल्कुल वही प्रतीक है। रोबोट को हर बार विभाजन (divide) करना फिर से सीखने की ज़रूरत नहीं है; वह बस शेल्फ से वही उपकरण निकाल लेता है।

व्यवहार में यह कैसे काम करता है

जब रोबक को कोई प्रश्न मिलता है, तो वह कहानी नहीं लिखता। वह इन कोड प्रतीकों का एक त्वरित, अदृश्य क्रम उत्पन्न करता है:

  • इनपुट: "जॉय 20 मिनट में 8 पेज पढ़ती है। 120 पेज के लिए कितना समय लगेगा?"
  • रोबोट का आंतरिक विचार (CIRF): [CALC_RATE][DIVIDE][CONVERT_MINUTES][ANSWER]
  • आउटपुट: "5 घंटे।"

रोबोट इन छोटे, कुशल टोकनों का उपयोग करके आंतरिक रूप से भारी काम करता है। वह आपके देखने के लिए केवल अंतिम उत्तर ही लिखता है।

यह बेहतर क्यों है ("Pareto Frontier")

पेपर का दावा है कि CIRF उस "स्वीट स्पॉट" (sweet spot) को छूता है जिसे अन्य विधियाँ मिस कर देती हैं। कल्पना कीजिए कि एक ग्राफ है जहाँ X-अक्ष गति (Speed) है और Y-अक्ष सटीकता (Accuracy) है।

  • पुरानी विधियाँ (सब कुछ लिखना): उच्च सटीकता, लेकिन बहुत धीमी (ग्राफ पर बहुत दाईं ओर)।
  • अन्य "गुप्त कोड" विधियाँ: कुछ विधियाँ सोचने को छिपाने की कोशिश करती हैं लेकिन सामान्य, अस्पष्ट प्रतीकों का उपयोग करती हैं (जैसे कि केवल "पॉज़" बटन दबाना या रैंडम शोर का उपयोग करना)। ये तेज़ हैं लेकिन अक्सर गलत उत्तर देती हैं क्योंकि प्रतीकों का कोई विशिष्ट अर्थ नहीं होता।
  • CIRF: यह ऊपरी-बाएँ कोने (top-left corner) में स्थित है। यह तेज़ है (क्योंकि यह छोटे कोड का उपयोग करता है) और सटीक भी है (क्योंकि कोड विशिष्ट, अर्थपूर्ण उपकरण जैसे "जोड़" या "घटाव" हैं)।

"अनुकूली" (Adaptive) विशेषता

CIRF की एक शानदार बात यह है कि यह अनुकूली (adaptive) है।

  • यदि प्रश्न आसान है ("2+2 क्या है?"), तो रोबोट एक छोटा कोड अनुक्रम उपयोग करता है: [ADD][ANSWER]
  • यदि प्रश्न कठिन है (एक जटिल लॉजिक पहेली), तो वह स्वचालित रूप से लंबे कोड श्रृंखला का उपयोग करता है: [ANALYZE][COMPARE][SUBTRACT][VERIFY][ANSWER]

यह एक मैकेनिक की तरह है: फ्लैट टायर के लिए, वे एक रिंच (wrench) उठाते हैं। टूटे हुए इंजन के लिए, वे पूरा टूलबॉक्स उठाते हैं। रोबोट समस्या की कठिनाई के आधार पर अपने "सोचने" की लंबाई को स्वतः समायोजित करता है।

परिणाम

शोधकर्ताओं ने गणित, तर्क और सामान्य ज्ञान के प्रश्नों पर इसका परीक्षण किया। उन्होंने पाया कि:

  1. यह तेज़ है: रोबोट बहुत तेज़ी से समस्याओं को हल करता है क्योंकि वह लंबे स्पष्टीकरण टाइप नहीं कर रहा है।
  2. यह सटीक है: यह शब्द वाले धीमे तरीकों की तरह ही लगभग उतनी ही बार सही उत्तर देता है।
  3. यह व्याख्या योग्य (Interpretable) है: भले ही रोबोट "गुप्त कोड" का उपयोग कर रहा है, शोधकर्ताओं ने जाँच की और पाया कि कोड वास्तव में वास्तविक, तार्किक चरणों (जैसे "जोड़ना" या "उत्तर चुनना") के अनुरूप हैं। वे केवल रैंडम बड़बड़ाहट नहीं हैं; वे अर्थपूर्ण कार्यात्मक इकाइयाँ हैं।

सारांश

CIRF एक तरीका है जिससे AI को कुशलतापूर्वक सोचना सिखाया जाता है। AI को एक साधारण गणितीय समस्या हल करने के लिए उपन्यास लिखने के लिए मजबूर करने के बजाय, CIRF उसे पुन: प्रयोज्य, अर्थपूर्ण शॉर्टहैंड प्रतीकों का एक सेट देता है। यह AI को तेज़ और सटीक रूप से जटिल समस्याओं को हल करने की अनुमति देता है, जिससे "सोच" को संक्षिप्त और छिपा हुआ रखते हुए भी सही परिणाम प्राप्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →