← नवीनतम पेपर
🤖 machine learning

Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression

यह शोध पत्र Extra-CoT को प्रस्तुत करता है, जो एक नवीन ढांचा है जो न्यूनतम सटीकता हानि के साथ अत्यधिक चेन-ऑफ-थॉट संपीड़न प्राप्त करता है, जिसमें एक अर्थ-संरक्षित संकुचक (semantically-preserved compressor), मिश्रित-अनुपात सुपरवाइज्ड फाइन-ट्यूनिंग, और एक कंस्ट्रेंड एंड हिरार्किकल रेशियो पॉलिसी ऑप्टिमाइज़ेशन (CHRPO) रणनीति का संयोजन किया गया है ताकि लार्ज लैंग्वेज मॉडल्स में कुशल, उच्च-निष्ठा वाले तर्क (high-fidelity reasoning) को सक्षम बनाया जा सके।

मूल लेखक: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, अति-उत्साही छात्र (AI) है जो गणित की समस्या को हल करने की कोशिश कर रहा है। जब आप उससे "2+2 क्या है?" जैसा सरल प्रश्न पूछते हैं, तो वह केवल "4" नहीं कहता। इसके बजाय, वह संख्याओं के इतिहास, जोड़ की अवधारणा और संख्या 2 क्यों विशेष है, इस पर 50 पन्नों का निबंध लिखता है, और अंत में "4" के उत्तर को घेर देता है।

इसे चेन-ऑफ-थॉट (CoT) तर्क कहा जाता है। यह AI को सही उत्तर पाने में मदद करता है, लेकिन यह अविश्वसनीय रूप से धीमा और महंगा है क्योंकि AI "जरूरत से ज्यादा सोच" रहा है और बहुत अधिक शब्द (टोकन) उत्पन्न कर रहा है।

यह पेपर Extra-CoT नामक एक नया सिस्टम पेश करता है जो इस अति-उत्साही छात्र को अपनी बुद्धिमत्ता खोए बिना संक्षिप्त होने के लिए प्रशिक्षित करने का तरीका है।

मौजूदा "एडिटर्स" (संपादकों) के साथ समस्या

इस पेपर से पहले, शोधकर्ता इस छात्र के लंबे निबंधों को काटने के लिए "एडिटर्स" का उपयोग करने की कोशिश करते थे। ये एडिटर बस शब्दों को बेतरतीब ढंग से या सरल नियमों के आधार पर काट देते थे।

  • उपमा: कल्पना कीजिए कि एक संपादक एक वाक्य को काट देता है जो कहता है, "109 का वर्गमूल लगभग 10.44 है।" यदि वे इसे आधा काट देते हैं, तो आपके पास केवल "109 का वर्गमूल..." बचेगा, जिसका कोई अर्थ नहीं निकलता।
  • परिणाम: जब इन एडिटर्स ने निबंध को बहुत छोटा (जैसे मूल का 20%) करने की कोशिश की, तो छात्र के उत्तर बेकार हो गए। तर्क बिखर गया क्योंकि "महत्वपूर्ण चरण" बीच से ही काट दिए गए थे।

Extra-CoT समाधान: एक तीन-चरणीय प्रशिक्षण शिविर

लेखक एक नया तरीका प्रस्तावित करते हैं जो छात्र और एडिटर के साथ अलग तरह से व्यवहार करता है।

चरण 1: "गणित-समझदार" एडिटर (द कंप्रेसर)

सबसे पहले, वे एक विशेष एडिटर को प्रशिक्षित करते हैं जो गणित के सूत्रों को किसी भी अन्य व्यक्ति से बेहतर समझता है।

  • यह कैसे काम करता है: केवल शब्दों को देखने के बजाय, यह एडिटर पूरे गणितीय सूत्र (जैसे x2+12x=73x^2 + 12x = 73) को एक एकल, अटूट "ब्लॉक" के रूप में मानता है। वे जानते हैं कि यदि आप किसी सूत्र को बीच से काटते हैं, तो वह पूरी तरह टूट जाता है।
  • उपमा: एक लाइब्रेरियन की कल्पना करें जो जानता है कि एक विशिष्ट पुस्तक अध्याय किसी रहस्य का "सुराग" है। यदि उन्हें लाइब्रेरी को छोटा करना है, तो वे उस अध्याय के पन्ने नहीं फाड़ेंगे; वे पूरे अध्याय को सुरक्षित रखेंगे और उसके आसपास के उबाऊ विवरणों को काट देंगे।
  • लक्ष्य: यह संक्षिप्त उत्तरों का एक "गोल्ड स्टैंडर्ड" बनाता है जो तार्किक रूप से भी पूर्ण होते हैं।

चरण 2: "मिक्स-मोड" क्लासरूम (SFT)

इसके बाद, वे मुख्य AI छात्र को इस नए एडिटर के निर्देशों का पालन करना सिखाते हैं।

  • यह कैसे काम करता है: वे छात्र को ऐसे उदाहरण दिखाते हैं जहाँ एडिटर कहता है, "80% टेक्स्ट रखें," फिर "60% रखें," और फिर "20% रखें।"
  • उपमा: यह एक कोच द्वारा एथलीट को विभिन्न दूरियों तक दौड़ने के लिए प्रशिक्षित करने जैसा है। एथलीट सीखता है कि जब कोच चिल्लाकर "शॉर्ट स्प्रिंट!" कहता है, तो वह केवल दौड़ना बंद नहीं करता; वह उस विशिष्ट दूरी के लिए कुशलतापूर्वक दौड़ता है। यह AI को शब्दों के विभिन्न "बजट" के प्रति आज्ञाकारी होना सिखाता है।

चरण 3: "जोखिम लेने वाला" कोच (CHRPO)

अंत में, वे छात्र को और भी अधिक कुशल बनाने के लिए एक विशेष रिवॉर्ड सिस्टम (रीइन्फोर्समेंट लर्निंग) का उपयोग करते हैं।

  • समस्या: छात्र बहुत छोटा होने से डरता है क्योंकि उसे गलत होने का डर रहता है।
  • समाधान: कोच (CHRPO) एक बड़ा बोनस देता है यदि छात्र सही उत्तर देता है और बहुत कम शब्दों का उपयोग करता है। लेकिन, यदि छात्र बहुत छोटा होने की कोशिश करता है और गलत हो जाता है, तो दंड बहुत भारी होता है।
  • उपमा: एक गेम शो की कल्पना करें जहाँ आपको एक पहेली को 10 सेकंड में हल करने के लिए पुरस्कार मिलता है। यदि आप इसे 5 सेकंड में हल करते हैं, तो आपको डबल पुरस्कार मिलता है। लेकिन यदि आप जल्दबाजी करते हैं और गलत होते हैं, तो आप सब कुछ हार जाते हैं। यह AI को बहुत तेज़ होने और सटीक होने के बीच का "स्वीट स्पॉट" खोजने के लिए प्रोत्साहित करता है।

परिणाम

इस पेपर ने कठिन गणितीय समस्याओं (जैसे हाई स्कूल प्रतियोगिताओं में पाई जाने वाली समस्याएं) पर इसका परीक्षण किया।

  • जीत: नया सिस्टम (Extra-CoT) AI द्वारा उत्पन्न शब्दों की संख्या को 73% तक कम कर सका (मूल लंबाई के केवल 27% तक) जबकि वास्तव में इसने पहले की तुलना में अधिक प्रश्नों को सही हल किया।
  • तुलना: पुराने तरीके (जैसे "TokenSkip") तब विफल हो गए जब उन्हें इतना छोटा करने के लिए कहा गया। वे या तो आदेश का पालन करने में असमर्थ रहे या गलत उत्तर देने लगे। Extra-CoT अत्यधिक सीमाओं पर भी शांत और सटीक रहा।
  • गति: क्योंकि AI बहुत कम लिखता है, इसलिए यह वास्तविक समय में समस्याओं को 3 गुना तेज़ी से हल करता है।

सारांश

संक्षेप में, Extra-CoT एक ऐसा सिस्टम है जो AI को "जरूरत से ज्यादा सोचने" से रोकता है। यह एक स्मार्ट एडिटर का उपयोग करता है जो गणितीय सूत्रों का सम्मान करता है, AI को सख्त शब्द सीमाओं का पालन करने के लिए प्रशिक्षित करता है, और इसे तेज़ और सटीक दोनों होने के लिए पुरस्कृत करता है। परिणाम एक ऐसा AI है जो पहले की तुलना में बहुत कम कंप्यूटिंग पावर और समय का उपयोग करके जटिल तर्क पहेलियों को हल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →