← नवीनतम पेपर
💬 NLP

Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models

यह शोध पत्र चेन-ऑफ-थॉट (Chain-of-Thought) रीजनिंग को कंप्रेस करने के लिए एंट्रॉपी-आधारित प्रूनिंग की प्रभावकारिता को चुनौती देता है, यह प्रदर्शित करते हुए कि ऐसे ह्यूरिस्टिक्स रैंडम सिलेक्शन की तुलना में कोई लाभ नहीं देते हैं और कार्य-महत्वपूर्ण जानकारी एंट्रॉपी मेट्रिक्स द्वारा पहचाने जाने वाले विशिष्ट टोकन में केंद्रित होने के बजाय पूरी रीजनिंग चेन में वितरित होती है।

मूल लेखक: Sara Candussio, Daniel Scalena, Luca Bortolussi, Elisabetta Fersini, Malvina Nissim, Gabriele Sarti

प्रकाशित 2026-08-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sara Candussio, Daniel Scalena, Luca Bortolussi, Elisabetta Fersini, Malvina Nissim, Gabriele Sarti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बातूनी रोबोट को एक कठिन पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। सही उत्तर पाने के लिए, रोबोट केवल समाधान नहीं बोल देता; वह पहले अपने आप से बात करता है, अपने विचारों, गणनाओं और "अहा!" वाले क्षणों की एक लंबी सूची लिखता है। इस आंतरिक एकालाप (internal monologue) को "चेन-ऑफ-थॉट" (Chain-of-Thought) कहा जाता है। यह एक जासूस की तरह है जो अपराधी को पकड़ने से पहले हर सुराग को लिख लेता है, यहाँ तक कि उन सुरागों को भी जो बहुत स्पष्ट लगते हैं। हालाँकि यह तरीका रोबोट को बहुत स्मार्ट बनाता है, लेकिन यह इसे बहुत धीमा और कंप्यूटर मेमोरी का भूखा भी बना देता है, क्योंकि विचारों की सूची अविश्वसनीय रूप से लंबी हो सकती है। वैज्ञानिक अब इस सूची को छोटा करने का तरीका खोजने की कोशिश कर रहे हैं बिना जासूस की प्रतिभा को खोए। वे जानना चाहते हैं: क्या हम कहानी के उबाऊ हिस्सों को हटाकर केवल रोमांचक और महत्वपूर्ण हिस्सों को रख सकते हैं?

कुछ समय के लिए, कई शोधकर्ताओं का मानना था कि उन्होंने एक जादुई फिल्टर खोज लिया है। उन्हें लगा कि यह देखकर कि रोबोट अपने अगले शब्द से कितना "आश्चर्यचकित" (surprised) था (एक अवधारणा जिसे "एंट्रॉपी" कहा जाता है), वे यह बता सकते हैं कि कौन से विचार महत्वपूर्ण थे और कौन से केवल भरने के लिए थे। विचार यह था कि यदि रोबिमट अपने अगले शब्द के बारे में बहुत आश्वस्त था (कम आश्चर्य/low entropy), तो वह हिस्सा शायद केवल उबाऊ दोहराव था और उसे काटा जा सकता था। यदि रोबोट अनिश्चित था (उच्च आश्चर्य/high entropy), तो वह वास्तविक सोचने का क्षण था और उसे रखा जाना चाहिए था। यह रोबोट की डायरी को कुछ पन्नों तक सिकोड़ने का एक आदर्श तरीका लग रहा था जबकि सारा अच्छा हिस्सा सुरक्षित रहे। लेकिन क्या यह जादुaling फिल्टर वास्तव में वास्तविक है, या यह केवल एक भाग्यशाली अनुमान है?

यह शोध पत्र उस विचार पर एक वास्तविकता की जांच (reality check) है। लेखकों ने, जो जिज्ञासु वैज्ञानिकों की एक टीम है, इस "एंट्रॉपी फिल्टर" का परीक्षण एक बहुत ही सरल, साधारण तरीके के विरुद्ध करने का निर्णय लिया: बस यादृच्छिक (random) रूप से विचारों को हटा देना। उन्होंने रोबोट की लंबी तर्क श्रृंखलाओं को एक बिखरे हुए कमरे की तरह माना और उन्हें व्यवस्थित करने के लिए दो अलग-अलग रणनीतियों का उपयोग किया। पहली रणनीति "स्मार्ट" थी, जो चुनने के लिए एंट्रॉपी फिल्टर का उपयोग करती थी। दूसरी रणनीति "रैंडम" थी, जहाँ उन्होंने सामग्री की परवाह किए बिना बस कुछ वाक्यों या शब्दों को चुन लिया। उन्होंने विभिन्न प्रकार के रोबोटों (विभिन्न AI मॉडल) पर इनका परीक्षण किया और उन्हें गणित, तर्क पहेलियों और विज्ञान के प्रश्नों सहित विभिन्न प्रकार के होमवर्क दिए।

परिणाम थोड़े चौंकाने वाले थे। जब वैज्ञानिकों ने पूरे वाक्यों को देखा, तो "स्मार्ट" एंट्रॉपी फिल्टर रैंडम अनुमान से बेहतर नहीं था। वास्तव में, रैंडम विधि अक्सर प्रदर्शन को उच्च बनाए रखने में उतनी ही अच्छी या उससे भी बेहतर रही। ऐसा हुआ कि "आश्चर्य का स्तर" यह बताने के लिए एक विश्वसनीय मानचित्र नहीं है कि महत्वपूर्ण जानकारी कहाँ छिपी है। लेखकों का सुझाव है कि पिछले अध्ययनों में एंट्रॉपी काम करती हुई इसलिए दिखी क्योंकि वे मुख्य रूप से गणित की समस्याओं पर परीक्षण कर रहे थे, जहाँ "महत्वपूर्ण" शब्द अक्सर संख्याएँ होते हैं।

जब उन्होंने वाक्यों के बजाय व्यक्तिगत शब्दों (टोकन) को देखने के लिए ज़ूम किया, तो एक अजीब पैटर्न सामने आया। गणित परीक्षणों पर, कम आश्चर्य वाले शब्दों को रखना वास्तव में मददगार लगा। लेकिन लेखकों ने गहराई से जांच की और महसूस किया कि यह इसलिए नहीं था क्योंकि वे शब्द "सोचने" वाले शब्द थे। बल्कि, गणित की समस्याओं में, कम एंट्रॉपी वाले शब्द लगभग हमेशा संख्याएँ (जैसे "2", "7", या "5") थे। गणित में संख्याएँ अनुमानित होती हैं, इसलिए उनमें कम एंट्रॉपी होती है। फिल्टर "स्मार्ट" हिस्सों को नहीं ढूंढ रहा था; वह बस गलती से संख्याओं को चुन रहा था। जब वैज्ञानिकों ने मिश्रण से संख्याओं को हटा दिया, तो लो-एंट्रॉपी फिल्टर काम करना बंद कर गया और रैंडम अनुमान जितना ही खराब हो गया।

इसे साबित करने के लिए, उन्होंने "एक्टिवेशन पैचिंग" नामक एक विशेष तकनीक का उपयोग किया। कल्पना कीजिए कि आप पूरी, लंबी कहानी की मस्तिष्क गतिविधि (brain activity) लेते हैं और उसे संक्षिप्त, संकुचित संस्करण में चिपका देते हैं। इससे उन्हें यह देखने में मदद मिलती है कि क्या गायब संदर्भ (context) ही समस्या थी। उन्होंने पाया कि इस मस्तिष्क-बढ़ाने वाली तकनीक के साथ भी, एंट्रॉपी फिल्टर रैंडम विधि से बेहतर नहीं हो सका, जब तक कि वह विशेष रूप से गणित की समस्याओं में संख्याओं को न रख रहा हो। गैर-गणित कार्यों, जैसे तर्क पहेलियों पर, एंट्रॉपी फिल्टर पूरी तरह से विफल रहा, जो संयोग (chance) से बेहतर प्रदर्शन नहीं कर सका।

तो, निष्कर्ष क्या है? यह शोध पत्र सुझाव देता है कि "आश्चर्य" (एंट्रॉपी) का उपयोग करके रोबोट की सोचने की प्रक्रिया के सबसे महत्वपूर्ण हिस्सों को स्वचालित रूप से खोजने और रखने का विचार काफी हद तक एक मिथक है। अर्थ संबंधी सामग्री (semantic content)—वास्तविक अर्थ और तर्क—कुछ विशेष, कम-आश्चर्य वाले शब्दों में केंद्रित नहीं है जिसे एक सरल नियम ढूंढ सके। इसके बजाय, महत्वपूर्ण जानकारी पूरी तर्क श्रृंखला में फैली हुई है। हालांकि संख्याओं को रखना गणित में मदद करता है, लेकिन ऐसा कोई सार्वभौमिक "जादुई फिल्टर" नहीं है जो रोबोट की तर्क श्रृंखला को उसकी बुद्धिमत्ता खोए बिना संकुचित कर सके। सूची को छोटा करने का सबसे अच्छा तरीका शायद इसका अधिक हिस्सा रखना होगा, या इसे काटने का एक स्मार्ट तरीका खोजना होगा जो यह अनुमान लगाने पर निर्भर न हो कि कौन से शब्द उबाऊ हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →