← नवीनतम पेपर
💬 NLP

Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization

यह शोध पत्र एक मास्टरी-गेटेड (mastery-gated), सॉफ्ट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तुत करता है जो केवल सही समाधान मिलने के बाद अनावश्यक विस्तार को दंडित करके चेन-ऑफ-थॉट रीजनिंग को गतिशील रूप से संकुचित करता है, जिससे विविध डोमेन में सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए टोकन की लंबाई और इन्फरेंस राउंड्स में महत्वपूर्ण कमी आती है।

मूल लेखक: Hanyu Li, Jiangshan Duo, Bofei Gao, Hailin Zhang, Sujian Li, Xiaotie Deng, Liang Zhao

प्रकाशित 2026-01-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanyu Li, Jiangshan Duo, Bofei Gao, Hailin Zhang, Sujian Li, Xiaotie Deng, Liang Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत प्रतिभाशाली लेकिन बहुत अधिक बातूनी छात्र है। जब आप उससे गणित का कोई सवाल पूछते हैं, तो वह केवल उसे हल नहीं करता; बल्कि वह उस समाधान तक पहुँचने के अपने तरीके पर एक उपन्यास लिख देता है। वह अपने हर छोटे कदम को समझाता है, अपनी बातों को दोहराता है, और "क्या होगा अगर" वाले काल्पनिक परिदृश्यों की गहराइयों में भटक जाता है।

हालाँकि यह छात्र बुद्धिमान है, लेकिन उसकी "ज्यादा सोचने" (overthinking) की आदत महंगी पड़ती है। उनके उत्तर को पढ़ने में बहुत समय लगता है, इसे समझने में बहुत ऊर्जा खर्च होती है, और कभी-कभी, उनकी यह अतिरिक्त बकबक वास्तव में उन्हें कम विश्वसनीय बना देती है।

यह शोधपत्र इस छात्र (एक AI मॉडल) को सिखाने का एक नया तरीका पेश करता है कि कैसे अपनी बुद्धिमत्ता खोए बिना संक्षिप्त (concise) बना रहा जाए। यहाँ उनके तरीके का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "ओवरथिंकिंग का जाल" (The Overthinking Trap)

वर्तमान में, AI मॉडल को गहराई से सोचने के लिए प्रशिक्षित किया जाता है। लेकिन अक्सर, वे बहुत अधिक सोचने लगते हैं। वे विचारों की लंबी, भटकाऊ श्रृंखलाएँ उत्पन्न करते हैं जो पैसा और समय खर्च करती हैं लेकिन जरूरी नहीं कि उत्तर में सुधार करें।

  • पुराना तरीका: पिछले तरीकों ने इसे इस तरह ठीक करने की कोशिश की कि छात्र के बोलने की एक "कठोर सीमा" तय कर दी जाए। यदि वे 500 शब्दों से ऊपर जाते हैं, तो शिक्षक उन्हें बीच में ही रोक देता है।
  • दोष: यह एक छात्र को यह बताने जैसा है कि, "चाहे तुम अभी उत्तर ढूंढ ही क्यों न रहे हो या अभी काम पूरा ही हुआ हो, 5 मिनट के बाद बोलना बंद कर दो।" यदि आप उन्हें सोचते समय ही रोक देते हैं, तो वे असफल हो जाते हैं। यदि आप उन्हें जल्दी रुकने के लिए मजबूर करते हैं, तो वे "सिस्टम को चकमा देने" के लिए गलत लेकिन छोटे उत्तर देना शुरू कर सकते हैं ताकि वे कटने से बच सकें।

2. समाधान: "मास्टरी गेट" (The Mastery Gate)

लेखक एक स्मार्ट नियम प्रस्तावित करते हैं: छात्र को संक्षिप्त होने के लिए तभी कहें जब वे यह सिद्ध कर दें कि उन्हें उत्तर पता है।

इसे एक वीडियो गेम कोच की तरह समझें:

  • चरण 1 (सीखना): छात्र समस्या को हल करने का प्रयास करता है। यदि वह सही उत्तर देता है, तो कोच कहता है, "बहुत बढ़िया! अब, इसी समस्या को फिर से हल करने का प्रयास करें, लेकिन इस बार, कम शब्दों में समझाएं।"
  • चरण 2 (गेट/द्वार): यदि छात्र गलत उत्तर देता है, तो कोच कहता है, "चिंता मत करो कि तुम्हें छोटा जवाब देना है। बस सही उत्तर पाने पर ध्यान केंद्रित करो।" यदि छात्र संघर्ष कर रहा है, तो उसे लंबा बोलने के लिए दंडित नहीं किया जाता है।
  • परिणाम: छात्र यह सीखता है कि अधिक बोलना केवल तभी एक दंड है जब वे पहले से ही समाधान जानते हैं। यह उन्हें उत्तर तक पहुँचने के लिए सबसे कुशल मार्ग खोजने के लिए प्रोत्साहित करता है, न कि केवल बकबक करने के लिए।

3. जादू: "वन-डोमेन-टू-ऑल" सामान्यीकरण (One-Domain-to-All Generalization)

यहाँ सबसे आश्चर्यजनक हिस्सा है। शोधकर्ताओं ने छात्र को केवल गणित की समस्याओं पर संक्षिप्त होने के लिए प्रशिक्षित किया।

  • उपमा: कल्पना कीजिए कि आप एक शेफ को सब्जियां तेजी से काटने के लिए सिखा रहे हैं। आप उम्मीद करेंगे कि वे बस सब्जियां तेजी से काटेंगे। लेकिन इस प्रयोग में, सब्जियां कुशलतापूर्वक काटने के बाद, उस शेफ ने मांस काटना, फल काटना और यहाँ तक कि कपड़े तह करना भी बहुत तेजी से शुरू कर दिया, बिना किसी विशेष प्रशिक्षण के।
  • वास्तविकता: AI, जिसे केवल गणित पर प्रशिक्षित किया गया था, ने कोडिंग, सामान्य ज्ञान और निर्देशों का पालन करने के लिए भी संक्षिप्त और अधिक कुशल उत्तर देना स्वतः ही शुरू कर दिया। इसने एक सामान्य "दक्षता की आदत" (habit of efficiency) विकसित कर ली जो हर जगह लागू होती है।

4. दो-तरफा रास्ता: एजेंट्स और टूल्स (Agents and Tools)

इस शोधपत्र का परीक्षण "एजेंट्स" पर भी किया गया—वे AI मॉडल जो समस्याओं को हल करने के लिए उपकरणों (जैसे कंप्यूटर या कोड एडिटर) का उपयोग करते हैं।

  • नॉन-एजेंट से एजेंट (Non-Agent to Agent): एक मानक AI को संक्षिप्त होने के लिए प्रशिक्षित करने से वह एक एजेंट के रूप में अधिक कुशलता से कार्य करने लगा (उपकरणों का उपयोग करते समय), भले ही उसे टूल-उपयोग के लिए प्रशिक्षित नहीं किया गया था।
  • एजेंट से नॉन-एजेंट (Agent to Non-Agent): एक एजेंट को संक्षिप्त होने के लिए प्रशिक्षित करने से उसने मानक कार्यों पर भी छोटे और बेहतर उत्तर दिए।
  • निष्कर्ष: "कब बोलना बंद करना है और बस काम करना है" यह एक सार्वभौमिक कौशल है। यह काम करता है चाहे AI केवल सोच रहा हो या वास्तव में उपकरणों का उपयोग कर रहा हो।

5. खतरा: "ओवर-कंप्रेशन" (Over-Compression)

शोधपत्र चेतावनी देता है कि यदि आप छात्र को बहुत लंबे समय तक बहुत संक्षिप्त होने के लिए मजबूर करते हैं, तो वे टूट जाते हैं।

  • उपमा: यदि आप छात्र से कहते हैं, "तुम्हें 5 शब्दों या उससे कम में उत्तर देना ही होगा," तो वे सोचना पूरी तरह से बंद कर सकते हैं और केवल अनुमान लगाने लगेंगे।
  • समाधान: लेखक एक "सेफ्टी स्टॉप" (सुरक्षा विराम) का उपयोग करते हैं। वे छात्र के प्रदर्शन पर बारीकी से नज़र रखते हैं। जिस क्षण छात्र संक्षिप्त होने की कोशिश में गलत उत्तर देने लगता है, वे प्रशिक्षण रोक देते हैं। यह सुनिश्चित करता है कि छात्र बुद्धिमान बना रहे, बस तेज़ हो जाए।

सारांश

यह शोधपत्र तर्क देता है कि सच्ची बुद्धिमत्ता केवल गहराई से सोचना नहीं है; बल्कि यह जानना है कि क्या भूलना है।

AI मॉडलों को किसी कार्य में महारत हासिल करने के बाद ही अपने विचारों को संकुचित (compress) करने के लिए सिखाकर, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई जिसने:

  1. प्रतिक्रिया समय और लागत को 20-40% तक कम कर दिया।
  2. सटीकता को समान रखा या उसमें सुधार किया।
  3. इस दक्षता के कौशल को उन कार्यों तक फैलाया जिनके लिए इसे स्पष्ट रूप से प्रशिक्षित नहीं किया गया था।

यह "संक्षिप्तता" को केवल लागत कम करने के एक साधारण तरीके से बदलकर एक परिपक्व, कुशल मस्तिष्क के मौलिक लक्षण में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →