← नवीनतम पेपर
💬 NLP

ConPress: Learning Efficient Reasoning from Multi-Question Contextual Pressure

ConPress एक हल्का स्व-पर्यवेक्षित फाइन-ट्यूनिंग (self-supervised fine-tuning) तरीका है जो "स्व-संपीड़न" (Self-Compression) घटना का लाभ उठाता है, जहाँ मॉडल कई प्रश्न प्रस्तुत किए जाने पर स्वाभाविक रूप से तर्क संबंधी निशानों (reasoning traces) को छोटा कर देते हैं, ताकि बड़े तर्क करने वाले मॉडलों को एकल-प्रश्न कार्यों के लिए संक्षिप्त और सटीक समाधान उत्पन्न करने के लिए प्रशिक्षित किया जा सके, जिससे बिना किसी बाहरी शिक्षक या सुदृढीकरण शिक्षण (reinforcement learning) के अनुमान ओवरहेड (inference overhead) को काफी कम किया जा सके।

मूल लेखक: Jie Deng, Shining Liang, Jun Li, Hongzhi Li, Yutao Xie

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jie Deng, Shining Liang, Jun Li, Hongzhi Li, Yutao Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, अति-उत्साही छात्र है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन उसकी एक बुरी आदत है: ज़रूरत से ज़्यादा सोचना (overthinking)

जब आप उस छात्र से गणित का एक सरल प्रश्न पूछते हैं जैसे "2 + 2 क्या है?", तो वह केवल "4" नहीं कहता। इसके बजाय, वह 50 पन्नों का निबंध लिख देता है। वह यह सोचकर शुरू करता है कि क्या उसे जोड़ (addition) सही से याद है, फिर वह सेबों की कल्पना करता है, फिर वह अपनी उंगलियों की जाँच करता है, फिर वह संख्याओं के दार्शनिक स्वरूप पर बहस करने लगता है, और अंत में, 20 पन्नों के "रुको, मुझे एक बार फिर से जाँच लेने दो" के बाद, वह उत्तर तक पहुँचता है।

यह बिल्कुल वही करता है जो आधुनिक "लार्ज रीजनिंग मॉडल्स" (AI) करते हैं। वे भारी मात्रा में टेक्स्ट (जिसे "चेन-ऑफ-थॉट" कहा जाता है) उत्पन्न करते हैं ताकि समस्याओं को हल किया जा सके। हालांकि यह अक्सर सही उत्तरों की ओर ले जाता है, लेकिन यह बहुत धीमा, महंगा और फालतू की बातों (fluff) से भरा होता है।

ConPress नामक शोध पत्र एक चतुर तरीका पेश करता है जिससे इस छात्र को अपनी बुद्धिमत्ता खोए बिना संक्षिप्त (concise) होना सिखाया जा सके। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. खोज: "भीड़भाड़ वाला कमरा" प्रभाव (The "Crowded Room" Effect)

शोधकर्ताओं ने देखा कि जब उन्होंने खेल के नियम बदल दिए, तो कुछ अजीब सा होने लगा।

  • पुराना तरीका (एकल प्रश्न): यदि आप एक शांत कमरे में AI से एक प्रश्न पूछते हैं, तो उसे लगता है कि उसके पास सारा समय है। वह अपने हर संभावित विचार पथ के माध्यम से विस्तार से चलता रहता है।
  • नया तरीका (बहु-प्रश्न दबाव): यदि आप एक ही प्रॉम्प्ट में तीन या चार अलग-अलग प्रश्न रखते हैं और AI को कहते हैं, "इन सभी के उत्तर अभी दें," तो कुछ जादुई होता है। AI अचानक बड़बड़ाना बंद कर देता है।

उपमा (Analogy): कल्पना कीजिए कि आप एक डिनर पार्टी में हैं।

  • यदि आप अकेले मेजबान (host) से बात कर रहे हैं, तो आप बहुत सारे विवरणों के साथ एक लंबी, घुमावदार कहानी सुना सकते हैं।
  • लेकिन यदि मेजबान कहता है, "ठीक है, यहाँ 10 लोग हैं, और हमें मिठाई से पहले सभी से एक छोटी कहानी सुननी है," तो आप अचानक मुख्य बात पर आ जाते हैं। आप "अम्म", "मुझे सोचने दो", और "रुको, मुझे यह जाँच लेने दो" जैसी चीज़ें छोड़ देते हैं। आप बस मूल कहानी दे देते हैं।

शोधकर्ता इसे "सेल्फ-कंप्रेशन" (Self-Compression) कहते हैं। एक साथ कई प्रश्नों का उत्तर देने का दबाव AI को फालतू बातें काटने और सीधे तर्क (logic) पर आने के लिए मजबूर करता है।

2. समाधान: ConPress (कॉन्टेक्स्टुअल प्रेशर)

टीम ने महसूस किया कि वे इस "भीड़भाड़ वाले कमरे" के प्रभाव का उपयोग AI को स्थायी रूप से कुशल बनाने के लिए कर सकते हैं। उन्होंने ConPress नामक एक विधि बनाई।

यहाँ वह चरण-दर-चरण प्रक्रिया दी गई है जिसका उन्होंने उपयोग किया:

  1. तनाव परीक्षण (The Stress Test): उन्होंने गणित की कई समस्याओं को लिया और उन्हें बैचों में समूहबद्ध किया (जैसे, एक बार में 3 प्रश्न)। उन्होंने AI को एक ही बार में उन सभी को हल करने के लिए कहा।
  2. फ़िल्टर (The Filter): क्योंकि AI जल्दबाजी कर रहा था, इसलिए उससे कभी-कभी गलतियाँ हो जाती थीं। इसलिए, शोधकर्ताओं ने केवल उन्हीं उत्तरों को रखा जो 100% सही थे। उन्होंने गलत उत्तरों को हटा दिया।
  3. पाठ (The Lesson): उन्होंने उन छोटे, सही उत्तरों (संक्षिप्त तर्क) को लिया और उनका उपयोग AI को भविष्य में एकल प्रश्नों का उत्तर देने के लिए सिखाने के लिए किया।

उपमा: यह एक ऐसे कोच की तरह है जो एक धावक को एक भारी बैकपैक लेकर दौड़ते हुए देखता है (बहु-प्रश्न दबाव)। धावक वजन उठाने के लिए कुशलतापूर्वक दौड़ना सीख जाता है। फिर कोच उस धावक से बैकपैक हटा देता है और कहता है, "अब, वैसे ही दौड़ो जैसे तुम बैकपैक के साथ दौड़ रहे थे।" धावक बिना वजन के भी उसी कुशल चाल को बनाए रखता है।

3. परिणाम: तेज़, सस्ता, फिर भी स्मार्ट

परिणाम प्रभावशाली थे। इस विधि का उपयोग करके, AI मॉडल काफी कुशल हो गए:

  • कम बातें: मॉडल्स ने समान समस्याओं को हल करने के लिए 30% से 60% कम शब्दों (टोकन्स) का उपयोग किया।
  • वही बुद्धिमत्ता: बहुत कम बोलने के बावजूद, वे पहले की तरह ही लगभग उतनी ही बार सही उत्तर देते रहे।
  • कोई बाहरी शिक्षक नहीं: अन्य तरीकों के विपरीत जिनमें उत्तरों को फिर से लिखने के लिए किसी "शिक्षक" AI या जटिल रिवॉर्ड सिस्टम की आवश्यकता होती है, इस विधि ने AI को उसके अपने व्यवहार का उपयोग करके सिखाया। यह एक "सेल्फ-सुपरवाइज्ड" पाठ था।

उन्होंने क्या दावा नहीं किया

यह महत्वपूर्ण है कि हम जो शोध पत्र में वास्तव में कहा गया है, उसी तक सीमित रहें:

  • उन्होंने यह दावा नहीं किया कि यह चिकित्सा निदान या कानूनी सलाह के लिए काम करता है।
  • उन्होंने यह दावा नहीं किया कि यह कच्ची बुद्धिमत्ता के मामले में AI को "स्मार्टर" बनाता है; यह केवल इसकी मौजूदा बुद्धिमत्ता का उपयोग करने में इसे तेज़ और सस्ता बनाता है।
  • उन्होंने यह सुझाव नहीं दिया कि यह उत्तर देते समय AI को बस "छोटा होने" के लिए कहने से काम करता है। शोध पत्र ने स्पष्ट रूप से इसका परीक्षण किया और पाया कि यह अच्छी तरह से काम नहीं करता है। दक्षता बनाए रखने के लिए AI को प्रशिक्षण (ConPress) के माध्यम से इस आदत को सीखना पड़ता है।

सारांश

शोध पत्र ConPress ने खोजा कि यदि आप एक रीजनिंग AI को एक साथ कई प्रश्न पूछकर दबाते हैं, तो वह स्वाभाविक रूप से ज़रूरत से ज़्यादा सोचना बंद कर देता है और संक्षिप्त होना शुरू कर देता है। उन्होंने इस "दबाव" का उपयोग AI को कुशल बनाने के लिए किया, भले ही बाद में उसे केवल एक प्रश्न पूछा जाए। परिणाम एक स्मार्ट, तेज़ और अधिक लागत प्रभावी AI है जो बिना बड़बड़ाए अपना काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →