← नवीनतम पेपर
🤖 machine learning

HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression

HMPO एक लागत प्रभावी, एकल-चरणीय सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विविध कार्यों और मॉडल स्केल्स में नगण्य सटीकता हानि के साथ चेन-ऑफ-थॉट रीजनिंग को 19%–46% तक कुशलतापूर्वक संकुचित करता है, जो मौजूदा विधियों में मैनुअल ट्यूनिंग और बहु-चरणीय प्रशिक्षण की सीमाओं को दूर करता है।

मूल लेखक: Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Zhou, Kun Zhan

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minghui Zheng, Hongxu Chen, Huimin Ren, Hongsheng Xin, Xiaoyang Qu, Ze Wang, Shuling Yang, Ziyu Peng, Kaike Zhang, Pan Zhou, Kun Zhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान लेकिन बहुत अधिक बातूनी छात्र है। जब आप उससे गणित का कोई सवाल पूछते हैं, तो वह केवल उत्तर नहीं देता; बल्कि वह अपने मन में आने वाले हर विचार, गलत रास्तों, "क्या होगा अगर" वाली स्थितियों और लंबी-चौड़ी व्याख्याओं के बारे में एक 50 पन्नों का उपन्यास लिख देता है। हालांकि यह "सोचने की प्रक्रिया" (Chain-of-Thought) उसे सही उत्तर तक पहुँचने में मदद करती है, लेकिन यह अविश्वसनीय रूप से धीमी, महंगी और ऊर्जा की बर्बादी करने वाली है।

यह शोध पत्र एक नई विधि पेश करता है जिसे HMPO (हाइब्रिड मीडियन-लेंथ पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है, जो इस छात्र को अपनी बुद्धिमत्ता खोए बिना संक्षिप्त (concise) होना सिखाती है।

HMPO कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:

1. समस्या: "ज़रूरत से ज़्यादा सोचने वाला" छात्र

वर्तमान AI मॉडल तर्क करने में माहिर हैं, लेकिन वे "ज़रूरत से ज़्यादा सोचने" (overthink) लगते हैं। वे एक ही प्रश्न के लिए हज़ारों शब्द (टोकन) उत्पन्न करते हैं। यह ऐसा है जैसे किसी से समय पूछने पर वह आपको घड़ियों के इतिहास पर एक व्याख्यान देने लगे। इससे बहुत अधिक पैसा (कंप्यूटिंग पावर) खर्च होता है और इसमें बहुत समय लगता है।

मौजूदा तरीके इन्हें ठीक करने के लिए बोझिल हैं:

  • वे कठोर नियमों का उपयोग करते हैं (जैसे, "1,000 शब्दों के बाद बोलना बंद कर दें"), जो एक कठिन समस्या के लिए आवश्यक व्याख्या को बीच में ही काट सकते हैं।
  • उन्हें महंगी, बहु-चरणीय ट्रेनिंग की आवश्यकता होती है (जैसे, पहले एक ट्यूटर रखना, फिर एक कोच, फिर एक मैनेजर), जिसमें बहुत समय और पैसा लगता है।
  • वे बहुत बड़े, जटिल मॉडलों पर लागू होने पर अक्सर विफल हो जाते हैं।

2. समाधान: HMPO (एक स्मार्ट कोच)

HMPO एक एकल, कुशल प्रशिक्षण सत्र है जो AI को संक्षिप्त लेकिन सटीक होना सिखाता है। यह तीन चतुर तरीकों का उपयोग करता है:

A. "गोल्डिलॉक्स" बजट (एडेप्टिव मीडियन)

एक निश्चित शब्द सीमा तय करने के बजाय (जैसे "अधिकतम 500 शब्द"), HMPO छात्र के हालिया सफल उत्तरों को देखता है।

  • उपमा: कल्पना कीजिए कि एक कोच धावकों के एक समूह को देख रहा है। धावकों को यह कहने के बजाय कि "ठीक 10 मिनट दौड़ो," कोच उन धावकों के मीडियन (मध्यम) समय को देखता है जिन्होंने वास्तव में सफलतापूर्वक दौड़ पूरी की है।
  • यह कैसे मदद करता है: यदि समस्याएँ कठिन हैं, तो "सफल" उत्तर स्वाभाविक रूप से लंबे होंगे, इसलिए बजट ढीला हो जाएगा। यदि समस्याएँ आसान हैं, तो सफल उत्तर छोटे होंगे, इसलिए बजट सख्त हो जाएगा। AI बिना किसी मानवीय अनुमान के अपने आप "बिल्कुल सही" लंबाई का लक्ष्य बनाना सीख जाता है।

B. "स्मूथ लैंडिंग" रिवॉर्ड (कोसाइन डिके)

आमतौर पर, यदि आप AI को "छोटा होने" के लिए कहते हैं, तो वह इनाम पाने के लिए एक छोटा, गलत उत्तर देकर धोखा दे सकता है। HMPO इसे रोकता है।

  • उपमा: एक वीडियो गेम की कल्पना करें जहाँ आपको स्तर (level) को जल्दी पूरा करने के लिए अंक मिलते हैं। लेकिन यदि आप स्तर को गलत तरीके से पूरा करते हैं, तो आपको शून्य अंक मिलेंगे, चाहे आपने कितनी भी तेज़ी से क्यों न किया हो।
  • यह कैसे मदद करता है: HMPO एक विशेष गणितीय सूत्र (मल्टीप्लिकेटिव रिवॉर्ड) का उपयोग करता है जो कहता है: "सटीकता ही सबसे महत्वपूर्ण है। यदि आप गलत हैं, तो आपकी लंबाई का कोई महत्व नहीं है; आपको शून्य मिलेगा।" यदि आप सही हैं, तो आपको संक्षिप्त होने के लिए अतिरिक्त अंक मिलते हैं। यह AI को आलसी या गलत होकर धोखाधड़ी करने से रोकता है।

C. "वन-स्टॉप शॉप" (सिंगल-स्टेज ट्रेनिंग)

पुराने तरीकों के लिए एक लंबी, जटिल प्रक्रिया की आवश्यकता होती थी: पहले AI को छोटा होना सिखाएं (चरण 1), फिर उसे सही होना सिखाएं (चरण 2), फिर उन्हें मिलाएं।

  • उपमा: तीन वर्षों में ईंट-दर-ईंट घर बनाने के बजाय, HMPO एक 3D प्रिंटर की तरह है जो एक ही बार में पूरा घर बना देता है।
  • यह कैसे मदद करता है: यह पुराने तरीकों की तुलना में ट्रेनिंग के समय और लागत को 1.5 से 2.5 गुना कम कर देता है।

3. परिणाम: स्मार्ट, तेज़ और सस्ता

शोधकर्ताओं ने 9 बिलियन पैरामीटर्स से लेकर 122 बिलियन पैरामीटर्स तक के AI मॉडलों पर इसका परीक्षण किया।

  • जादू: उन्होंने AI को केवल गणित की समस्याओं पर प्रशिक्षित किया।
  • आश्चर्य: भले ही इसने केवल गणित पर संक्षिप्त होना सीखा, लेकिन यह कोडिंग, विज्ञान और निर्देशों का पालन करने में भी संक्षिप्त हो गया। यह ऐसा है जैसे किसी छात्र को गणित पर एक छोटा निबंध लिखना सिखाया जाए, और अचानक वे बिना बताए छोटे, स्पष्ट ईमेल और कोड लिखने लगें।
  • आंकड़े: AI ने अपनी "सोचने" की लंबाई में 19% से 46% की कमी की (शब्दों की संख्या काफी कम कर दी) जबकि इसकी सटीकता लगभग वैसी ही बनी रही।
  • तुलना: HMPO के साथ प्रशिक्षित एक कंप्रेस्ड 122-बिलियन-पैरामीटर मॉडल, बहुत बड़े और अन-ऑप्टिमाइज्ड मॉडलों के समान प्रदर्शन करता है, लेकिन यह बहुत कम शब्दों और कम कंप्यूटिंग पावर के साथ करता है।

सारांश

HMPO एक नया तरीका है जो AI को "ज़रूरत से ज़्यादा सोचने" से रोकने के लिए है। यह संक्षिप्त होने और सही होने के बीच के आदर्श संतुलन को खोजने के लिए एक स्मार्ट, स्व-समायोजन (self-adjusting) प्रणाली का उपयोग करता है। यह प्रशिक्षित करने में सस्ता है, विशाल मॉडलों पर काम करता है, और आश्चर्यजनक रूप से, केवल गणित का अभ्यास करके कई अलग-अलग विषयों में संक्षिप्त होने का कौशल सिखाता है।

यह शोध पत्र क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह मल्टी-टर्न बातचीत (जैसे एक लंबी चैट जहाँ AI पिछले दौर को याद रखता है) के लिए काम करता है।
  • यह दावा नहीं करता कि यह चिकित्सा निदान या कानूनी सलाह के लिए तैयार है।
  • यह दावा नहीं करता कि यह उन AI एजेंटों के लिए काम करता है जो जटिल लूप में टूल्स (जैसे वेब ब्राउज़ करना या कैलकुलेटर का उपयोग करना) का उपयोग करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →