HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression
HMPO एक लागत प्रभावी, एकल-चरणीय सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विविध कार्यों और मॉडल स्केल्स में नगण्य सटीकता हानि के साथ चेन-ऑफ-थॉट रीजनिंग को 19%–46% तक कुशलतापूर्वक संकुचित करता है, जो मौजूदा विधियों में मैनुअल ट्यूनिंग और बहु-चरणीय प्रशिक्षण की सीमाओं को दूर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान लेकिन बहुत अधिक बातूनी छात्र है। जब आप उससे गणित का कोई सवाल पूछते हैं, तो वह केवल उत्तर नहीं देता; बल्कि वह अपने मन में आने वाले हर विचार, गलत रास्तों, "क्या होगा अगर" वाली स्थितियों और लंबी-चौड़ी व्याख्याओं के बारे में एक 50 पन्नों का उपन्यास लिख देता है। हालांकि यह "सोचने की प्रक्रिया" (Chain-of-Thought) उसे सही उत्तर तक पहुँचने में मदद करती है, लेकिन यह अविश्वसनीय रूप से धीमी, महंगी और ऊर्जा की बर्बादी करने वाली है।
यह शोध पत्र एक नई विधि पेश करता है जिसे HMPO (हाइब्रिड मीडियन-लेंथ पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है, जो इस छात्र को अपनी बुद्धिमत्ता खोए बिना संक्षिप्त (concise) होना सिखाती है।
HMPO कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:
1. समस्या: "ज़रूरत से ज़्यादा सोचने वाला" छात्र
वर्तमान AI मॉडल तर्क करने में माहिर हैं, लेकिन वे "ज़रूरत से ज़्यादा सोचने" (overthink) लगते हैं। वे एक ही प्रश्न के लिए हज़ारों शब्द (टोकन) उत्पन्न करते हैं। यह ऐसा है जैसे किसी से समय पूछने पर वह आपको घड़ियों के इतिहास पर एक व्याख्यान देने लगे। इससे बहुत अधिक पैसा (कंप्यूटिंग पावर) खर्च होता है और इसमें बहुत समय लगता है।
मौजूदा तरीके इन्हें ठीक करने के लिए बोझिल हैं:
- वे कठोर नियमों का उपयोग करते हैं (जैसे, "1,000 शब्दों के बाद बोलना बंद कर दें"), जो एक कठिन समस्या के लिए आवश्यक व्याख्या को बीच में ही काट सकते हैं।
- उन्हें महंगी, बहु-चरणीय ट्रेनिंग की आवश्यकता होती है (जैसे, पहले एक ट्यूटर रखना, फिर एक कोच, फिर एक मैनेजर), जिसमें बहुत समय और पैसा लगता है।
- वे बहुत बड़े, जटिल मॉडलों पर लागू होने पर अक्सर विफल हो जाते हैं।
2. समाधान: HMPO (एक स्मार्ट कोच)
HMPO एक एकल, कुशल प्रशिक्षण सत्र है जो AI को संक्षिप्त लेकिन सटीक होना सिखाता है। यह तीन चतुर तरीकों का उपयोग करता है:
A. "गोल्डिलॉक्स" बजट (एडेप्टिव मीडियन)
एक निश्चित शब्द सीमा तय करने के बजाय (जैसे "अधिकतम 500 शब्द"), HMPO छात्र के हालिया सफल उत्तरों को देखता है।
- उपमा: कल्पना कीजिए कि एक कोच धावकों के एक समूह को देख रहा है। धावकों को यह कहने के बजाय कि "ठीक 10 मिनट दौड़ो," कोच उन धावकों के मीडियन (मध्यम) समय को देखता है जिन्होंने वास्तव में सफलतापूर्वक दौड़ पूरी की है।
- यह कैसे मदद करता है: यदि समस्याएँ कठिन हैं, तो "सफल" उत्तर स्वाभाविक रूप से लंबे होंगे, इसलिए बजट ढीला हो जाएगा। यदि समस्याएँ आसान हैं, तो सफल उत्तर छोटे होंगे, इसलिए बजट सख्त हो जाएगा। AI बिना किसी मानवीय अनुमान के अपने आप "बिल्कुल सही" लंबाई का लक्ष्य बनाना सीख जाता है।
B. "स्मूथ लैंडिंग" रिवॉर्ड (कोसाइन डिके)
आमतौर पर, यदि आप AI को "छोटा होने" के लिए कहते हैं, तो वह इनाम पाने के लिए एक छोटा, गलत उत्तर देकर धोखा दे सकता है। HMPO इसे रोकता है।
- उपमा: एक वीडियो गेम की कल्पना करें जहाँ आपको स्तर (level) को जल्दी पूरा करने के लिए अंक मिलते हैं। लेकिन यदि आप स्तर को गलत तरीके से पूरा करते हैं, तो आपको शून्य अंक मिलेंगे, चाहे आपने कितनी भी तेज़ी से क्यों न किया हो।
- यह कैसे मदद करता है: HMPO एक विशेष गणितीय सूत्र (मल्टीप्लिकेटिव रिवॉर्ड) का उपयोग करता है जो कहता है: "सटीकता ही सबसे महत्वपूर्ण है। यदि आप गलत हैं, तो आपकी लंबाई का कोई महत्व नहीं है; आपको शून्य मिलेगा।" यदि आप सही हैं, तो आपको संक्षिप्त होने के लिए अतिरिक्त अंक मिलते हैं। यह AI को आलसी या गलत होकर धोखाधड़ी करने से रोकता है।
C. "वन-स्टॉप शॉप" (सिंगल-स्टेज ट्रेनिंग)
पुराने तरीकों के लिए एक लंबी, जटिल प्रक्रिया की आवश्यकता होती थी: पहले AI को छोटा होना सिखाएं (चरण 1), फिर उसे सही होना सिखाएं (चरण 2), फिर उन्हें मिलाएं।
- उपमा: तीन वर्षों में ईंट-दर-ईंट घर बनाने के बजाय, HMPO एक 3D प्रिंटर की तरह है जो एक ही बार में पूरा घर बना देता है।
- यह कैसे मदद करता है: यह पुराने तरीकों की तुलना में ट्रेनिंग के समय और लागत को 1.5 से 2.5 गुना कम कर देता है।
3. परिणाम: स्मार्ट, तेज़ और सस्ता
शोधकर्ताओं ने 9 बिलियन पैरामीटर्स से लेकर 122 बिलियन पैरामीटर्स तक के AI मॉडलों पर इसका परीक्षण किया।
- जादू: उन्होंने AI को केवल गणित की समस्याओं पर प्रशिक्षित किया।
- आश्चर्य: भले ही इसने केवल गणित पर संक्षिप्त होना सीखा, लेकिन यह कोडिंग, विज्ञान और निर्देशों का पालन करने में भी संक्षिप्त हो गया। यह ऐसा है जैसे किसी छात्र को गणित पर एक छोटा निबंध लिखना सिखाया जाए, और अचानक वे बिना बताए छोटे, स्पष्ट ईमेल और कोड लिखने लगें।
- आंकड़े: AI ने अपनी "सोचने" की लंबाई में 19% से 46% की कमी की (शब्दों की संख्या काफी कम कर दी) जबकि इसकी सटीकता लगभग वैसी ही बनी रही।
- तुलना: HMPO के साथ प्रशिक्षित एक कंप्रेस्ड 122-बिलियन-पैरामीटर मॉडल, बहुत बड़े और अन-ऑप्टिमाइज्ड मॉडलों के समान प्रदर्शन करता है, लेकिन यह बहुत कम शब्दों और कम कंप्यूटिंग पावर के साथ करता है।
सारांश
HMPO एक नया तरीका है जो AI को "ज़रूरत से ज़्यादा सोचने" से रोकने के लिए है। यह संक्षिप्त होने और सही होने के बीच के आदर्श संतुलन को खोजने के लिए एक स्मार्ट, स्व-समायोजन (self-adjusting) प्रणाली का उपयोग करता है। यह प्रशिक्षित करने में सस्ता है, विशाल मॉडलों पर काम करता है, और आश्चर्यजनक रूप से, केवल गणित का अभ्यास करके कई अलग-अलग विषयों में संक्षिप्त होने का कौशल सिखाता है।
यह शोध पत्र क्या दावा नहीं करता है:
- यह दावा नहीं करता कि यह मल्टी-टर्न बातचीत (जैसे एक लंबी चैट जहाँ AI पिछले दौर को याद रखता है) के लिए काम करता है।
- यह दावा नहीं करता कि यह चिकित्सा निदान या कानूनी सलाह के लिए तैयार है।
- यह दावा नहीं करता कि यह उन AI एजेंटों के लिए काम करता है जो जटिल लूप में टूल्स (जैसे वेब ब्राउज़ करना या कैलकुलेटर का उपयोग करना) का उपयोग करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।