← नवीनतम पेपर
💬 NLP

IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning

यह शोध पत्र IAPO का प्रस्ताव करता है, जो एक सूचना-सैद्धांतिक (information-theoretic) पोस्ट-ट्रेनिंग फ्रेमवर्क है, जो कंडीशनल म्यूचुअल इंफॉर्मेशन के आधार पर टोकन-वार एडवांटेज असाइन करके टोकन-कुशल तर्क (token-efficient reasoning) को अनुकूलित करता है, जिससे सटीकता में सुधार या उसे बनाए रखते हुए इन्फरेंस लागत में 36% तक की कमी आती है।

मूल लेखक: Yinhan He, Yaochen Zhu, Mingjia Shi, Wendy Zheng, Lin Su, Xiaoqing Wang, Qi Guo, Jundong Li

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yinhan He, Yaochen Zhu, Mingjia Shi, Wendy Zheng, Lin Su, Xiaoqing Wang, Qi Guo, Jundong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "ज़रूरत से ज़्यादा बोलने वाला" रोबोट

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान रोबोट से गणित का एक सवाल पूछा। आप उत्तर चाहते हैं, लेकिन रोबोट बोलना शुरू कर देता है। वह केवल उत्तर नहीं देता; वह अपने हर एक विचार को बोलकर बताता है, अपने काम की तीन बार जाँच करता है, "ठीक है, मुझे इस बारे में सोचने दें," जैसी बातें कहता है, और फिर गलती से उसी विचार पर वापस आ जाता है जिसे वह पहले ही देख चुका है।

वर्तमान AI मॉडल (लार्ज लैंग्वेज मॉडल्स) के साथ ऐसा ही होता है। वे समस्याओं को हल करने में माहिर हैं, लेकिन वे अत्यधिक वाचाल (verbose) हैं। वे वहां तक पहुँचने के लिए बहुत अधिक "टोकन्स" (शब्दों के समूह) का उपयोग करते हैं।

  • लागत: हर अतिरिक्त शब्द का मतलब है पैसा और समय। यह एक टैक्सी यात्रा के लिए भुगतान करने जैसा है जहाँ ड्राइवर एक लंबा रास्ता लेता है, फूलों की खुशबू लेने के लिए रुकता है, और आपको छोड़ने से पहले पाँच बार मैप चेक करता है।
  • लक्ष्य: हम चाहते हैं कि रोबोट बुद्धिमान भी हो और संक्षिप्त (concise) भी। हम चाहते हैं कि वह सही उत्तर खोए बिना फालतू की बातों को हटा दे।

पुराना तरीका: "लंबाई की सीमा" लगाने वाला कोच

पहले, शोधकर्ताओं ने एक सख्त कोच की तरह काम करके इसे ठीक करने की कोशिश की जो कहता था, "यदि आप 50 से अधिक शब्द लिखते हैं, तो आपको कोई अंक नहीं मिलेंगे।"

  • खामी: यह एक छात्र को यह कहने जैसा है कि, "50 से अधिक शब्द न लिखें," बिना इस बात की परवाह किए कि उन्होंने क्या लिखा है। छात्र सही उत्तर तक पहुँचने के लिए सबसे महत्वपूर्ण गणितीय चरणों को भी काट सकता है, या वह अच्छी बातों को छोड़कर बोरिंग हिस्सों को रख सकता है। पुराने तरीकों को यह समझ नहीं था कि कौन से शब्द वास्तव में सहायक थे और कौन से केवल शोर (noise) थे।

नया समाधान: IAPO (एक "स्मार्ट एडिटर")

लेखक IAPO नामक एक नई प्रणाली प्रस्तावित करते हैं। केवल शब्दों को गिनने के बजाय, IAPO एक स्मार्ट एडिटर की तरह काम करता है जो रोबोट द्वारा लिखे गए हर एक शब्द के मूल्य (value) को समझता है।

यह तीन सरल भागों में कैसे काम करता है, यहाँ दिया गया है:

1. "वैल्यू मीटर" (सूचना जागरूकता - Information Awareness)

कल्पना कीजिए कि रोबोट एक पहेली सुलझाने के लिए एक कहानी लिख रहा है। IAPO हर वाक्य को देखता है और पूछता है: "क्या यह वाक्य वास्तव में पहेली सुलझाने में मदद करता है?"

  • उच्च मूल्य (High Value): "उत्तर 42 है।" (यह अत्यंत महत्वपूर्ण है!)
  • निम्न मूल्य (Low Value): "रुको, मुझे अपनी गणित की दोबारा जाँच करने दो... हम्म, मुझे लगता था कि मैं पहले सही था।" (यह केवल शोर/अनावश्यकता है)।

IAPO एक गणितीय अवधारणा का उपयोग करता है जिसे कंडीशनल म्यूचुअल इंफॉर्मेशन (Conditional Mutual Information) कहा जाता है। सरल शब्दों में, यह मापने का एक तरीका है: "यदि मैं इस विशिष्ट शब्द को हटा दूँ, तो मैं अंतिम उत्तर के बारे में कितना अधिक भ्रमित हो जाऊँगा?"

  • यदि शब्द को हटाने से आप भ्रमित हो जाते हैं, तो वह शब्द उच्च मूल्य का है। IAPO इसे पुरस्कृत करता है।
  • यदि शब्द को हटाने से कोई फर्क नहीं पड़ता, तो वह शब्द निम्न मूल्य का है (फालतू की बात)। IAPO इसे दंडित करता है।

2. "एक्सप्लोरेशन सेफ्टी नेट" (Exploration Safety Net)

एक जोखिम है: यदि आप केवल रोबोट को छोटा लिखने के लिए पुरस्कृत करते हैं, तो वह आलसी हो सकता है और सही उत्तर पाने के लिए आवश्यक कठिन सोच को छोड़कर बहुत जल्दी उत्तर का अनुमान लगा सकता है।
इसे ठीक करने के लिए, IAPO में एक दूसरा नियम है: एक्सप्लोरेशन एडजस्टमेंट (Exploration Adjustment)।

  • यदि रोबोट उत्तर सही देता है, तो IAPO कहता है, "बहुत बढ़िया! आप आत्मविश्वासी और सही थे। जो कर रहे थे वही करते रहें।" (यह रोबोट को भटकने से रोकता है)।
  • यदि रोबोट उत्तर गलत देता है, तो IAPO कहता है, "ओह। आप एक गलत रास्ते पर बहुत अधिक आत्मविश्वासी थे। अगली बार कुछ अलग करने की कोशिश करें।" (यह रोबोट को नए विचारों को खोजने के लिए प्रोत्साहित करता है)।

3. "स्पीड ट्रिक" (कुशल अनुमान - Efficient Estimation)

एक लंबी कहानी में हर एक शब्द का "मूल्य" निकालना आमतौर पर कंप्यूटर के लिए बहुत धीमा और महंगा होता है। यह समुद्र तट पर रेत के हर एक कण को व्यक्तिगत रूप से तौलने की कोशिश करने जैसा है।
लेखकों ने एक स्पीड ट्रिक (जिसे "अर्ली-एग्जिट" और "KV-कैश" कहा जाता है) का आविष्कार किया है।

  • उपमा: पूरी कहानी को शुरू से बार-बार पढ़ने के बजाय, सिस्टम कहानी की "याददाश्त" (memory) को चलते-चलते सहेज लेता है। इसके बाद यह सीधे उस हिस्से पर कूद सकता है जिसकी इसे जाँच करने की आवश्यकता है। यह प्रक्रिया को वास्तविक कंप्यूटरों पर उपयोग करने के लिए पर्याप्त तेज़ बनाता है।

परिणाम: छोटे, स्मार्ट और तेज़

इस नए "स्मार्ट एडिटर" का परीक्षण गणित की समस्याओं (जैसे स्कूल या प्रतियोगिताओं में पाई जाने वाली) पर किया गया।

  • परिणाम: IAPO के साथ प्रशिक्षित AI ने समस्याओं को पहले की तरह ही सटीकता से हल किया, लेकिन इसने 47% तक कम शब्दों का उपयोग किया।
  • तुलना: एक उदाहरण में, एक मानक AI ने एक साधारण गणित की समस्या को हल करने के लिए 105 शब्दों का उपयोग किया। IAPO-प्रशिक्षित AI ने उसी समस्या को केवल 15 शब्दों में हल किया, जिससे सभी "उम्म," "आह," और दोहराव वाली जाँचें हट गईं।

सारांश

IAPO को एक AI को केवल एक तेज़ टाइपिस्ट के बजाय एक बेहतरीन एडिटर बनने की शिक्षा देने के रूप में समझें।

  • पुराना AI: "उत्तर 5 है" कहने के लिए 10 पन्नों का निबंध लिखता है।
  • IAPO AI: एक वाक्य का नोट लिखता है: "उत्तर 5 है।"

यह इसलिए हासिल करता है क्योंकि यह AI को केवल उन शब्दों के लिए पुरस्कृत करता है जो वास्तव में मायने रखते हैं, जबकि पर्दे के पीछे गणित करने के लिए एक चतुर स्पीड ट्रिक का उपयोग करता है। इससे पैसा, समय और कंप्यूटिंग पावर की बचत होती है, जिससे AI को कम बुद्धिमान बनाए बिना अधिक कुशल बनाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →