EAGer: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling
EAGer एक प्रशिक्षण-मुक्त, एंट्रॉपी-जागरूक इन्फरेंस-टाइम स्केलिंग विधि है जो केवल उच्च-अनिश्चितता वाले टोकन पर ही रीजनिंग पथों को ब्रांच करके कंप्यूटेशनल संसाधनों को गतिशील रूप से आवंटित करती है, जिससे टोकन के उपयोग को 64% तक कम किया जा सकता है और जटिल रीजनिंग बेंचमार्क पर Pass@k प्रदर्शन में महत्वपूर्ण सुधार किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एआई (AI) छात्रों की एक कक्षा को गणित का टेस्ट दे रहे हैं। लक्ष्य सही उत्तर प्राप्त करना है।
परंपरागत रूप से, यह सुनिश्चित करने के लिए कि एआई सही उत्तर दे, आप उसे कहते हैं: "मुझे केवल एक उत्तर न दें। हर एक प्रश्न के लिए, चाहे वह कितना भी आसान या कठिन क्यों न हो, 32 अलग-अलग समाधान लिखें।" फिर, आप उन सभी 32 उत्तरों को देखते हैं और सबसे अच्छा वाला चुन लेते हैं।
इसे फुल पैरेलल सैंपलिंग (Full Parallel Sampling) कहा जाता है। यह काम तो करता है, लेकिन यह अविश्वसनीय रूप से अपव्ययी (wasteful) है।
- समस्या: यदि प्रश्न सरल है (जैसे "2+2=?"), तो एआई संभवतः 32 बार बिल्कुल एक ही उत्तर लिखेगा। आपने एक प्रश्न के लिए 31 सेट दिमागी शक्ति बर्बाद कर दी जिसकी आवश्यकता ही नहीं थी।
- लागत: यह बिजली और कंप्यूटर समय को भारी मात्रा में जलाता है, खासकर जब एआई किसी बहुत कठिन समस्या पर अटका हुआ हो और उसे समाधान खोजने के लिए कई अलग-अलग रास्तों को आज़माने की आवश्यकता हो।
पेश है EAGER: एक स्मार्ट, अनुकूलन योग्य शिक्षक
यह शोध पत्र EAGER (एन्ट्रॉपी-अवेयर जेनरेशन - Entropy-Aware GEneRation) को पेश करता है। EAGER को एक स्मार्ट शिक्षक के रूप में समझें जो एआई के सोचने के दौरान उसके "आत्मविश्वास मीटर" (confidence meter) पर नज़र रखता है।
EAGER कैसे काम करता है, इसे एक सरल उपमा (analogy) से समझते हैं:
1. आत्मविश्वास मीटर (एन्ट्रॉपी - Entropy)
कल्पना कीजिए कि एआई एक भूलभुलैया (maze) में चल रहा है।
- कम एन्ट्रॉपी (उच्च आत्मविश्वास): एआई एक सीधी, अच्छी रोशनी वाली गैलरी में चल रहा है। उसे पता है कि उसे किस दिशा में जाना है। वह कह रहा है, "मुझे यकीन है कि यही रास्ता है।"
- उच्च एन्ट्रॉपी (कम आत्मविश्वास): एआई सड़क के एक ऐसे मोड़ पर पहुँचता है जहाँ धुंध छाई हुई है। वह अनिश्चित है कि किस दिशा में जाना है। वह कह रहा है, "हम्म, मैं बाईं ओर जा सकता हूँ, या शायद दाईं ओर? मुझे यकीन नहीं है।"
2. रणनीति: केवल फंसने पर ही शाखाएँ बनाना (Branching)
32 उत्तर लिखने के बजाय, EAGER एआई को बताता है:
- जब एआई आश्वस्त हो (कम एन्ट्रॉपी): "सीधे चलते रहो। नए रास्ते आज़माने में समय बर्बाद मत करो। बस इस वाक्य को पूरा करो।"
- जब एआई भ्रमित हो (उच्च एन्ट्रॉपी): "रुको! यह एक पेचीदा जगह है। आइए शाखाएँ फैलाते हैं (branch out)। विभिन्न संभावनाओं को तलाशने के लिए यहीं पर उत्तर के कुछ नए संस्करण बनाएँ।"
यह एक जासूस की तरह है जो अपराध को सुलझा रहा है। यदि सुराग स्पष्ट हैं, तो उन्हें हर गली में जांच करने की आवश्यकता नहीं है। लेकिन जब वे किसी भ्रमित करने वाले सुराग से टकराते हैं, तो वे अचानक विभाजित हो जाते हैं और अलग-अलग गलियों में कई जासूसों को भेज देते हैं ताकि वे क्या पाते हैं, यह देखा जा सके।
3. "बजट" का तरीका
शोध पत्र में कंप्यूटर पावर का एक "बजट" उल्लेख किया गया है।
- पुराना तरीका: हर प्रश्न पर पूरे बजट को खर्च करना, यहाँ तक कि आसान प्रश्नों पर भी।
- EAGER का तरीका: क्योंकि EAGER आसान प्रश्नों पर अनावश्यक काम को छोड़ देता है, इसलिए यह अपने बजट का एक बड़ा हिस्सा बचा लेता है।
- पुनर्वितरण (Reallocation): EAGER उस बचाए गए ऊर्जा को कठिन प्रश्नों को दे देता है। यदि कोई प्रश्न वास्तव में कठिन है, तो EAGER बची हुई ऊर्जा का उपयोग यह करने के लिए करता है कि एआई सामान्य से भी अधिक रास्ते आज़मा सके, विशेष रूप से वहीं जहाँ उसके फंसने की सबसे अधिक संभावना है।
उन्होंने क्या पाया?
शोधकर्ताओं ने विभिन्न एआई मॉडलों का उपयोग करके कठिन गणित, विज्ञान और कोडिंग समस्याओं पर इसका परीक्षण किया। यहाँ परिणाम सरल भाषा में दिए गए हैं:
- यह तेज़ और सस्ता है: पुराने तरीके की तुलना में EAGER ने उत्तर उत्पन्न करने के लिए 64% तक कम शब्द (टोकन) का उपयोग किया। इसका मतलब है कि यह कंप्यूटर की भारी मात्रा में शक्ति बचाता है।
- यह स्मार्ट है: कम शक्ति का उपयोग करने के बावजूद, इसने वास्तव में अधिक सही उत्तर प्राप्त किए।
- एक ऐसी सेटिंग में जहाँ एआई अपने काम की जाँच कर सकता था (जैसे कि उत्तर कुंजी के साथ गणित का टेस्ट), इसने सफलता दर में 37% का सुधार किया।
- बिना किसी उत्तर कुंजी के (केवल अनुमान लगाते हुए), इसने सफलता में 12% का सुधार किया।
- यह हर जगह काम करता है: यह छोटे एआई मॉडल और बड़े मॉडल, दोनों पर गणित, विज्ञान और कोडिंग कार्यों पर अच्छी तरह से काम करता है।
मुख्य निष्कर्ष (The Bottom Line)
EAGER एक "ट्रेनिंग-फ्री" (training-free) विधि है, जिसका अर्थ है कि आपको एआई को सोचने का नया तरीका सिखाने की आवश्यकता नहीं है। आपको बस उसे यह बताने के लिए नए नियम देने हैं कि उसे कब कई रास्तों को आज़माना है।
उपमा का सारांश:
यदि पुराना तरीका हर पहेली को हल करने के लिए 32 समान क्लोन भेजने जैसा था, तो EAGER एक स्मार्ट खोजकर्ता को भेजने जैसा है जो केवल तभी कई क्लोनों में विभाजित होता है जब रास्ता धुंधला और भ्रमित करने वाला हो जाता है। यह आसान हिस्सों पर ऊर्जा बचाता है और उस अतिरिक्त ऊर्जा को कठिन हिस्सों पर केंद्रित करता है, जिससे कम बर्बादी के साथ बेहतर परिणाम मिलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।