← नवीनतम पेपर
🤖 AI

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

Hyper एक प्रशिक्षण-मुक्त (training-free), ऑनलाइन नियंत्रण नीति है जो मिश्रण-विशेषज्ञों (mixture-of-experts) वाले मॉडलों के लिए विस्तार, टोकन-स्तरीय परिशोधन और विश्वास-आधारित एकत्रीकरण के माध्यम से परिकल्पना पूल (hypothesis pool) का प्रबंधन करके परीक्षण-समय तर्क (test-time reasoning) के दौरान अन्वेषण (exploration) और शोषण (exploitation) को गतिशील रूप से संतुलित करती है, जिससे टोकन उपयोग को कम करते हुए सटीकता में उल्लेखनीय सुधार होता है।

मूल लेखक: Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत कठिन गणितीय समस्या या एक जटिल तर्क पहेली (logic puzzle) को हल करने की कोशिश कर रहे हैं। आपके पास एक प्रतिभाशाली लेकिन थोड़ा घबराया हुआ सहायक (AI) है जो समस्या को चरण-दर-चरण सोचने के माध्यम से हल कर सकता है।

यदि आप अपने सहायक को इसे केवल एक बार हल करने के लिए कहते हैं, तो वह किसी गलत मोड़ पर फंस सकता है और आपको गलत उत्तर दे सकता है। इसे ठीक करने के लिए, आप उससे एक ही समय में इसे हल करने के कई अलग-अलग तरीके आज़माने के लिए कह सकते हैं। इसे "स्केलिंग टेस्ट-टाइम कंप्यूट" (scaling test-time compute) कहा जाता है।

हालाँकि, एक पेच है: आपके पास समय और ऊर्जा (एक "कंप्यूट बजट") की एक सीमित मात्रा है। यदि आप सहायक को 100 अलग-अलग रास्ते आज़माने के लिए कहते हैं, तो शायद वे कोई भी रास्ता पूरा करने से पहले ही आपकी ऊर्जा समाप्त हो जाए। यदि आप केवल 2 रास्ते मांगते हैं, तो आप सही समाधान को पूरी तरह से मिस कर सकते हैं।

यह पेपर HyPER (Hypothesis Path Expansion and Reduction) नामक एक नई प्रणाली पेश करता है जो इस संतुलन को बनाने का काम करती है। HyPER को अपने सहायक के विचारों के लिए एक स्मार्ट ट्रैफिक कंट्रोलर के रूप में समझें।

पुराने तरीकों के साथ समस्या

पुराने तरीके कठोर यातायात नियमों की तरह थे:

  1. "ट्री" (Tree) विधि: यह सहायक को हर 5 स्टेप के बाद नए रास्ते बनाने के लिए मजबूर करने जैसा था, चाहे इसकी ज़रूरत हो या न हो। कभी-कभी उन्हें शाखाएँ (branch) बनाने की ज़रूरत नहीं होती थी, और कभी-कभी उन्हें बहुत पहले ही शाखाएँ बनानी पड़ती थीं। यह बहुत कठोर था और ऊर्जा बर्बाद करता था।
  2. "पैरेलल" (Parallel) विधि: यह सहायक को शुरू से अंत तक 100 पूरी कहानियाँ लिखने के लिए कहने जैसा था और फिर उनमें से सबसे अच्छी को चुनने जैसा था। इसने 99 कहानियाँ लिखने में बहुत अधिक ऊर्जा बर्बाद की जो लगभग एक जैसी या स्पष्ट रूप से गलत थीं, और इसने कहानियाँ लिखे जाने के दौरान उनकी गुणवत्ता सुधारने में मदद नहीं की।

HyPER कैसे काम करता है: स्मार्ट ट्रैफिक कंट्रोलर

HyPER खेल बदल देता है क्योंकि यह सोचने की प्रक्रिया को विचारों के एक गतिशील पूल (dynamic pool) के रूप में देखता है जिसे यह वास्तविक समय में फैला (expand) या सिकोड़ (shrink) सकता है। यह तीन तरकीबों का उपयोग करता है:

1. "फेज़-डिपेंडेंट" स्विच (कब कार्य करना है, यह जानना)

HyPER सहायक की सोचने की प्रक्रिया को एक कोच की तरह देखता है जो खेल देख रहा हो।

  • शुरुआती दौर (एक्सप्लोरेशन - अन्वेषण): शुरुआत में, सहायक अभी बस शुरू ही कर रहा होता है। HyPER कहता है, "आइए कुछ अलग शुरुआती बिंदु आज़माते हैं!" यह रास्तों की संख्या को बढ़ाता है ताकि वे सही दिशा को मिस न कर दें।
  • अंतिम दौर (एक्सप्लोइटेशन - दोहन): जैसे-जैसे सहायक उत्तर के करीब पहुँचता है, HyPER देखता है कि रास्ते एक जैसे दिखने लगे हैं या एक रास्ता बहुत आत्मविश्वासी दिख रहा है। यह कहता है, "नई चीज़ें आज़माना बंद करो! अपनी सारी ऊर्जा इस एक मजबूत रास्ते को बेहतर बनाने में लगाओ।"
  • जादू: यह कोई निश्चित शेड्यूल का उपयोग नहीं करता है। यह तय करता है कि वर्तमान विचारों की आत्मविश्वास और विविधता के आधार पर उसे शाखाएँ निकालनी चाहिए (explore) या ध्यान केंद्रित करना चाहिए (exploit)।

2. "एक्सपर्ट रिफाइनमेंट" की तरकीब (AI की आंतरिक विविधता का उपयोग करना)

आधुनिक AI मॉडल अक्सर एक "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts - MoE) आर्किटेक्चर का उपयोग करते हैं। कल्पना कीजिए कि AI वास्तव में 100 छोटे विशेषज्ञों की एक टीम है, लेकिन एक समय में केवल कुछ ही सक्रिय होते हैं।

  • पुराना तरीका: बेहतर उत्तर पाने के लिए, आपको पूरी वाक्य रचना को शुरू से दोबारा शुरू करना पड़ता था।
  • HyPER का तरीका: जब AI अगला शब्द लिखने वाला होता है, तो HyPER विशेषज्ञों की टीम से पूछता है: "हे, तुम्हें क्या लगता है कि अगला शब्द क्या होना चाहिए?" यह सिर्फ उस एक शब्द के लिए विभिन्न विशेषज्ञों की राय एकत्र करता है, उन्हें औसत निकालता है, और सबसे अच्छा चुनता है।
  • लाभ: यह पूरी कहानी को दोबारा लिखे बिना तुरंत उत्तर की गुणवत्ता में सुधार करता है। यह पूरे खेल को फिर से शुरू करने के बजाय अपनी टीम के साथ एक त्वरित बैठक (huddle) करने जैसा है।

3. "लंबाई और आत्मविश्वास" का वोट (विजेता चुनना)

अंत में, आपके पास कई पूर्ण समाधान होते हैं। आप सही वाले को कैसे चुनते हैं?

  • जाल: कभी-कभी, एक गलत उत्तर बहुत आत्मविश्वासी और छोटा होता है, जबकि सही उत्तर लंबा और सावधानीपूर्वक होता है। एक साधारण "बहुमत वोट" गलत छोटे उत्तर को चुन सकता है।
  • HyPER की अंतर्दृष्टि: पेपर ने कुछ दिलचस्प देखा: जब आप कम आत्मविश्वास वाले रास्तों को हटा देते हैं, तो सही रास्ते गलत रास्तों की तुलना में लंबे होते हैं। गलत रास्ते आमतौर पर जल्दी क्रैश हो जाते हैं क्योंकि AI अपना आत्मविश्वास खो देता है।
  • समाधान: HyPER केवल वोटों को नहीं गिनता है। यह दो चीजों को देखता है: रास्ता कितना आत्मविश्वासी था? और इसे हल करने में कितना समय लगा? यह उन उत्तरों को बोनस देता है जो आत्मविश्वासी भी हैं और जिन्होंने गहनता से काम लिया भी है। यह इसे सही उत्तर चुनने में मदद करता है भले ही वह सबसे आम न हो।

परिणाम

इस प्रणाली का परीक्षण कठिन गणितीय और तार्किक समस्याओं पर किया गया।

  • सटीकता (Accuracy): इसने पिछले तरीकों की तुलना में बहुत अधिक बार सही उत्तर दिया (लगभग 8-10% बेहतर)।
  • दक्षता (Efficiency): वहां तक पहुँचने के लिए इसने काफी कम ऊर्जा (लगभग 25-40% कम "टोकन" या शब्द उत्पन्न किए) का उपयोग किया।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप अंधेरे में एक टॉर्च के साथ भूलभुलैया (maze) में रास्ता खोज रहे हैं जिसकी बैटरी सीमित है।

  • पुराने तरीके या तो बैटरी खत्म होने तक 100 यादृच्छिक (random) दिशाओं में रोशनी दिखाते थे, या वे आपको विशिष्ट स्थानों पर कोने मुड़ने के लिए मजबूर करते थे, चाहे आप जो भी देख रहे हों।
  • HyPER एक स्मार्ट गाइड है। यह आपको बताता है कि जब आप खो गए हों तो फैलकर चारों ओर देखें (Exploration)। जब आपको एक आशाजनक रास्ता दिखाई देता है, तो यह आपको अपनी रोशनी वहां केंद्रित करने और सावधानी से चलने के लिए कहता है (Exploitation)। यदि आप लड़खड़ाते हैं, तो यह आपको पूरा फिर से शुरू करने के बजाय तुरंत अपने कदम को समायोजित करने में मदद करता है। और जब आप निकास (exit) पा लेते हैं, तो यह जाँचता है कि क्या रास्ता लंबा और स्थिर था, जिससे यह सुनिश्चित हो सके कि आप केवल एक ऐसे रास्ते में नहीं stumbled हुए जो निकास जैसा दिखता था।

परिणाम? आप तेज़ गति से, तेज़ रोशनी के साथ, और बची हुई बैटरी के साथ निकास ढूंढ लेते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →