← नवीनतम पेपर
💬 NLP

AdaBoN: Adaptive Best-of-N Alignment

यह शोध पत्र AdaBoN का प्रस्ताव करता है, जो एक प्रॉम्प्ट-अनुकूलनीय (prompt-adaptive) बेस्ट-ऑफ-एन (Best-of-N) संरेखण रणनीति है जो एक छोटे अन्वेषण बजट के साथ रिवॉर्ड वितरण का पहले अनुमान लगाकर और फिर शेष संसाधनों को अनुकूल रूप से वितरित करके इन्फरेंस-टाइम कंप्यूट को कुशलतापूर्वक आवंटित करता है, जिससे यह समान वितरण विधियों से बेहतर प्रदर्शन करता है और काफी बड़े बजटों के साथ प्रतिस्पर्धी बना रहता है।

मूल लेखक: Vinod Raman, Hilal Asi, Satyen Kale

प्रकाशित 2026-03-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Vinod Raman, Hilal Asi, Satyen Kale

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली शेफ (Language Model) हैं जो लाजवाब व्यंजन बना सकते हैं। हालाँकि, कभी-कभी शेफ थोड़ा अनियंत्रित हो जाता है और बहुत अधिक नमक डाल देता है या टोस्ट जला देता है। इसे ठीक करने के लिए, आपके पास एक टेस्ट-टेस्टर (Reward Model) है जो हर व्यंजन को 1 से 10 के पैमाने पर रेट करता है।

आपका लक्ष्य अपने ग्राहकों (उपयोगकर्ताओं) को सबसे अच्छा भोजन परोसना है।

पुराना तरीका: "द ब्रूट फोर्स बुफे" (The Brute Force Buffet)

अतीत में, यह सुनिश्चित करने के लिए कि आप 10/10 का व्यंजन परोसें, आप Best-of-N नामक विधि का उपयोग करते थे। यह कैसे काम करता था:

  1. आप शेफ को एक ही व्यंजन के 100 अलग-अलग संस्करण बनाने के लिए कहते हैं।
  2. आप सभी 100 प्लेटें टेस्ट-टेस्टर को देते हैं।
  3. आप सबसे अच्छी प्लेट चुनते हैं और उसे परोसते हैं।
  4. आप बाकी 99 को फेंक देते हैं।

समस्या: यह अविश्वसनीय रूप से बर्बादी भरा है।

  • यदि शेफ पहले से ही पास्ता बनाने में माहिर है, तो शायद आपको एक बेहतरीन प्लेट खोजने के लिए केवल 3 संस्करण बनाने की आवश्यकता थी। 100 बनाना समय और गैस की बर्बादी थी।
  • यदि शेफ सुशी बनाने में संघर्ष कर रहा है, तो आपको एक खाने योग्य प्लेट खोजने के लिए 100 संस्करण बनाने की आवश्यकता हो सकती है।
  • लेकिन पुराने तरीके को इससे कोई फर्क नहीं पड़ता था। उसने हर एक ऑर्डर के लिए 100 संस्करण बनाए, चाहे वह आसान हो या कठिन। इसने रसोई को धीमा और महंगा बना दिया।

नया तरीका: "AdaBoN" (एडेप्टिव बेस्ट-ऑफ-एन)

यह पेपर AdaBoN पेश करता है, जो एक स्मार्ट किचन मैनेजर है जो विशिष्ट ऑर्डर के आधार पर रणनीति बदलता है। यह समय और पैसा बचाने के लिए एक दो-चरणीय दृष्टिकोण का उपयोग करता है।

चरण 1: "स्वाद परीक्षण" (खोज/Exploration)

तुरंत 100 प्लेटें बनाने के बजाय, मैनेजर कहता है: "चलो पहले हर ऑर्डर के लिए 5 छोटे नमूने बनाते हैं।"

  • शेफ पास्ता के 5 छोटे नमूने बनाता है। टेस्ट-टेस्टर उन्हें रेट करता है।
  • शेफ सुशी के 5 छोटे नमूने बनाता है। टेस्ट-टेस्टर उन्हें रेट करता है।

चरण 2: "स्मार्ट एलोकेशन" (अनुकूलन/Adaptation)

अब, मैनेजर उन 5 नमूनों से प्राप्त डेटा को देखता है और एक स्मार्ट निर्णय लेता है:

  • परिदृश्य A (एक आसान ऑर्डर): पास्ता के नमूने सभी 9 और 10 के थे। मैनेजर सोचता है, "शानदार! शेफ लय में है। हमें 95 और बनाने की ज़रूरत नहीं है। चलिए इनमें से सर्वश्रेष्ठ 5 में से चुन लेते हैं और इसे परोस देते हैं।" परिणाम: भारी बचत।
  • परिदृश्य B (एक कठिन ऑर्डर): सुशी के नमूने सभी 2 और 3 के थे। मैनेजर सोचता है, "ओह ओह, शेफ इस चीज़ में संघर्ष कर रहा है। हमें प्रयास जारी रखना होगा। आइए विजेता खोजने के लिए अपने शेष बजट का उपयोग करके 95 और सुशी प्लेटें बनाते हैं।" परिणाम: उच्च गुणवत्ता, भले ही इसमें अधिक लागत आई हो।

यह एक बड़ी बात क्यों है

यह पेपर दिखाता है कि यह "स्मार्ट मैनेजर" तीन मुख्य कारणों से "ब्रूट फोर्स" शेफ की तुलना में बहुत बेहतर है:

  1. यह तेज़ है (कम लेटेंसी): क्योंकि मैनेजर सभी के लिए शुरुआती 5 नमूने एक साथ (पैरेलल में) मांगता है, इसलिए रसोई एक ऑर्डर के पूरा होने का इंतज़ार करने में फंसी नहीं रहती है। यह प्रवाह को बनाए रखता है।
  2. यह सस्ता है: आसान ऑर्डर्स पर जल्दी रुककर, आप बहुत सारा "कुकिंग गैस" (कंप्यूटिंग पावर) बचाते हैं।
  3. यह स्मार्ट है: यह हर ग्राहक के ऑर्डर को अद्वितीय मानता है। यह आसान कार्यों पर संसाधन बर्बाद नहीं करता और न ही कठिन कार्यों पर कमी करता है।

"सर्वाइवल" (उत्तरजीविता) सादृश्य

शोधकर्ताओं ने सफलता को मापने के लिए एक मज़ेदार तरीका भी आविष्कार किया जिसे एक्सपेक्टेड सर्वाइवल टाइम (Expected Survival Time) कहा जाता है।
कल्पना कीजिए कि "यूनिफॉर्म एलोकेशन" (पुराना तरीका) एक सैनिक है जिसके पास एक मानक राइफल है।

  • AdaBoN एक सैनिक है जिसके पास एक स्मार्ट स्नाइपर राइफल है।
  • शोधकर्ताओं ने पूछा: "पुराने सैनिक को हमारे स्मार्ट स्नाइपर की तरह बार-बार जीतने के लिए कितनी बड़ी राइफल की आवश्यकता होगी?"
  • उन्होंने पाया कि पुराने सैनिक को AdaBoN की दक्षता के बराबर बने रहने के लिए 20% बड़ी (अधिक महंगी, अधिक ईंधन वाली) राइफल की आवश्यकता थी।

निचोड़ (The Bottom Line)

AdaBoN एक स्मार्ट प्रोजेक्ट मैनेजर को नियुक्त करने जैसा है जो जानता है कि किसी कार्य को कब रोकना है क्योंकि वह पहले ही पूरा हो चुका है, और कब अधिक मेहनत करनी है क्योंकि वह कठिन है। यह आसान समस्याओं पर पैसा बर्बाद करना बंद करता है और अपनी ऊर्जा वहीं केंद्रित करता है जहाँ वास्तव में इसकी आवश्यकता होती है, जिससे AI पहले की तुलना में तेज़, सस्ता और उतना ही (या उससे बेहतर) बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →