← नवीनतम पेपर
🤖 AI

Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

यह शोध पत्र बेस्ट-ऑफ-बेटर-NN (BoBN) को प्रस्तुत करता है, जो एक इन-कॉन्टेक्स्ट लर्निंग फ्रेमवर्क है जो उच्च-पुरस्कार वाले उदाहरणों को रिट्रीव और रीस्टाइल करके मॉडल के सैंपलिंग डिस्ट्रीब्यूशन को बेहतर प्रतिक्रियाओं की ओर स्थानांतरित करके इन्फरेंस-टाइम अलाइनमेंट में सुधार करता है, जिससे पारंपरिक बेस्ट-ऑफ-NN विधियों की तुलना में कम जनरेटेड उम्मीदवारों के साथ उत्कृष्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Eric Lei, Hsiang Hsu, Chun-Fu Chen

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eric Lei, Hsiang Hsu, Chun-Fu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली लेकिन थोड़ा शरारती शेफ है (रेफरेंस LLM)। यह शेफ खाना बनाने में अविश्वसनीय रूप से कुशल है, लेकिन उसे उस मेनू के लिए विशेष रूप से प्रशिक्षित नहीं किया गया है जिसकी आपको आज रात आवश्यकता है। शायद आपने उससे एक तीखा शाकाहारी (vegan) व्यंजन माँगा है, और वह शेफ बार-बार स्टेक या सादा दलिया परोसता रहता है क्योंकि वही चीजें वह आमतौर पर बनाता है।

AI की दुनिया में, इसे कवरेज प्रॉब्लम (Coverage Problem) कहा जाता है। भले ही आप शेफ से 100 अलग-अलग व्यंजन बनाने के लिए कहें और उनमें से सबसे अच्छा चुनें (एक विधि जिसे Best-of-N कहा जाता है), फिर भी आप अंत में कुछ भी खाने योग्य प्राप्त नहीं कर पाएंगे यदि शेफ ने कभी शाकाहारी व्यंजन बनाने के बारे में सोचा ही नहीं। चयन करने की कोई भी मात्रा काम नहीं आएगी यदि सही उत्तर उस बैच में मौजूद ही नहीं है।

यह पेपर इस समस्या को हल करने के लिए Best-of-Better-N (BoBN) नामक एक नई विधि पेश करता है। इसे ऐसे समझें जैसे कि आप शेफ को खाना बनाना शुरू करने से ठीक पहले एक "चीट शीट" (संकेत पत्र) दे रहे हैं, लेकिन एक विशेष ट्विस्ट के साथ।

समस्या: शेफ का अंधा कोना (Blind Spot)

मानक तरीके (जैसे Best-of-N) इस तरह काम करते हैं:

  1. शेफ को 10 भोजन बनाने के लिए कहें।
  2. उन सभी को चखें।
  3. सबसे अच्छा वाला चुनें।

खामी: यदि शेफ को कभी शाकाहारी भोजन बनाना नहीं सिखाया गया है, तो सभी 10 भोजन मांस-आधारित होंगे। आप एक शाकाहारी भोजन नहीं चुन सकते यदि वह बैच में मौजूद ही नहीं है। शेफ का "अंधा कोना" बहुत बड़ा है।

समाधान: Best-of-Better-N (BoBN)

BoBN गेम बदल देता है क्योंकि यह इन-कॉन्टेक्स्ट लर्निंग (शेफ को उदाहरण देना) को एक रीस्टाइलिंग (Restyling) चरण के साथ जोड़ता है। हमारे किचन एनालॉजी (रसोई के उदाहरण) का उपयोग करके यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

1. स्मार्ट सर्च (रिट्रीवल/प्राप्ति)

केवल शेफ को रैंडम रेसिपी देने के बजाय, BoBN पिछले सफल व्यंजनों के पुस्तकालय (library) को देखता है। यह उन शीर्ष K रेसिपीज़ को खोजता है जो आज रात आपके द्वारा ऑर्डर किए गए भोजन के सबसे समान हैं।

  • उदाहरण: यदि आपने तीखा शाकाहारी करी माँगी है, तो सिस्टम तीखी शाकाहारी करी के 8 पिछले उदाहरण खोजता जिन्हें बहुत उच्च रेटिंग मिली थी।

2. "रीस्टाइलिंग" चरण (सीक्रेट सॉस)

यही इस पेपर का अनूठा नवाचार है। रिट्राईव की गई रेसिपीज़ का स्टाइल, फॉर्मेट या टोन आपके द्वारा आवश्यक चीज़ से अलग हो सकता है। हो सकता है कि पुरानी रेसिपीज़ वैज्ञानिक पेपर की तरह लिखी गई हों, लेकिन आप एक दोस्ताना बातचीत चाहते हों।

  • जादू: इन रेसिपीज़ को अपने शेफ को दिखाने से पहले, शेफ स्वयं उन्हें फिर से लिखता है। वे रिट्राव की गई रेसिपीज़ के विचारों को लेते हैं लेकिन उन्हें आपके विशिष्ट अनुरोध के स्टाइल, फॉर्मेट और टोन के अनुरूप फिर से लिखते हैं।
  • यह क्यों मायने रखता है: यह सुनिश्चित करता है कि शेफ अच्छे उत्तर के तर्क (logic) को समझता है, लेकिन उसे आपके विशिष्ट प्रतिबंधों (जैसे JSON फॉर्मेट या विनम्रता से मना करना) के अनुकूल प्रस्तुत करता है।

3. नया कुकिंग सेशन

अब, आप शेफ को प्रॉम्प्ट और ये 8 "रीस्टाइल की गई" उदाहरण देते हैं।

  • क्योंकि शेफ उन रीस्टाइल किए गए उदाहरणों को देखता है जो बिल्कुल वैसा ही है जैसा आप चाहते हैं, इसकी बहुत अधिक संभावना है कि वह इस बार शाकाहारी व्यंजन बनाएगा।
  • "अंधा कोना" भर जाता है। शेफ का आउटपुट डिस्ट्रीब्यूशन "ज्यादातर मांस" से बदलकर "ज्यादातर शाकाहारी" हो जाता है।

4. अंतिम चयन (Best-of-N)

अब, आप शेफ को फिर से 10 भोजन बनाने के लिए कहते हैं। क्योंकि शेफ को रीस्टाइल किए गए उदाहरणों द्वारा निर्देशित किया गया था, इसलिए सभी 10 भोजन संभवतः शाकाहारी होंगे। इसके बाद आप सबसे अच्छा वाला चुनते हैं।

  • परिणाम: आपको बहुत तेज़ी से उच्च-गुणवत्ता वाला उत्तर मिलता है, अक्सर आपको कम प्रयासों (एक छोटे "N") की आवश्यकता होती है।

इस पेपर ने क्या पाया

लेखकों ने दो मुख्य कार्यों पर इसका परीक्षण किया:

  1. सुरक्षा (Safety): मॉडल को हानिकारक अनुरोधों (जैसे "मैं बम कैसे बनाऊं?") को अस्वीकार करने के लिए सिखाना। एक मॉडल जिसे सुरक्षा के लिए प्रशिक्षित नहीं किया गया है, वह आमतौर पर "ज़रूर!" कहता है। BoBN ने इसे सुरक्षित इनकार के रीस्टाइल किए गए उदाहरण दिखाकर "नहीं" कहना सीखने में मदद की।
  2. गणित (Math): जटिल गणितीय समस्याओं को हल करना। BoBN ने मॉडल्स को सही तर्क चरणों को खोजने में मदद की, उन्हें सही गणितीय समाधानों के रीस्टाइल किए गए उदाहरण दिखाकर।

मुख्य निष्कर्ष:

  • बेहतर कवरेज: BoBN मॉडल को उच्च-गुणवत्ता वाले उत्तर उत्पन्न करने के लिए अधिक सक्षम बनाता है, भले ही मॉडल को मूल रूप से उस विशिष्ट कार्य के लिए प्रशिक्षित न किया गया हो।
  • दक्षता (Efficiency): आपको एक अच्छा उत्तर खोजने के लिए उतने उत्तर उत्पन्न करने की आवश्यकता नहीं है।
  • प्रशिक्षण की आवश्यकता नहीं: यह "इन्फरेंस टाइम" (जब आप प्रश्न पूछते हैं) पर तुरंत होता है। आपको मॉडल को फिर से प्रशिक्षित करने या उसके आंतरिक मस्तिष्क भार (weights) को बदलने की आवश्यकता नहीं है। आप बस चलते समय (on the fly) उसे बेहतर उदाहरण देते हैं।

संक्षेप में

यदि Best-of-N एक शेफ को 100 बार रेसिपी का अनुमान लगाने के लिए कहने और उम्मीद करने जैसा है कि एक सही होगी, तो Best-of-Better-N शेफ को खाना शुरू करने से ठीक पहले उसी सटीक रेसिपी के परफेक्टली रीरिटन (पुनर्लिखित) उदाहरणों का एक ढेर थमाने जैसा है। यह शेफ की अंतर्दृष्टि को निर्देशित करता है ताकि "अच्छे" उत्तर वास्तव में शुरुआत से ही बर्तन में मौजूद हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →