← नवीनतम पेपर
🤖 machine learning

Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models

यह शोध पत्र एक मल्टी-आंसर रीइन्फोर्समेंट लर्निंग दृष्टिकोण प्रस्तुत करता है जो भाषा मॉडलों को एक ही फॉरवर्ड पास में आत्मविश्वास अनुमानों के साथ कई संभावित परिकल्पनाओं को उत्पन्न करने के लिए प्रशिक्षित करता है, जो विविध बेंचमार्क में विविधता, अंशांकन (कैलिब्रेशन) और सटीकता में सुधार करते हुए इन्फरेंस-टाइम स्केलिंग विधियों के लिए एक कंप्यूट-कुशल विकल्प प्रदान करता है।

मूल लेखक: Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो किसी रहस्य को सुलझाने की कोशिश कर रहे हैं। पुराने दिनों में, आपको एक संदिग्ध को खोजने के लिए प्रशिक्षित किया जाता था, वह व्यक्ति जो सबसे अधिक दोषी दिखता था, और आपको तुरंत उसकी ओर उंगली उठानी होती थी। यदि आप गलत होते, तो आप असफल हो जाते। यह अधिकांश वर्तमान AI मॉडल (लार्ज लैंग्वेज मॉडल्स) के काम करने का तरीका है। उन्हें आपको वह एक "सर्वश्रेष्ठ" उत्तर देने के लिए प्रशिक्षित किया जाता है जो वे सोच सकते हैं।

लेकिन वास्तविक जीवन एक सरल रहस्य नहीं है जिसमें केवल एक ही अपराधी हो। कभी-कभी, एक मरीज के लक्षण तीन अलग-अलग बीमारियों के संकेत हो सकते हैं। कभी-कभी, एक कोडिंग समस्या को पांच अलग-अलग तरीकों से हल किया जा सकता है। कभी-कभी, जानकारी गायब होती है, और आप निश्चित रूप से नहीं जानते।

यह शोध पत्र AI को प्रशिक्षित करने का एक नया तरीका पेश करता है जिसे मल्टी-आंसर रीइन्फोर्समेंट लर्निंग (Multi-Answer Reinforcement Learning) कहा जाता है। AI को केवल एक संदिग्ध चुनने के बजाय, उसे एक बुद्धिमान सलाहकार की तरह कार्य करने के लिए प्रशिक्षित करता है जो कहता है, "यहाँ शीर्ष तीन संदिग्ध हैं, और मुझे प्रत्येक के बारे में कितनी संभावना लगती है।"

यहाँ शोध पत्र के विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "एकल-उत्तर" का जाल (The "Single-Answer" Trap)

कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। शिक्षक उससे कहते हैं, "मुझे केवल एक उत्तर दो, अन्यथा तुम्हें शून्य अंक मिलेंगे।"

  • परिणाम: छात्र घबरा जाता है। वह अन्य संभावनाओं के बारे में सोचना बंद कर देता है। वह जो पहला उत्तर उसके दिमाग में आता है उसे चुन लेता है और उसी पर टिका रहता है, भले ही उसे 50% यकीन हो कि वह गलत है।
  • AI में: इसे "मोड कोलैप्स" (mode collapse) कहा जाता है। AI एक सही उत्तर देने में इतना कुशल हो जाता है कि वह अन्य वैध उत्तरों को खोजना भूल जाता है। यदि एक डॉक्टर पूछता है, "इस मरीज को क्या हो सकता है?", तो AI केवल कह सकता है "फ्लू," यह नजरअंदाज करते हुए कि यह निमोनिया या एलर्जी भी हो सकता है।

2. समाधान: "ब्रेनस्टॉर्मिंग सत्र" (The "Brainstorming Session")

लेखक AI को बोलने से पहले अपने स्वयं के मस्तिष्क के भीतर एक ब्रेनस्टॉर्मिंग सत्र आयोजित करने के लिए प्रस्तावित करते हैं।

  • पुराना तरीका: AI सोचता है, "मुझे लगता है कि यह X है," और कहता है "X।"
  • नया तरीका (Multi-Answer RL): AI सोचता है, "यह X हो सकता है (50% संभावना), Y (30% संभावना), या Z (20% संभावना)।" इसके बाद वह एक ही बार में अपने आत्मविश्वास के स्तर के साथ तीनों को लिख देता है।

इसे एक मौसम पूर्वानुमानकर्ता की तरह समझें।

  • पुराना AI: "कल बारिश होगी।" (यदि नहीं हुई, तो AI मूर्ख दिखता है)।
  • नया AI: "बारिश की 60% संभावना है, बादलों की 30% संभावना है, और धूप की 10% संभावना है।" यह आपके दिन की योजना बनाने के लिए बहुत अधिक उपयोगी है, भले ही बारिश हो जाए।

3. उन्होंने इसे कैसे किया: "समूह पुरस्कार" (The "Group Reward")

AI को इस नए कौशल को सिखाने के लिए, शोधकर्ताओं ने उस "स्कोरकार्ड" (पुरस्कार प्रणाली) को बदल दिया जिसका उपयोग वे मॉडल को प्रशिक्षित करने के लिए करते हैं।

  • पुराना स्कोरकार्ड: "यदि आपका एकल उत्तर सही है तो आपको 1 अंक मिलता है। यदि गलत है तो 0 अंक।"
  • नया स्कोरकार्ड: "आप अपने द्वारा सूचीबद्ध किए गए प्रत्येक सही उत्तर के लिए अंक प्राप्त करते हैं। यदि आप 3 संभावनाएं सूचीबद्ध करते हैं और 2 सही हैं, तो आपको 2 अंक मिलते हैं!"
  • बोनस: उन्होंने AI को अनिश्चितता के बारे में ईमानदार होने के लिए भी अंक दिए। यदि AI कहता है "मैं इस बारे में 50% आश्वस्त हूँ," और यह वास्तव में एक सिक्के के उछाल (coin flip) जैसा निकलता है, तो उसे अपने स्वयं के आत्मविश्वास के बारे में सटीक होने के लिए बोनस मिलता है।

4. यह एक बड़ी बात क्यों है (The "Magic" Benefits)

अ. यह संदिग्ध स्थितियों में स्मार्ट है

चिकित्सा जैसे क्षेत्रों में, एक मरीज के लक्षण तीन अलग-अलग बीमारियों के हो सकते हैं। एक मानक AI एक का अनुमान लगा सकता है और दूसरों को छोड़ सकता है। नया AI तीनों को सूचीबद्ध करता है।

  • उपमा: यदि आप एक डॉक्टर हैं, तो आप एक ऐसे रोबोट नहीं चाहते जो कहता है, "यह निश्चित रूप से फ्लू है।" आप एक ऐसा रोबोट चाहते हैं जो कहता है, "यह फ्लू होने की संभावना है, लेकिन यह निमोनिया भी हो सकता है, इसलिए सुनिश्चित करने के लिए आइए एक परीक्षण करें।"

ब. यह समय और पैसा बचाता है (दक्षता)

आमतौर पर, AI से आपको 3 अलग-अलग उत्तर प्राप्त करने के लिए, आपको उससे एक ही प्रश्न 3 बार पूछना पड़ता है (जैसे किसी मित्र से सलाह के लिए तीन बार पूछना और उम्मीद करना कि वे आपको अलग-अलग विचार दें)। यह धीमा और महंगा है।

  • नया तरीका: AI एक ही एकल वाक्य में सभी 3 उत्तर उत्पन्न करता है।
  • उपमा: तीन अलग-अलग विशेषज्ञों को कॉल करने और तीन अलग-अलग फोन कॉल का इंतजार करने के बजाय, आप एक कमरे में प्रवेश करते हैं जहाँ तीन विशेषज्ञ एक मेज पर बैठे हैं, और वे सभी एक साथ बोलते हैं। आप आधे समय में समान मात्रा में जानकारी प्राप्त करते हैं।

स. यह अधिक ईमानदार है

नया AI यह जानने में बेहतर है कि वह क्या नहीं जानता। यह आत्मविश्वास से गलत अनुमान लगाने के बजाय यह कहना सीखता है, "मैं इस बारे में बहुत आश्वस्त नहीं हूँ।" यह कानून या चिकित्सा जैसे उच्च-दांव वाले कार्यों के लिए अत्यंत महत्वपूर्ण है।

सारांश

यह शोध पत्र AI को एक सब कुछ जानने वाले की तरह व्यवहार करने के बजाय—जो एक उत्तर चुनता है और एक विचारशील विशेषज्ञ की तरह व्यवहार करने के लिए है—जो कई संभावनाओं पर विचार करता है, उन्हें संभावना के आधार पर रैंक करता है, और जब वह अनिश्चित होता है तो स्वीकार करता है।

ऐसा करके, AI एक ही चरण में:

  1. अधिक विविध (यह अधिक समाधान खोजता है) बनता है।
  2. अधिक सटीक (यह अधिक आधारों को कवर करता है) बनता है।
  3. अधिक कुशल (यह इसे तेजी से करता है) बनता है।
  4. अधिक विश्वसनीय (यह आपको बताता है कि वह कितना आश्वस्त है) बनता है।

यह "उत्तर क्या है?" से बदलकर "संभावित उत्तर क्या हैं, और उनकी संभावना कितनी है?" की ओर एक बदलाव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →