← नवीनतम पेपर
🤖 machine learning

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

यह शोध पत्र डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड (Distribution-Aware Reward) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) उद्देश्य है जो निरंतर रैंक की संभाव्यता स्कोर (Continuous Ranked Probability Score) के साथ कई डिकोड किए गए नमूनों का मूल्यांकन करके, बड़े भाषा मॉडलों को प्रतिगमन कार्यों (regression tasks) के लिए कैलिब्रेटेड प्रेडिक्टिव वितरण उत्पन्न करने हेतु अनुकूलित करता है, जिससे पारंपरिक पॉइंट-एस्टीमेट प्रशिक्षण विधियों की तुलना में अनिश्चितता अनुमान, रैंकिंग प्रदर्शन और मजबूती में सुधार होता है।

मूल लेखक: Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड: एलएलएम रिग्रेशन के लिए प्रेडिक्टिव डिस्ट्रीब्यूशन पर रीइन्फोर्समेंट लर्निंग" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: "लोन वुल्फ" बनाम "टीम"

कल्पना कीजिए कि आप बाहर के सटीक तापमान का अनुमान लगाने की कोशिश कर रहे हैं। आपके पास एक बहुत ही स्मार्ट एआई असिस्टेंट (एक लार्ज लैंग्वेज मॉडल, या एलएलएम) है जो मौसम के विवरण को देखकर आपको एक संख्या दे सकता है।

पुराना तरीका (पॉइंटवाइज रिवॉर्ड):
वर्तमान में, अधिकांश एआई ट्रेनिंग एक सख्त शिक्षक की तरह काम करती है जो एक छात्र के एकल उत्तर को ग्रेड देता है।

  • एआई अनुमान लगाता है "72°F"। शिक्षक जाँच करता है: "क्या 72, वास्तविक 70 के करीब है? हाँ। अच्छा काम किया।"
  • एआई अनुमान लगाता है "75°F"। शिक्षक जाँच करता है: "क्या 75, 70 के करीब है? नहीं। बुरा काम किया।"
  • खामी: एआई एक "लोन वुल्फ" (अकेला भेड़िया) बनने की कोशिश करता है। वह हर बार सटीक निशाना लगाने की कोशिश करता है। लेकिन अगर वह गलत होने से डर जाता है, तो वह पूरे साल के औसत तापमान (मान लीजिए 60°F) का अनुमान लगाने लग सकता है। वह सुरक्षित हो जाता है, लेकिन वह अपनी विविधता खो देता है। वह आपको यह नहीं बताता कि वह कितना निश्चित है। यदि वास्तविक तापमान 70 है, और एआई हर बार 60 कहता है, तो तकनीकी रूप से वह औसतन "करीब" तो है, लेकिन वह एक खराब प्रेडिक्टर है क्योंकि उसमें कभी बदलाव नहीं आता।

नया तरीका (डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड):
यह पेपर एक नई विधि पेश करता है जिसे डिस्ट्रीब्यूशन-अवेयर रिवॉर्ड (DAR) कहा जाता है। केवल एक एकल अनुमान पर ग्रेड देने के बजाय, शिक्षक एआई से एक साथ 12 अलग-अलग अनुमान लगाने के लिए कहता है।

  • एआई कहता है: "मुझे लगता है कि यह 68, 69, 70, 71, 72, 73, 74, 75, 76, 77, 78, या 79 हो सकता है।"
  • शिक्षक केवल एक संख्या नहीं देखता। वे अनुमानों के पूरे समूह को देखते हैं।
  • लक्ष्य: शिक्षक चाहता है कि समूह वास्तविक उत्तर (70) के केंद्र में हो, लेकिन इतना फैला हुआ भी हो कि यह दिखाए कि एआई विभिन्न संभावनाओं पर विचार कर रहा है।

मुख्य विचार: "लीव-वन-आउट" स्कोर

शिक्षक कैसे तय करता है कि कौन से अनुमान अच्छे हैं? वे एक चतुर तकनीक का उपयोग करते हैं जिसे लीव-वन-आउट क्रेडिट असाइनमेंट कहा जाता है।

कल्प कल्पना कीजिए कि एआई के 12 अनुमान एक लक्ष्य पर तीर चलाने वाली तीरंदाजों की एक टीम हैं।

  • पुराना तरीका: शिक्षक एक तीरंदाज को चुनता है, देखता है कि क्या उसका तीर निशाने पर लगा, और उसे एक स्कोर देता है। यदि किसी तीरंदाज का तीर थोड़ा दूर चला गया लेकिन उसने टीम को अधिक क्षेत्र कवर करने में मदद की, तो उसे दंडित किया जाता है।
  • नया तरीका (DAR): शिक्षक पूछता है, "यदि हम टीम से इस विशिष्ट तीरंदाज को हटा दें, तो क्या टीम का समग्र प्रदर्शन खराब हो जाएगा?"
    • यदि किसी तीरंदाज को हटाने से टीम का फैलाव बहुत कम या पक्षपाती हो जाता है, तो उस तीरंदाज को उच्च रिवॉर्ड (पुरस्कार) मिलता है, भले ही उसका तीर निशाने के सबसे करीब न रहा हो।
    • यदि किसी को हटाने से कोई फर्क नहीं पड़ता (क्योंकि दूसरा तीरंदाज ठीक उसके बगल में खड़ा है), तो उस तीरंदाज को कम रिवॉर्ड मिलता है क्योंकि वह अनावश्यक (redundant) था।

यह एआई को विविध लेकिन सटीक होना सिखाता है। यह यह कहना सीखता है, "मैं काफी हद तक आश्वस्त हूँ कि यह 70 के आसपास है, लेकिन यह थोड़ा कम या अधिक भी हो सकता है," बजाय इसके कि वह केवल एक संख्या चिल्लाए।

उन्होंने कहाँ परीक्षण किया

शोधकर्ताओं ने इस नए "टीम स्कोरिंग" तरीके का परीक्षण तीन अलग-अलग प्रकार की समस्याओं पर किया:

  1. सिंथेटिक मैथ (ट्रेनिंग जिम): उन्होंने एक नकली गणित की समस्या बनाई जहाँ उत्तर एक जटिल, लहरदार पैटर्न में बदलता है।

    • परिणाम: पुराने तरीकों (सिंगल गेस) ने लहरों को समझने में भ्रमित होकर उन्हें सपाट कर दिया। नए तरीके (टीम गेस) ने लहरदार पैटर्न का पूरी तरह से पालन किया, यहाँ तक कि उन क्षेत्रों में भी जिन्हें उसने पहले नहीं देखा था।
  2. कोड परफॉरमेंस (प्रोग्रामर): उन्होंने एआई से पूछा कि कंप्यूटर कोड का एक टुकड़ा कितनी तेजी से चलेगा या वह कितनी मेमोरी का उपयोग करेगा।

    • परिणाम: नया तरीका रैंकिंग करने में बहुत बेहतर था। यदि आपके पास 100 कोड के टुकड़े हैं और आप जानना चाहते हैं कि कौन से सबसे धीमे हैं, तो नया तरीका उन्हें पुराने तरीकों की तुलना में बहुत बेहतर ढंग से सही क्रम में रख सकता था। इसने केवल औसत गति का अनुमान नहीं लगाया; इसने तेज़ और धीमे कोड के बीच के अंतर को समझा।
  3. मॉलिक्यूलर प्रॉपर्टीज (केमिस्ट): उन्होंने एआई को रासायनिक सूत्र (टेक्स्ट स्ट्रिंग्स के रूप में) दिए और उससे पानी में घुलने की क्षमता जैसी चीजों की भविष्यवाणी करने के लिए कहा।

    • परिणाम: भले ही एआई ने केवल टेक्स्ट देखा (3D रासायनिक मॉडल नहीं), फिर भी इसने विशेष रासायनिक कंप्यूटरों के बराबर या उनसे बेहतर प्रदर्शन किया। यह संभावित मूल्यों की रेंज (सीमा) की भविष्यवाणी करने में बेहतर था, जो वैज्ञानिकों के लिए अत्यंत महत्वपूर्ण है।

यह क्यों मायने रखता है

पेपर का दावा है कि एआई को केवल एक एकल अनुमान की सटीकता के बजाय अपने अनुमानों के आकार (डिस्ट्रीशन) की परवाह करने के लिए प्रशिक्षित करने से, एआई बनता है:

  • रैंकिंग में बेहतर: यह आपको बता सकता है कि कौन सी वस्तु "अधिक संभावित" है।
  • अनिश्चितता में बेहतर: इसे पता होता है कि कब यह अंदाज़ा लगा रहा है और कब यह आश्वस्त है।
  • अधिक मजबूत (Robust): यह हर बार एक ही उबाऊ उत्तर देने के लिए ढह नहीं जाता है।

निचोड़

पुराने तरीके को एक छात्र को परीक्षा के सटीक उत्तर को याद करने के लिए प्रशिक्षित करने के रूप में सोचें। नया तरीका (DAR) छात्र को अवधारणा को इतनी अच्छी तरह से समझने के लिए प्रशिक्षित करता है कि वह संभावित उत्तरों की एक रेंज दे सके, और यह समझा सके कि उत्तर क्यों भिन्न हो सकता है। यह एआई को विज्ञान और इंजीनियरिंग के लिए एक बहुत अधिक विश्वसनीय उपकरण बनाता है, जहाँ केवल संख्या के बजाय "त्रुटि की सीमा" (margin of error) को जानना भी उतना ही महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →