← नवीनतम पेपर
💬 NLP

Process Rewards with Learned Reliability

यह शोधपत्र BetaPRM को प्रस्तुत करता है, जो एक वितरण संबंधी प्रोसेस रिवॉर्ड मॉडल (distributional Process Reward Model) है जो स्टेप-लेवल सफलता की संभावनाओं और उनकी विश्वसनीयता दोनों का पूर्वानुमान लगाता है ताकि एडेप्टिव कंप्यूटेशन एलोकेशन (Adaptive Computation Allocation) को सक्षम बनाया जा सके, जो भविष्यवाणी के आत्मविश्वास के आधार पर गणना को गतिशील रूप से समायोजित करके बेस्ट-ऑफ-एन (Best-of-N) रीजनिंग में सटीकता-टोकन ट्रेडऑफ़ में महत्वपूर्ण सुधार करता है।

मूल लेखक: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र के लंबे, बहु-चरणीय गणितीय निबंध को ग्रेड दे रहे हैं। आप केवल अंतिम उत्तर पर ही नहीं, बल्कि हर एक चरण पर फीडबैक देना चाहते हैं। AI के लिए यही प्रोसेस रिवॉर्ड मॉडल्स (PRMs) करते हैं: वे एक चरण-दर-चरण कोच की तरह कार्य करते हैं, जो AI को बताते हैं, "चरण 1 में अच्छा काम किया," या "चरण 2 में यह गलत लग रहा है।"

हालाँकि, यह शोध पत्र बताता है कि वर्तमान में इन कोचों के काम करने के तरीके में एक दोष है। वे एक एकल संख्या (जैसे, 8/10 का स्कोर) देते हैं और ऐसा व्यवहार करते हैं जैसे वह संख्या 100% निश्चित हो। लेकिन वास्तव में, कोच अनुमान लगा रहा हो सकता है। यदि AI एक अजीब रास्ता अपनाता है जो ठीक लग सकता है लेकिन अंततः गलत साबित हो सकता है, तो पुराना कोच अभी भी उसे उच्च स्कोर देता है, और AI आँख मूंदकर उस पर भरोसा करता है।

लेखक एक नया कोच प्रस्तावित करते हैं जिसे BETAPRM कहा जाता है जो केवल एक स्कोर नहीं देता; यह एक स्कोर और एक विश्वास स्तर (confidence level) देता है।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "अनुमान लगाने वाला" कोच

कल्पना कीजिए कि आप एक सिक्के के उछाल के हेड (heads) आने की भविष्यवाणी करने की कोशिश कर रहे हैं।

  • पुरानी विधि (Standard PRM): आप सिक्का 8 बार उछालते हैं, और यह 5 बार हेड आता है। पुराना कोच कहता है, "प्रायिकता (probability) ठीक 62.5% है।" यह इस छोटे से नमूने को एक पूर्ण, अपरिवर्तनीय तथ्य के रूप में मानता है।
  • समस्या: यदि आप सिक्के को फिर से 8 बार उछालते हैं, तो आपको 4 हेड या 6 हेड मिल सकते हैं। पुराना कोच यह नहीं जानता। यह "62.5%" को एक कठोर तथ्य के रूप में मानता है, भले ही यह एक बहुत छोटे और शोर वाले नमूने पर आधारित हो। यह AI को अनिश्चित स्थितियों में अत्यधिक आत्मविश्वासी बना देता है।

2. समाधान: "ईमानदार" कोच (BETAPRM)

BETAPRM खेल बदल देता है। केवल एक संख्या देने के बजाय, यह संभावनाओं की एक सीमा (range) देता है और आपको बताता है कि वह उस सीमा के बारे में कितना आश्वस्त है।

  • उपमा: कल्पना कीजिए कि कोच एक रबर बैंड पकड़े हुए है।
    • बैंड का केंद्र: यह अनुमानित स्कोर है (जैसे, "यह चरण 70% सही होने की संभावना है")।
    • बैंड का कसाव (Tightness): यह विश्वसनीयता (reliability) है।
      • कसा हुआ बैंड (उच्च विश्वास): कोच बहुत आश्वस्त है। रबर बैंड 70% के निशान के चारों ओर कसकर खिंचा हुआ है। यदि आप सिक्का फिर से उछालते हैं, तो यह संभवतः 70% के पास ही रहेगा।
      • ढीला बैंड (कम विश्वास): कोच अनिश्चित है। रबर बैंड चौड़ा होकर फैला हुआ है, जो 40% से 90% तक सब कुछ कवर कर रहा है। कोच कह रहा है, "मुझे लगता है कि यह 70% है, लेकिन मैं बहुत गलत भी हो सकता हूँ।"

इस "कसाव" (जिसे पेपर में concentration कहा गया है) को सीखकर, मॉडल यह कहना सीख जाता है, "मैं इस चरण के प्रति आश्वस्त हूँ," या "मैं यहाँ केवल अनुमान लगा रहा हूँ, इसलिए मुझ पर बहुत अधिक भरोसा न करें।"

3. यह कैसे सीखता है: "मोंटे कार्लो" प्रशिक्षण

कोच ईमानदार होना कैसे सीखता है?

  • पेपर मोंटे कार्लो कंटीन्यूएशन (Monte Carlo continuations) नामक एक विधि का उपयोग करता है। कल्पना कीजिए कि AI एक समस्या को हल करने की कोशिश करता है, चरण 3 पर रुकता है, और फिर उसी बिंदु से समस्या को 16 अलग-अलग तरीकों से पूरा करने की कोशिश करता है।
  • उन 16 प्रयासों में से कुछ सफल होते हैं; कुछ विफल होते हैं।
  • पुराना कोच: उन 16 प्रयासों को देखता है, सफलताओं को गिनता है (मान लीजिए 10), और उसे "10/16 = 0.625" के रूप में याद कर लेता है।
  • BETAPROM: उन 16 प्रयासों को देखता है और सोचता है, "ठीक है, मैंने 10 सफलताएँ देखीं। यह एक अच्छा संकेत है, लेकिन क्योंकि मैंने केवल 16 प्रयास देखे हैं, इसमें बहुत अधिक अनिश्चितता (randomness) है। मुझे इस शोर को ध्यान में रखते हुए अपने रबर बैंड को ढीला रखना चाहिए।"

यह स्कोर और अनिश्चितता के बीच इस संतुलन को सीखने के लिए बीटा-बाइनोमियल (Beta-Binomial) वितरण नामक एक गणितीय उपकरण का उपयोग करता है।

4. सुपरपावर: एडेप्टिव कंप्यूटेशन (ACA)

पेपर इस "ईमानदार कोच" का उपयोग करने का एक नया तरीका पेश करता है जिसे एडैप्टिव कंप्यूटेशन एलोकेशन (ACA) कहा जाता है।

इसे एक रोड ट्रिप के बजट की तरह समझें। आपके पास सबसे अच्छा रास्ता खोजने के लिए गैस (या धन) की एक निश्चित मात्रा है।

  • पुरानी विधि (निश्चित बजट): आप 16 अलग-अलग कारें भेजते हैं ताकि सबसे अच्छा रास्ता खोजा जा सके, चाहे जो भी हो। भले ही कार नंबर 1 पहले मील के बाद ही स्पष्ट रूप से विजेता हो, आप फिर भी अन्य 15 कारों को भेज देते हैं ताकि सुरक्षित रहा जा सके। यह गैस बर्बाद करता है।
  • नई विधि (ACA):
    1. आप कारों का एक छोटा समूह भेजते हैं (मान लीजिए 4)।
    2. आप "ईमानदार कोच" (BETAPRM) की जाँच करते हैं।
    3. परिदृश्य A (उच्च विश्वास): कोच कहता है, "कार नंबर 1 विजेता है, और मैं बहुत आश्वस्त (tight rubber band) हूँ कि कोई अन्य कार इसे मात नहीं दे सकती।"
      • कार्रवाई: तुरंत रुकें! गैस बचाएं। आपको अन्य 12 कारें भेजने की आवश्यकता नहीं है।
    4. परिदृश्य B (कम विश्वास): कोच कहता है, "कार नंबर 1 अच्छी दिख रही है, लेकिन मेरा रबर बैंड ढीला है। मुझे यकीन नहीं है कि कार नंबर 2 या 3 वास्तव में बेहतर हो सकती है।"
      • कार्रवाई: रुकें नहीं। अनिश्चित रास्तों को खोजने के लिए और अधिक कारें भेजें।

परिणाम

पेपर ने चार अलग-अलग AI मॉडलों और चार गणितीय बेंचमार्क पर इसका परीक्षण किया।

  • बेहतर चयन: "टाइट रबर बैंड" वाले स्कोर पर अधिक भरोसा करके, AI ने पुरानी विधि की तुलना में सही उत्तर अधिक बार चुने।
  • गैस की बचत: नई विधि (ACA) ने समस्याओं को हल करने के लिए आवश्यक कंप्यूटर पावर (टोकन) को 33.57% तक बचाया। इसने उन समस्याओं पर समय बर्बाद करना बंद कर दिया जहाँ उत्तर पहले से ही स्पष्ट था, और केवल कठिन, अनिश्चित समस्याओं पर ही अपना दिमाग लगाया।

सारांश

BETAPOTM एक स्मार्ट कोच है जो केवल ग्रेड नहीं देता; यह बताता है कि उस ग्रेड पर कितना भरोसा किया जा सकता है। यह जानकर कि वह कब अनुमान लगा रहा है, AI आसान समस्याओं पर ऊर्जा बर्बाद करना बंद कर सकता है और अपनी पूरी मानसिक शक्ति केवल कठिन, अनिश्चित समस्याओं पर केंद्रित कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →