Process Rewards with Learned Reliability
यह शोधपत्र BetaPRM को प्रस्तुत करता है, जो एक वितरण संबंधी प्रोसेस रिवॉर्ड मॉडल (distributional Process Reward Model) है जो स्टेप-लेवल सफलता की संभावनाओं और उनकी विश्वसनीयता दोनों का पूर्वानुमान लगाता है ताकि एडेप्टिव कंप्यूटेशन एलोकेशन (Adaptive Computation Allocation) को सक्षम बनाया जा सके, जो भविष्यवाणी के आत्मविश्वास के आधार पर गणना को गतिशील रूप से समायोजित करके बेस्ट-ऑफ-एन (Best-of-N) रीजनिंग में सटीकता-टोकन ट्रेडऑफ़ में महत्वपूर्ण सुधार करता है।