From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation
यह शोध पत्र CARE-PPO को प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम (reinforcement learning) ढांचा है जो भाषा-आधारित मात्रात्मक भविष्यवाणियों और उनकी विश्वसनीयता को संयुक्त रूप से अनुकूलित करने के लिए कॉन्फिडेंस-अलाइन्ड रिवॉर्ड (Confidence-Aligned Reward) का लाभ उठाता है, जिसमें PPO क्रिटिक को एक मजबूत कॉन्फिडेंस एस्टीमेटर के रूप में पुन: उपयोग किया गया है, जिससे यह स्वास्थ्य सेवा और वित्त डोमेन में सटीकता और अनिश्चितता अंशांकन (uncertainty calibration) में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।