Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
यह शोध पत्र RLCR (कैलिब्रेशन रिवॉर्ड्स के साथ सुदृढीकरण सीखना) प्रस्तुत करता है, जो एक नवीन प्रशिक्षण दृष्टिकोण है जो बाइनरी शुद्धता पुरस्कारों को ब्रियर स्कोर (Brier score) के साथ जोड़कर भाषा मॉडलों की सटीकता और कैलिब्रेटेड आत्मविश्वास दोनों में सुधार करता है, जिससे मानक सुदृढीकरण सीखने के कारण होने वाले मतिभ्रम (hallucination) और कैलिब्रेशन क्षरण को कम किया जा सके।