CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
यह शोधपत्र CARE-RFT को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण फाइनट्यूनिंग (reinforcement finetuning) विधि है जो तर्क क्षमता (reasoning performance) और मॉडल की विश्वसनीयता (trustworthiness) के बीच के संतुलन को हल करने के लिए स्क्यू रिवर्स KL डाइवर्जेंस (skew reverse KL divergence) का उपयोग करती है, जिससे अनियंत्रित RFT की उच्च तर्क क्षमताओं को प्राप्त करते हुए बेस मॉडल के अंशांकन (calibration) और विश्वसनीयता को बनाए रखा जा सकता है।