EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models
यह शोध पत्र EvidenceRL को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो लार्ज लैंग्वेज मॉडल्स में साक्ष्य अनुपालन (evidence adherence) को लागू करने के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन का उपयोग करता है, जो कार्य सटीकता से समझौता किए बिना कार्डिएक डायग्नोसिस और कानूनी तर्क जैसे उच्च-जोखिम वाले डोमेन में मतिभ्रम (hallucinations) को काफी कम करता है और ग्राउंडिंग एवं निष्ठा (faithfulness) में सुधार करता है।