Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models
यह शोध पत्र यह प्रदर्शित करता है कि सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना (Reinforcement Learning with Verifiable Rewards - RLVR), जो मॉडलों को अनिश्चित प्रश्नों का उत्तर देने से बचने के लिए स्पष्ट रूप से प्रोत्साहित करता है, तथ्यात्मक बेंचमार्क पर सटीकता से समझौता किए बिना बड़े भाषा मॉडलों में मतिभ्रम (hallucinations) को प्रभावी रूप से कम करता है और बौद्धिक विनम्रता में सुधार करता है।