RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning
यह शोध पत्र RIFT को प्रस्तुत करता है, जो एक डेटा-कुशल ढांचा है जो रिवॉर्ड-इन्फॉर्म्ड लॉस रीवेटिंग और एक स्थिर फॉर्मूलेशन के माध्यम से स्वयं-निर्मित नकारात्मक नमूनों का पुनरुद्देश्य बनाकर LLM अलाइनमेंट में सुधार करता है, और गणितीय बेंचमार्क पर मानक रिजेक्शन सैंपलिंग फाइन-ट्यूनिंग से लगातार बेहतर प्रदर्शन करता है।