SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
SAIL-RL एक दोहरा-पुरस्कार (dual-reward) सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को अनुकूल रूप से यह सिखाकर उन्हें कब गहन तर्क (deep reasoning) करना है बनाम कब सीधा उत्तर देना है, उन्हें बेहतर बनाता है, जिससे तर्क की सटीकता में सुधार होता है, मतिभ्रम (hallucinations) कम होता है, और शीर्ष-स्तरीय वाणिज्यिक मॉडलों के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।