Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
यह शोध पत्र मल्टी-इमेज सेफ्टी (MIS) डेटासेट को पेश करके विजन-लैंग्वेज मॉडल्स में सुरक्षा तर्क अंतराल (safety reasoning gap) को संबोधित करता है, जो सामान्य मॉडल क्षमताओं को संरक्षित करते हुए दृश्य तर्क क्षमताओं और सुरक्षा प्रदर्शन को महत्वपूर्ण रूप से बढ़ाने के लिए मल्टी-इमेज इनपुट को सेफ्टी चेन-ऑफ-थॉट लेबल के साथ एकीकृत करता है।