Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases
यह शोध पत्र आठ मल्टीमॉडल एलएलएम (LLMs) के दो-चरणीय अनुदैर्ध्य मूल्यांकन को प्रस्तुत करता है, जो मॉडल परिवारों के बीच सुरक्षा में महत्वपूर्ण और निरंतर असमानताओं, कुछ उत्तराधिकारियों में बढ़ती हमले की सफलता दरों के साथ संरेखण विचलन (alignment drift) के प्रमाण, और बदलती मोडैलिटी-विशिष्ट कमजोरियों को प्रकट करता है जो निरंतर, मल्टीमॉडल सुरक्षा बेंचमार्क की आवश्यकता को रेखांकित करते हैं।