The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails
यह शोध पत्र "अनसेफ इंडक्शन अटैक्स" (Unsafe Induction Attacks) और संबंधित "अनसेफ सिमेंटिक डिस्टिलेशन" (Unsafe Semantic Semantic Distillation) पद्धति को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि कैसे अदृश्य रूप से विचलित (imperceptibly perturbed) सुरक्षित छवियों का उपयोग मल्टीमॉडल गार्ड मॉडल्स में गलत सकारात्मक अस्वीकारियों (false positive rejections) को ट्रिगर करने के लिए किया जा सकता है, जिससे एक महत्वपूर्ण उपलब्धता भेद्यता (availability vulnerability) उजागर होती है जो सेवा विश्वसनीयता को कम करती है और उपयोगकर्ता के विश्वास को क्षीण करती है।