When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers
यह शोध पत्र प्रकट करता है कि कॉन्सेप्ट बॉटलनेक मॉडल्स (CBMs) में एक महत्वपूर्ण भेद्यता है जहाँ न्यूनतम इनपुट व्यवधान उनके सिमेंटिक कॉन्सेप्ट लेयर्स को विनाशकारी रूप से हेरफेर कर सकते हैं, और SPECTRA का प्रस्ताव करता है, जो एक नई रक्षा पद्धति है जो वर्गीकरण सटीकता को बनाए रखते हुए हमले की कठिनाई को नाटकीय रूप से बढ़ा देती है।