SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
यह शोध पत्र SARSteer को प्रस्तुत करता है, जो लार्ज ऑडियो-लैंग्वेज मॉडल्स के लिए पहला इन्फरेंस-टाइम डिफेंस फ्रेमवर्क है जो टेक्स्ट-व्युत्पन्न रिफ्यूसल स्टीयरिंग को डीकंपोज्ड सेफ-स्पेस एब्लेशन के साथ जोड़ता है ताकि हानिकर ऑडियो-प्रेरित प्रतिक्रियाओं को प्रभावी ढंग से कम किया जा सके और सौहार्दपूर्ण प्रश्नों पर ओवर-रिफ्यूजल से बचा जा सके।