GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis
यह शोध पत्र GREAT प्रस्तुत करता है, जो एक नवीन ढांचा है जो RLHF मॉडलों में सामान्यीकरण योग्य बैकडोर हमलों को निष्पादित करने के लिए लेटेंट स्पेस क्लस्टरिंग और क्रोधित प्रॉम्प्ट्स के एक क्यूरेटेड डेटासेट के माध्यम से स्वाभाविक, भावना-जागरूक ट्रिगर्स को संश्लेषित करता है, जिससे वे विशिष्ट उपयोगकर्ता उपसमूहों के लिए हानिकारक प्रतिक्रियाएं उत्पन्न करते हैं जबकि गोपनीयता और उपयोगिता बनाए रखते हैं।