Cross-Lingual Jailbreak Detection via Semantic Codebooks
यह शोध पत्र एक प्रशिक्षण-मुक्त, भाषा-निरपेक्ष जेलब्रेक डिटेक्शन विधि प्रस्तावित करता है जो बहुभाषी क्वेरी एम्बेडिंग्स की तुलना दुर्भावनापूर्ण प्रॉम्प्ट्स के एक निश्चित अंग्रेजी कोडबुक से करता है, और यह प्रदर्शित करता है कि जबकि सिमेंटिक समानता विभिन्न भाषाओं में कैनोनिकल टेम्पलेट्स पर हमलों को प्रभावी ढंग से कम करती है, विविध और विषम असुरक्षित व्यवहारों से जुड़े वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के तहत इसका प्रदर्शन काफी घट जाता है।