Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs
यह शोध पत्र एडवर्सरियल प्रॉम्प्ट डिस्टिलेशन (APD) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो नॉलेज डिस्टिलेशन और रिइन्फोर्समेंट लर्निंग के माध्यम से बड़े भाषा मॉडलों से छोटे भाषा मॉडलों में जेलब्रेकिंग क्षमताओं को स्थानांतरित करता है, जिससे काफी बेहतर दक्षता और कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक अटैक सक्सेस रेट्स प्राप्त होते हैं।