Jailbreaking Frontier Foundation Models Through Intention Deception
यह शोध पत्र एक नवीन मल्टी-टर्न जेलब्रेकिंग तकनीक प्रस्तुत करता है जो फ्रंटियर मॉडल्स के "सेफ कंप्लीशन" प्रतिमान का लाभ उठाते हुए उन्हें हानिरहित दिखने वाले इरादों से धोखे में डालकर हानिकारक आउटपुट उत्पन्न करता है, साथ ही "पारा-जेलब्रेकिंग" नामक एक नव-खोजे गए भेद्यता वर्ग की पहचान और समाधान भी करता है।