Breaking Refusal in the First Half: A Mechanistic Study of the Prefill Jailbreak
यह अध्ययन प्रकट करता है कि प्रीफिल-आधारित जेलब्रेक सुरक्षा को एक उथले, रिस्पॉन्स-साइट कंप्यूटेशन का लाभ उठाकर दरकिनार कर देते हैं जहाँ मॉडल का हानिकारक निरंतरता (continuation) मुख्य रूप से प्रारंभिक "Sure, here is" प्रॉम्प्ट पर निष्क्रिय ऑटो-रिग्रेसिव कंडीशनिंग द्वारा संचालित होता है, न कि एक अक्षुण्ण हानि प्रतिनिधित्व (harm representation) के दमन द्वारा।