Exploring and Developing a Pre-Model Safeguard with Draft Models
यह शोध पत्र एक प्री-मॉडल सेफगार्ड का प्रस्ताव करता है जो ड्राफ्ट रिस्पॉन्स जनरेट करने के लिए बड़े लैंग्वेज मॉडल्स से छोटे ड्राफ्ट मॉडल्स में जेलब्रेक हमलों की ट्रांसफरेबिलिटी का लाभ उठाता है, जिससे मौजूदा गार्ड्स को पोस्ट-मॉडल ऑडिटिंग की उच्च कम्प्यूटेशनल लागतों से बचते हुए, टारगेट मॉडल इन्फरेंस से पहले असुरक्षित प्रॉम्प्ट्स को अधिक सटीकता से पहचानने में सक्षम बनाया जा सके।