SecureBreak -- A dataset towards safe and secure models
यह शोध पत्र SecureBreak को प्रस्तुत करता है, जो एक मैन्युअल रूप से एनोटेट किया गया डेटासेट है जिसे अवशिष्ट सुरक्षा संरेखण कमजोरियों (residual security alignment weaknesses) के परिणामस्वरूप होने वाले हानिकारक LLM आउटपुट का पता लगाने के लिए डिज़ाइन किया गया है, जिससे यह जनरेशन के बाद की फ़िल्टरिंग के लिए एक मजबूत उपकरण के रूप में और भविष्य के मॉडल सुरक्षा सुधारों के मार्गदर्शन के रूप में कार्य करता है।