Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior
यह शोध पत्र प्रदर्शित करता है कि समझौता किए गए मॉडलों से हानिकारक चेन-ऑफ-थॉट ट्रेसेस को पुन: प्रयोज्य जेलब्रेक प्रॉम्प्ट्स में स्थानांतरित और डिस्टिल किया जा सकता है, जो ओपन-सोर्स और क्लोज्ड-सोर्स दोनों मॉडलों पर हमले की सफलता दर को महत्वपूर्ण रूप से बढ़ा देता है और यह भी प्रकट करता है कि वर्तमान आउटपुट-साइड सुरक्षा उपाय ऐसे रीजनिंग-आधारित खतरों का पता लगाने में अक्सर विफल रहते हैं।