Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs
यह शोध पत्र प्रदर्शित करता है कि जहाँ फाइन-ट्यून्ड लार्ज लैंग्वेज मॉडल्स में स्टेग्नोग्राफिक पेलोड्स के लीनियर प्रोब-आधारित डिटेक्शन को उन एडवरसेरियल ट्रेनिंग के माध्यम से व्यवस्थित रूप से टाला जा सकता है जो रहस्यों को सिनर्जिस्टिक रेसिडुअल डिग्री ऑफ फ्रीडम में स्थानांतरित कर देती है, वहीं इस तरह के बचाव का मुकाबला एक थ्योरी-गाइडेड रीकॉन्टेक्स्टुअलाइजेशन डेटासेट को लागू करके किया जा सकता है जो मॉडल के प्रदर्शन से महत्वपूर्ण समझौता किए बिना डिटेक्टेबिलिटी को बहाल करता है।