Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models
यह शोध पत्र प्रदर्शित करता है कि डिकोडर-ओनली लैंग्वेज मॉडल्स के अंतिम-लेयर हिडन स्टेट्स मूल टेक्स्ट जितने ही संवेदनशील होते हैं, जो यह दर्शाता है कि एक निरंतर एम्बेडिंग-स्पेस ऑप्टिमाइज़ेशन दृष्टिकोण प्रभावी रूप से इनपुट टोकन्स को रिकवर करता है और यह भी प्रकट करता है कि पुनर्निर्माण की विफलताएं मुख्य रूप से वास्तविक अस्पष्टताओं के बजाय उच्च-आवृत्ति वाले फंक्शन वर्ड्स के कारण होती हैं।