Leak It: A Probabilistic Approach to Training-Data Extraction from Black-Box Language Models
यह शोध पत्र यह तर्क देता है कि ROC-AUC जैसे समग्र सदस्यता अनुमान मेट्रिक्स (aggregate membership inference metrics), ब्लैक-बॉक्स लैंग्वेज मॉडल्स से वर्बेटिम (verbatim) प्रशिक्षण-डेटा निष्कर्षण के गंभीर, क्षमता-निर्भर जोखिम को छिपाते हैं, यह प्रदर्शित करते हुए कि पहचानकर्ताओं या कोड वाले विशिष्ट दस्तावेज़ ब्लाइंड बेसलाइन या डीडुप्लिकेशन के बावजूद बार-बार लीक होते हैं, और "leakit" टूल के माध्यम से एक प्रति-दस्तावेज़ संभाव्य ऑडिट ढांचे (per-document probabilistic audit framework) का प्रस्ताव करता है ताकि इस गोपनीयता हानि को सटीक रूप से मापा जा सके।