Personal Information Parroting in Language Models
تقدم هذه الورقة مجموعة كاشفات محسنة تعتمد على التعبيرات النمطية (regex) لتكشف أن النماذج اللغوية، لا سيما مع زيادة حجمها ومدة تدريبها، تقوم في كثير من الأحيان بحفظ وإعادة إنتاج المعلومات الشخصية حرفياً من بيانات التدريب المسبق الخاصة بها، مما يستلزم تصفية صارمة وإخفاءً للهوية في مجموعات البيانات للتخفيف من مخاطر الخصوصية.