When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation
تكشف هذه الورقة أن طرق توليد البيانات الجدولية القائمة على النماذج اللغوية الكبيرة معرضة لتسريبات الخصوصية من خلال الأنماط الرقمية المحفوظة، وتقدم هجوماً للتحقق من العضوية بنظام الصندوق الأسود يسمى LevAtt لكشف هذه المخاطر، وتقترح استراتيجية جديدة لأخذ العينات عبر اضطراب الأرقام للتخفيف من التسريب بفعالية مع الحفاظ على فائدة البيانات.