Characterizing Memorization in Diffusion Language Models: Generalized Extraction and Sampling Effects
تقدم هذه الورقة إطاراً نظرياً وتجريبياً يوضح أنه في حين يمكن لنماذج اللغة الانتشارية (DLMs) حفظ بيانات التدريب مع زيادة احتمالية ذلك بالتوازي مع دقة أخذ العينات، إلا أنها تظهر تسريباً أقل بكثير لمعلومات الهوية الشخصية مقارنة بالنماذج ذات التوليد الذاتي (autoregressive models) في ظل تقييمات مشروطة ببادئات متوافقة.