Quantifying Memorization and Privacy Risks in Genomic Language Models
تقدم هذه الورقة إطاراً شاملاً للتقييم متعدد المتجهات للخصوصية، يقوم بقياس مخاطر الحفظ في نماذج اللغة الجينومية من خلال دمج الكشف القائم على الارتياب (perplexity)، واستخراج تسلسل الكناري (canary sequence)، والاستدلال بالانتماء، مما يكشف أن هذه النماذج تظهر تسريباً ملموساً للبيانات يعتمد على البنية وديناميكيات التدريب.