Detecting Data Contamination in LLMs via In-Context Learning
تقدم الورقة البحثية CoDeC، وهي طريقة عملية وآلية تكتشف وتحدد كمية تلوث بيانات التدريب في النماذج اللغوية الكبيرة من خلال تحليل كيفية تأثير التعلم في السياق على ثقة النموذج، مع التمييز بين بيانات التدريب المحفوظة والتوزيعات غير المرئية.