LLM Benchmark Datasets Should Be Contamination-Resistant
تجادل هذه الورقة بأن مجموعات بيانات اختبار النماذج اللغوية الكبيرة يجب إعادة تصميمها لتكون مقاومة للتلوث —بما يجعلها غير قابلة للتعلم أثناء التدريب مع بقائها قابلة للحل أثناء الاستنتاج— وذلك عبر الاستفادة من التباينات الهيكلية والتقدم الرياضي لضمان تقييم موثوق وقابل للتكرار للنماذج.