When benchmark inferences do not compose: Projectibility in AI evaluation
تجادل هذه الورقة بأن الاستنتاجات الصحيحة لمعايير الذكاء الاصطناعي لا تترجم تلقائياً إلى ادعاءات تبعية مبررة بسبب عدم التوافق في النهايات والافتراضات والارتباطات، وتقترح إطار عمل "تدقيق القابلية للإسقاط" لتشخيص هذه الروابط المنطقية غير المدعومة.