The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World
تُثبت هذه الورقة أن طرق التقييم القائمة على إعادة التشغيل الساكنة تفشل جوهرياً في تقييم موجّهات وكلاء النماذج اللغوية الكبيرة، لأن استبدال مخرجات النموذج في المسارات المسجلة يتجاهل التباعد المتتالي لأفعال الوكيل اللاحقة، مما يؤدي إلى مقاييس أداء مضللة لا تعكس النتائج في العالم الحقيقي.