Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts
تكشف هذه الدراسة التجريبية أن "سقوف عدم القدرة على الحل" المُبلغ عنها في توجيه النماذج اللغوية الكبيرة المتعددة (multi-LLM routing) مبالغ فيها إلى حد كبير بسبب عيوب تقييمية مثل انحياز الحكم والقص، مما يشوه إشارات تدريب الموجه ويؤدي إلى تكاليف فرصة بديلة كبيرة، مما يستلزم بروتوكولات تقييم أكثر موثوقية لتقدير المقايضات بين التكلفة والجودة بدقة.