ORCA-bench: How Ready Are Language Model Agents for Oncall?
تقدم الورقة البحثية ORCA-bench، وهو معيار قياس ذو دقة إنتاجية لتقييم وكلاء النماذج اللغوية في مهام تحليل الأسباب الجذرية أثناء المناوبات، كاشفةً أن أكثر النماذج المتطورة حالياً تحقق دقة منخفضة (25.3% في الصعوبة المتوسطة) وتواجه صعوبة في الهلوسة، مما يشير إلى وجود فجوة كبيرة قبل إمكانية الوثوق بها بأمان في موثوقية الإنتاج في العالم الحقيقي.