SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows
يقدم SQBench معياراً مرجعياً جديداً لتقييم وكلاء النماذج اللغوية في سير عمل العمليات الإنتاجية من خلال تقييم 220 مهمة معيارية عبر ثلاثة مستويات من التعقيد عبر إطار عمل ثنائي المعايير يميز بين الإنجاز الوظيفي والجزاءات القائمة على المخاطر، مما يكشف أن النماذج الحالية تعاني في التسليم المقيد بالمجال وأن النجاح الوظيفي وحده غير كافٍ لضمان مخرجات مهام عالية الجودة.