DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
تقدم هذه الورقة DSAgentBench، وهو أول معيار مصمم لتقييم قدرة وكلاء الذكاء الاصطناعي على أتمتة سير عمل علم البيانات من البداية إلى النهاية ضمن بيئات حاسوبية حقيقية، مما يكشف عن فجوة أداء كبيرة حيث تواجه حتى أقوى النماذح صعوبة في تنسيق الأدوات والاستنتاج متعدد الخطوات.