Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
تقدم هذه الورقة البحثية Agent-X، وهو معيار مرجعي واسع النطاق يضم 828 مهمة واقعية متعددة الوسائط عبر ست بيئات متنوعة وإطار تقييم دقيق على مستوى الخطوات لتقييم الاستدلال العميق في الوكلاء المتمحورين حول الرؤية، مما يكشف أن النماذج الرائدة الحالية تعاني لتحقيق نجاح كامل السلسلة في السيناريوهات المعقدة متعددة الخطوات.