← أحدث الأبحاث
💻 computer science

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

تقدم الورقة البحثية AgentVista، وهو معيار شامل يمتد عبر 25 مجالاً فرعياً يقيم الوكلاء متعددي الوسائط العامين في مهام واقعية طويلة الأمد وشديدة الصعوبة تتطلب استخداماً هجيناً للأدوات، مما يكشف عن فجوات كبيرة في أداء النماذج الحالية الرائدة.

المؤلفون الأصليون: Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

نُشر 2026-03-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك وظفت مساعداً آلياً (روبوت) فائق الذكاء لمساعدتك في مهمة معقدة من واقع الحياة، مثل إصلاح صنبور يسرب الماء، أو التخطيط لرحلة برية عبر البلاد، أو شراء هدية عيد ميلاد مثالية. أنت تعطي الروبوت صورة للمشكلة وبعض التعليمات.

المشكلة:
معظم الاختبارات التي استخدمناها للتحقق مما إذا كانت هذه الروبوتات "ذكية" تشبه إعطاءها اختباراً قصيراً مفاجئاً. يظهرون للروبوت صورة ويسألونه: "ما لون السيارة؟" أو "كم عدد التفاحات الموجودة هناك؟". الروبوت ينظر فقط ويجيب. إنه لا يفعل أي شيء فعلياً. الأمر يشبه اختبار طيار بسؤاله عن أجزاء الطائرة، دون السماح له أبداً بالطيران.

الحل: AGENTVISTA
قام مؤلفو هذه الورقة البحثية ببناء اختبار جديد وأصعب بك much يسمى AGENTVISTA. فكر في الأمر كأنه "جزيرة نجاة" لوكلاء الذكاء الاصطناي.

بدلاً من الاختبار القصير، يعطي AGENTVISTA الروبوت مهمة حقيقية فوضوية تتطلب سلسلة طويلة من الأفعال. إليك كيف يعمل:

1. مهمة "المحقق"

تخيل أنك محقق. لديك صورة ضبابية لمسرح جريمة (المدخل البصري). لا يمكنك مجرد التخمين؛ عليك حل اللغز.

  • الخطوة 1: تنظر إلى الصورة وتدرك أنك بحاجة للعثون على نوع معين من الأحذية.
  • الخطوة 2: تستخدم محرك بحث (أداة) للعثور على صور لهذا الحذاء.
  • الخطوة 3: تجد موقعاً إلكترونياً يبيع الحذاء، لكن السعر مخفي. يجب عليك النقر عبر الموقع الإلكتروني (أداة أخرى) للعثور على السعر.
  • الخطوة 4: تدرك أن الحذاء يتوفر بمقاسات مختلفة، وعليك حساب التكلفة الإجمالية لعائلة بأكملها. تفتح آلة حاسبة (أداة برمجية) للقيام بالعملية الحسابية.
  • الخطوة 5: تدرك أن الصورة التقطت في مدينة معينة، لذا تحتاج إلى التحقق من الطقس لمعرفة ما إذا كانت الأحذية مقاومة للماء بما يكفي.

AGENTVISTA هو مجموعة من 209 من هذه "المهام التحقيقية". وهي تغطي كل شيء من إصلاح مجموعة "ليجو" (LEGO) إلى التخطيط لرحلة إلى اليابان. العقدة هي أن الروبوت يجب أن يمزج ويطابق أدوات مختلفة (البحث، النقر، الحساب، التكبير على الصور) بترتيب محدد للوصول إلى الإجابة الصحيحة.

2. لماذا هو صعب جداً؟

يطلق عليه المؤلفون وصف "التحدي الفائق". وإليك السبب:

  • الصور فوضوية: الصور ليست لقطات استوديو مثالية. إنها تشبه الحياة الواقعية: مزدحمة، ضبابية، أو ملتقطة من زوايا غريبة. يجب على الروبوت أن يضيق عينيه ليفهم ما الذي ينظر إليه.
  • السلسلة طويلة: لا يمكن للروبوت الإجابة في جملة واحدة فقط. قد يحتاج للقيام بـ 25 خطوة مختلفة (مثل تقليب صفحة، البحث، الحساب، البحث مرة أخرى) للوصء إلى الإجابة. إذا أخطأ في الخطوة 3، ستفشل المهمة بأكملها.
  • لا توجد طرق مختصرة: تم تصميم الأسئلة بحيث لا يمكن للروبوت مجرد "البحث في جوجل" للحصول على الإجابة. يجب عليه النظر في الصورة أولاً، ثم الحصول على المعلومات.

3. النتائج: الروبوتات لا تزال تتعلم

اختبر المؤلفون أذكى نماذج الذكاء الاصطناعي في العالم (مثل أحدث إصدارات GPT وGemini وClaude) في "جزيرة النجاة" هذه.

لوحة الدرجات:
حتى أفضل روبوت في الغرفة، Gemini-3-Pro، حصل على حوالي 27% فقط من الإجابات الصحيحة. هذا يشكنه الحصول على تقدير "مقبول" (D-) في الاختبار.

  • معظم الروبوتات تعثرت لأنها أخطأت في قراءة الصورة (على سبيل المثال، ظنت أن لافتة ضبابية مكتوب عليها "مفتوح" بينما كانت تقول "مغلق").
  • بمجرد أن أخطأت في قراءة الصورة، سلكت مساراً خاطئاً، وبحثت عن الشيء الخطأ، وأعطت إجابة خاطئة.
  • كما واجهوا صعوبة في تتبع سلسلة الخطوات الطويلة، حيث نسوا ما كان ينبغي عليهم فعله تالياً.

4. التشبيه: "الطاهي معصوب العينين"

فكر في وكلاء الذكاء الاصطناعي هؤلاء كطهاة يحاولون طهي وجبة معقدة، لكنهم يرتدون عصابة على أعينهم تُرفع لجزء من الثانية فقط.

  • الاختبارات القديمة: كنا نسألهم: "ما هو الطماطم؟" فيجيبون بشكل صحيح.
  • AGENTVISTA: نقول لهم: "إليك صورة لسطح مطبخ فوضوي. ابحث عن الطماطم، وتحقق مما إذا كانت ناضجة، وابحث عن وصفة عبر الإنترنت تستخدمها، واحسب كم تكلفتها، وأخبرني ما إذا كان معك مال كافٍ لشرائها".
  • النتيجة: الطهاة يستمرون في الاصطدام بالأشياء، أو الإمساك بالمكونات الخاطئة، أو نسيان الوصفة. إنهم جيدون في التحدث عن الطبخ، لكنهم لا يزالون يتعلمون كيفية الطبخ فعلياً في مطبخ فوضوي.

لماذا هذا مهم؟

يقول المؤلفون إن هذا الاختبار مهم لأنه يوضح لنا بالضبط أين يخفق الذكاء الاصطناعي في العالم الحقيقي. المشكلة ليست في أن الروبوتات "غبية"؛ بل في أنها لم تتعلم بعد كيف تنظر بعناية، وتستخدم الأدوات بحكمة، وتحافظ على خطة طويلة في ذهنها في آن واحد.

من خلال إطلاق هذا الاختبار (AGENTVISTA) ومجموعة أدوات للباحثين الآخرين، يأمل المؤلفون في المساعدة في بناء وكلاء ذكاء اصطناعي يمكنهم حقاً مساعدتنا في حياتنا اليومية، من إصلاح هواتفنا إلى التخطيط لعطلاتنا، دون ارتباك أو ارتكاب أخطاء سخيفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →