← أحدث الأبحاث
🤖 AI

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

تقدم الورقة البحثية Agentick، وهو معيار موحد يضم 37 مهمة مُولدة إجرائياً عبر وسائط ومستويات صعوبة متنوعة لتمكين المقارنة العادلة ودفع عجلة التقدم في اتخاذ القرار المتسلسل لوكلاء التعلم المعزز (RL)، والنماذج اللغوية الكبيرة (LLM)، والنماذج اللغوية البصرية (VLM)، والوكلاء الهجينين، والبشر.

المؤلفون الأصليون: Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

نُشر 2026-05-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول معرفة من هو أفضل "حلال للمشكلات" في العالم. لديك ثلاثة أنواع مختلفة تماماً من المتسابقين:

  1. اللوحة الفارغة: روبوت لا يعرف شيئاً ويجب عليه تعلم كل شيء عن طريق التجربة والخطأ (مثل طفل يتعلم المشي).
  2. الموسوعة: كمبيوتر فائق الذكاء قرأ كل شيء تقريباً على الإنترنت ولكنه لم يقم بأي فعل حقيقي في العالم الواقعي قط.
  3. الهجين: مزيج من كليهما.

المشكلة؟ حتى الآن، لم نكن نستطيع مقارنتهم بشكل عادل. الأمر يشبه محاولة مقارنة عداء ماراثون، وبطل شطرنج، وسباح عبر سؤالهم جميعاً عن "الجري في سباق". السباح سيغرق، ولاعب الشطرخ سيضيع طريقه.

إليك "Agentick".

قام مؤلفو هذه الورقة البحثية ببناء ساحة اختبار عالمية جديدة تسمى Agentick. فكر في الأمر كأنه "مضمار عقبات" ضخم يتم إنتاجه إجرائياً، مصمم خصيصاً ليكون بإمكان أي نوع من أنواع الذكاء الاصطناعي التنافس فيه على نفس الملعب.

مضمار العقبات (المعيار المرجعي)

ليس Agentick مجرد لعبة واحدة؛ بل هو مجموعة من 37 لعبة مصغرة مختلفة (مثل المتاهات، والألغاز، ورحلات البحث عن الكنز) تزداد صعوبتها تدريجياً. تختبر هذه الألعاب ست مهارات محددة:

  • الملاحة (Navigation): هل يمكنك إيجاد طريقك؟
  • التخطيط (Planning): هل يمكنك التفكير مسبقاً؟
  • الاستنتاج (Reasoning): هل يمكنك حل الألغاز المنطقية؟
  • الذاكرة (Memory): هل يمكنك تذكر ما حدث قبل 10 خطوات؟
  • التعميم (Generalization): هل يمكنك التكيف مع قاعدة جديدة؟
  • العمل الجماعي (Teamwork): هل يمكنك العمل مع (أو ضد) الآخرين؟

المترجم العالمي (الواجهة)

هذه هي الخدعة السحرية: يتحدث Agentick خمس لغات مختلفة في نفس الوقت لكل لحظة في اللعبة.

  • بالنسبة لـ "اللوحة الفارغة" (RL): يعرض لها شاشة لعبة فيديو بكسلية (مثل ألعاب الأركيد القديمة).
  • بالنسبة لـ "الموسوعة" (LLMs): يعرض لها خريطة نصية باستخدام رموز ASCII (مثل # للجدران و . للمساحات الفارغة) أو وصفاً مكتوباً.
  • بالنسبة للبشر: يعرض لهم عرضاً ثلاثي الأبعاد.

هذا يضمن عدم غش أحد. "الموسوعة" لا تضطر لتخمين معنى البكسلات، و"اللوحة الفارغة" لا تضطر لقراءة رواية لفهم القواعد. الجميع يرى الحالة ذاتها للعالم، ولكن بالتنسيق الذي يناسبهم.

النتائج: من الفائز؟

قام الباحثون بتشغيل أكثر من 90,000 لعبة لمعرفة من سيؤدي بشكل أفضل. وإليكم ما وجدوه، باستخدام تشبيهات بسيطة:

  1. لا يوجد بطل واحد: لا يوجد نوع واحد هو "الأفضل"، فالأمر يعتمد على المهمة.

    • كانت "اللوحة الفارغة" (RL) مذهلة في التخطيط والعمل الجماعي. لقد تعلمت آليات اللعبة الدقيقة من خلال التكرار وأصبحت بارعة في التكتيك.
    • كانت "الموسوعة" (LLMs) رائعة في الملاحة والتعميم. ولأنها قرأت الكثير، استطاعت تخمين المسار الصحيح في متاهة جديدة دون الحاجة للتدريب أولاً.
    • الحكم النهائي: حتى أذكى نموذج ذكاء اصطناٍ (GPT-5 mini) لم يصل إلا إلى حوالي 30% من "الدرجة المثالية". لا تزال هناك فجوة هائلة بين ما يمكن للذكاء الاصطناعي فعله اليوم وما يجب أن يكون قادراً عليه.
  2. خدعة "التفكير": طريقة طلبك من الذكاء الاصطناعي أن يفكر أهم من حجم الذكاء الاصطناعي نفسه.

    • عندما أخبر الباحثون نماذج (LLMs) أن "تفكر خطوة بخطوة" (وهي طريقة تسمى سلسلة الأفكام - Chain-of-Thought) قبل اتخاذ إجراء، تضاعف أداؤها ثلاث أو عشر مرات. إنه يشبه قولك لطالب: "لا تخمن فقط؛ بل اكتب منطقك أولاً". فجأة، أصبحوا يحلون الألغاز بشكل أفضل بكثير.
  3. الاختصار والوضوح أفضل: بالنسبة للذكاء الاصطناعي الذي يحاول التنقل في خريطة، كانت شبكات النصوص (ASCII) تعمل بشكل أفضل من الأوصاف الطويلة والمنمقة.

    • تخيل أنك تعطي شخصاً ما اتجاهات. غالباً ما يكون من الأسهل للكمبيوتر معالجة خريطة بسيطة بالرموز (# = جدار، . = مسار) بدلاً من فقرة نصية تقول: "أنت تقف في غرفة بجانب جدار على يسارك...". كانت الرموز المدمجة أكثر كفاءة في الاستدلال المكاني.

لماذا هذا مهم؟

تجادل الورقة البحثية بأنه لبناء وكلاء قادرين حقاً ومستقلين (روبوتات أو برمجيات يمكنها القيام بالأشياء بمفردها)، نحتاج إلى التوقف عن معاملة هذه الأنواع المختلفة من الذكاء الاصطناعي كعوالم منفصلة. يوفر Agentick أرضية مشتركة لرؤية أين يتألق كل نوع وأين يخفق.

ويشير البحث إلى أن مستقبل الذكاء الاصطناعي لا يقتصر فقط على جعل النماذج أكبر أو تدريبها لفترات أطول؛ بل يتعلق بـ دمج "التعلم من خلال الفعل" الخاص باللوحة الفارغة مع "المعرفة بالعالم" الخاصة بالموسوعة، مع استخدام "التوجيه" (Prompting) الصحيح للحصول على أفضل النتائج.

باختصار: Agentick هو أول حكم عادل يمكنه الحكم على لاعب شطرنج، وسباح، وعداء في نفس الحلبة، مثبتاً أنه بينما أحرزنا تقدماً، لا نزال بعيدين عن بناء الوكيل المستقل المثالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →