← أحدث الأبحاث
🤖 AI

MMSkills: Towards Multimodal Skills for General Visual Agents

تقدم الورقة البحثية MMSkills، وهو إطار عمل يعالج أوجه القصور في تمثيلات المهارات القائمة على النصوص من خلال صياغة وتنفيذ معرفة إجرائية متعددة الوسائط قابلة لإعادة الاستخدام —تجمع بين الإجراءات النصية والأدلة المرئية المشروطة بالحالة— لتعزيز قدرات اتخاذ القرار في وقت التشغيل للوكلاء البصريين العامين.

المؤلفون الأصليون: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

نُشر 2026-05-14
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "MMSkills: نحو مهارات متعددة الوسائط للوكلاء البصريين العامين" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الفكرة الكبرى: تعليم الروبوتات كيف "ترى" مثل البشر

تخ trình أنك تعلم روبوتاً كيفية استخدام جهاز كمبيوتر.

  • الطريقة القديمة (مهارات تعتمد على النص فقط): تعطي الروبوت وصفة مكتوبة: "اضغط على قائمة 'ملف' (File)، ثم 'جديد' (New)، ثم 'ورقة عمل' (Sheet)."
    • المشكلة: إذا كان الروبوت في الشاشة الخطأ، أو إذا كانت هناك نافذة منبثقة تحجب القائمة، فإن الروبوت يتبع النص بشكل أعمى. سيضغط على "ملف" رغم أن القائمة ليست موجودة، فيتعثر ويفشل. هو يعرف ماذا يفعل، لكنه لا يعرف متى يفعل ذلك أو كيف يبدو شكل النتيجة النهائية.
  • الطريقة الجديدة (MMSkills): تعطي الروبوت "دليلاً ذكياً". هذا الدليل لا يحتوي على نصوص فحسب؛ بل يحتوي أيضاً على صور لما يجب أن تبدو عليه الشاشة في كل خطوة، جنباً إلى جنب مع قوائم تحقق للتأكد مما إذا كان الروبوت يسير على المسار الصحيح.

تقدم هذه الورقة البحثية نظام MMSkills، وهو نظام يحول هذه "الأدلة الذكية" إلى أدوات قابلة لإعادة الاستخدام لوكلاء الذكاء الاصطناعي (الروبوتات التي تستخدم أجهزة الكمبيوتر أو تلعب الألعاب).


المشكلات الثلاث الرئيسية التي حلوها

حدد المؤلفون ثلاث عقبات كبيرة في جعل هذه الأدلة الذكية تعمل:

  1. ماذا يوجد داخل الحزمة؟

    • تشبيه: إذا كنت تعلم شخصاً ما كيفية خبز كعكة، فإن وصفة نصية ليست كافية. أنت بحاجة إلى صورة للعجين (لمعرفة متى أصبح جاهزاً)، وصورة للفرن (لمعرفة ما إذا كان ساخناً)، وقائمة تحقق (للتأكد من أنك لم تنسَ البيض).
    • الحل: تحتوي حزمة MMSkill على ثلاثة أشياء:
      • النص: التعليمات خطوة بخطوة.
      • بطاقات الحالة (State Cards): نظام يشبه "إشارات المرور". يخبر الوكيل: "استمر فقط إذا رأيت زراً أزرق"، أو "توقف! لا تضغط إذا رأيت رسالة خطأ حمراء".
      • الدليل البصري (Visual Evidence): صور (إطارات رئيسية/keyframes) توضح بالضبط كيف يجب أن تبدو الشاشة في لحظات حرجة (مثل صور "قبل" و "بعد").
  2. من أين نحصل على هذه الأدلة؟

    • تشبيه: لا تريد استئجار إنسان لكتابة وصفة جديدة لكل كعكة تصنعها. تريد مراقبة الناس وهم يخبزون الكعك، وفهم الخطوات المشتركة، ثم كتابة وصفة عامة بنفسك.
    • الحل: قاموا ببناء "مولّد" (Generator) آلي. هو يراقب آلاف الفيديوهات العامة لأشخاص يستخدمون أجهزة الكمبيوتر (مسارات الحركة)، ويجمع المهام المتشابهة معاً، ويكتب هذه الأدلة الذكية تلقائياً. هو لا يكتفي بنسخ الفيديو فحسب؛ بل يستخرج المنطق و الإشارات البصرية.
  3. كيف يستخدمها الروبوت دون أن يصاب بالارتباك؟

    • تشبيه: تخيل أنك تحاول قراءة ألبوم صور ضخم مكون من 50 صفحة أثناء قيادة السيارة. هذا الأمر مشتت وخطير. قد يركز الروبوت بشدة على الصور القديمة لدرجة تجعله يصطدم بالعالم الحقيقي.
    • الحل: ابتكروا تقنية "تحميل الفروع" (Branch Loading).
      • بدلاً من حشو ألبوم الصور الكامل في عقل الروبوت الرئيسي، يفتح الروبوت نافذة جانبية مؤقتة (فرع).
      • في هذه النافذة الجانبية، ينظر بسرعة إلى الصورة المحددة فقط التي يحتاجها الآن لاتخاذ قرار.
      • ثم يغلق النافذة الجانبية ويخبر الروبوت الرئيسي: "حسناً، لقد تحققت من الصورة. أنت على المسار الصحيح. الآن، اضغط على الزر".
      • هذا يجعل الروبوت الرئيسي يركز على الشاشة الحية، وليس على الصور المرجعية القديمة.

كيف يعمل في الواقع (مثال "الرسم البياني")

تستخدم الورقة مثالاً محدداً لتوضيح سبب تفوق هذه الطريقة: إنشاء رسم بياني (Chart) في جدول بيانات.

  • السيناريو: المهمة هي "إنشاء رسم بياني في الورقة 2 (Sheet 2)".
  • الوكيل الذي يعتمد على النص فقط: يقرأ "أنشئ رسماً بيانياً". يرى رسماً بيانياً يتم إنشاؤه. يضغط على "تم".
    • النتيجة: أنشأ الرسم البياني في الورقة 1 (الورقة الخطأ) لأن النص لم يخبره بضرزم التحقق من أي ورقة هي النشطة. النتيجة: 0.
  • وكيل MMSkills:
    1. يقوم بتحميل مهارة "إنشاء الرسم البياني".
    2. تقول بطاقة الحالة: "تحقق: هل الورقة النشطة اسمها 'الورقة 2'؟"
    3. يظهر الدليل البصري صورة للورقة الصحيحة.
    4. يرى الروبوت أنه حالياً في "الورقة 1". يقول "الفرع": "انتظر! أنت في الورقة الخطأ. انتقل إلى الورقة 2 أولاً".
    5. ينتقل الروبوت، ثم ينشئ الرسم البياني، ثم يتحقق من أن العنوان يطابق الصورة.
    • النتيجة: رسم بياني مثالي في الورقة الصحيحة. النتيجة: 1.

ماذا أظهرت النتائج

اختبر الباحثون النظام على نوعين من المهام:

  1. مهام سطح المكتب: مثل استخدام Excel أو Chrome أو Word (OSWorld, macOSWorld).
  2. مهام الألعاب: مثل لعب Minecraft أو Super Mario Bros.

النتائج:

  • معدلات نجاح أفضل: حققت الروبوتات التي تستخدم MMSkills نجاحاً أكبر بكثير في حل المهام مقارنة بالروبوتات التي لا تملك مهارات أو تملك مهارات نصية فقط.
  • ساعدت الروبوتات الأصغر: حتى نماذج الذكاء الاصطنا_ي الأصغر والأقل قوة أصبحت أفضل بكثير في المهام عندما مُنحت هذه الأدلة البصرية.
  • أخطاء أقل: ارتكبت الروبوتات أخطاءً أقل تكرارية (مثل الضغط على نفس الزر 10 مرات) وأنهت المهام بشكل أسرع.
  • ليس للكمبيوتر فقط: عمل النظام بنفس الكفاءة في ألعاب الفيديو، مما يثبت أن "رؤية الحالة" مهمة سواء كنت تدير ملفات أو تقفز فوق العقبات.

الملخص

MMSkills هي طريقة لتعليم وكلاء الذكاء الاصطناعي ليس فقط ماذا يفعلون، بل كيف يتعرفون على ما إذا كانوا يفعلون ذلك بشكل صحيح. من خلال الجمع بين التعليمات النصية مع قوائم التحقق التي تشبه "إشارات المرور" وصور محددة، وباستخدام طريقة "النافذة الجانبية" للنظر إليها، يساعد النظام الروبوتات على تجنب الضياع أو الارتباك أو التوقف عند الشاشة الخطأ. إنه يحول الروبوت الذي يتبع الأوامر بشكل أعمى إلى روبوت يفهم بالفعل العالم البصري الذي يعمل فيه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →