DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA
يوحد DeicticVLA أنماط اللغة، واللغة والرؤية، والتعليمات البصرية في نموذج واحد للرؤية واللغة والعمل من خلال توحيدها في مطالبات نصية وأقنعة إشارية (deictic masks)، مما يظهر قدرة فائقة على التعميم على الأشياء والتعبيرات غير المرئية سابقاً مقارنة بالنماذج المرجعية التي تعتمد على اللغة فقط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل ذراعاً آلياً يجلس في مطبخ، مستعداً للمساعدة. لإخباره بما يجب فعله، قد يقول إنسان: "التقط الكوب الأحمر الموجود على اليسار". يبدو هذا بسيطاً، لكن بالنسبة لآلة، غالباً ما يكون العالم مليئاً بالعديد من الأكواب الحمراء، أو أكواب تبدو متطابقة تقريباً. إذا حاول الإنسان أن يكون أكثر تحديداً، قائلاً: "التقط ثالث كوب أحمر من اليسار، ذاك المجاور للمنديل الأزرق"، فقد يظل الروبوت مرتبكاً. أصبحت الروبوتات الحديثة أفضل في فهم اللغة، لكنها غالباً ما تعاني عندما تكون التعليمات مفصلة للغاية أو عندما لا تتطابق الأشياء الموجودة أمامها مع الصور الدقيقة التي تعلمتها أثناء التدريب. قد يلتقطون الشيء الخاطئ لمجرد أنه يبدو مألوفاً أكثر قليلاً، متجاهلين الكلمات المحددة التي نطق بها الإنسان للتو.
لحل هذه المشكلة، يستكشف الباحثون طريقة مختلفة للتحدث مع الآلات: استخدام إيماءة التأشير. تماماً كما قد يقول إنسان: "التقط هذا الواحد"، وهو يشير بإصبعه إلى الشيء، يمكن تعليم الروبوت أن يفهم النقرة على الشاشة كأمر مباشر. هذا النهج، المعروف باسم الإيماءة الإشارية (deictic gesture)، يقطع طريق الحيرة التي تسببها اللغة عبر إظهار ما يُقصد به بدقة. ومع ذلك، حتى الآن، كانت الروبوتات تُدرب عادةً على الاستماع للكلمات فقط، أو الاستماع للكلمات أثناء التأشير عليها، ولكن نادراً ما كانت قادرة على التعامل مع كل هذه الطرق في آن واحد. تقدم دراسة جديدة نظاماً يوحد هذه الأساليب، مما يسمح لعقل روبوتي واحد بالانتقال بسلاسة بين الاستماع إلى جملة، أو الاستماع إلى جملة مع التأشير عليها، أو مجرد اتباع إشارة دون أي كلمات على الإطلاق.
قام الباحثون، الذين يعملون مع نوع من الذكاء الاصطناي من نوع "نموذج الرؤية واللغة والعمل" (Vision-Language-Action model)، بتطوير نظام أطلقوا عليه اسم DeicticVLA. هذه النماذج تشبه عقل الروبوت الذي قرأ ملايين الكتب ورأى ملايين الصور، حيث تعلمت كيفية ربط ما تراه بما يجب أن تفعله. كان التحدي هو جعل هذا العقل مرناً بما يكفي لقبول ثلاثة أنواع مختلفة من المدخلات: أمر نصي، أمر نصي مدمج مع إيماءة تأشير، أو مجرد إيماءة تأشير. في النمط الأول، يكتب المستخدم جملة كاملة. وفي النمط الثاني، يكتب المستخدم جملة تتضمن كلمة مثل "هذا" أو "هناك" وينقر على الشاشة لتحديد ما تشير إليه تلك الكلمة. وفي النمط الثالث، ينقر المستخدم على الشيء الذي يريد تحريكه والمكان الذي يريد نقله إليه، دون قول أي شيء على الإطلاق.
لجعل هذا يعمل، ابتكر الفريق خطوة ترجمة تحول كل هذه المدخلات الثلاثة المختلفة إلى نفس التنسيق الداخلي. فعندما ينقر المستخدم على الشاشة، يستخدم النظام أداة قوية لتحليل الصور لتحويل تلك النقرة الواحدة إلى تحديد دقيق للكائن، وهو عبارة عن "قناع" (mask) يسلط الضوء على ما يلمسه الإنسان بالضبط. ثم يتم دمج هذا القناع مع مطالبة نصية؛ فإذا تحدث المستخدم، تكون المطالبة النصية هي كلماته، وإذا نقر فقط، يستخدم النظام عبارة افتراضية مثل "اتبع التعليمات المرئية". وبهذه الطريقة، يتلقى عقل الروبوت دائماً حزمة متسقة: تعليمات نصية وتحديداً مرئياً للهدف. ثم اختبر الباحثون طرقاً مختلفة لتغذية هذا التحديد المرئي في عقل الروبوت؛ حيث جربوا رسم صندوق حول الكائن في صورة الكاميرا، أو تعتيم بقية المشهد لجعل الكائن يبرز، أو تغذية التحديد كطبقة منفصلة من المعلومات يعالجها الروبوت جنباً إلى جنب مع الصورة.
اختبر الفريق هذه الأفكار أولاً في بيئة محاكاة، وهي عالم رقمي حيث يمكن للروبوتات التدرب آلاف المرات دون كسر أي شيء. ووجدوا أن النظام يمكنه تعلم التعامل مع جميع أنماط التعليمات الثلاثة في آن واحد. وعندما طُلب من الروبوت تنفيذ مهام لم يسبق له رؤيتها، مثل التقاط جسم من ترتيب جديد للأثاث أو تحديد جسم بناءً على وصف مكاني جديد، كانت طرق التأشير تعمل بشكل أفضل بكثير من الكلمات وحدها. في أحد الاختبارات التي تضمنت أوعية سوداء متطابقة، حيث كان على الروبوت التقاط الوعاء المجاور لمرجع محدد، فشل نهج اللغة وحدها في معظم الأوقات. ومع ذلك، عندما أشار المستخدم إلى الوعاء الصحيح، نجح الروبوت في كل مرة تقريباً. أظهرت الدراسة أن طريقة التدريب على مرحلتين كانت حاسمة: تعلم الروبوت أولاً اتباع الأوامر النصية، ثم تعلم كيفية دمج تلك الأوامر مع إيماءات التأشير. ساعد هذا الترتيب الروبوت على الاحتفاظ بقدرته على فهم اللغة مع اكتساب المهارة الجديدة المتمثلة في اتباع الإشارة.
ولرؤية ما إذا كان هذا سينجح في العالم الحقيقي، قام الباحثون ببناء إعداد مادي يتكون من ذراع روبوتية، وكاميرا، وجهاز لوحي. علموا الروبوت التقاط المكعبات، ووضعها في أوعية، وتنظيم الألعاب المحشوة. واختبروا الروبوت بتعليمات لم يسمعها من قبل، مثل الطلب منه التقاط المكعب "الأيسر" بينما تم تدريبه فقط على تعليمات "الأيمن"، أو الطلب منه نقل نوع معين من الألعاب لم يره من قبل. في هذه السيناريوهات الصعبة، عانى الروبوت الذي يعتمد على اللغة فقط، حيث كان يخمن بشكل خاطئ أو يفشل في التنفيذ. ولكن عندما أشار المستخدم إلى الهدف، ارتفع معدل نجاح الروبوت بشكل هائل. في اختبار مع فئات جديدة تماماً من الألعاب المحشوة، نجح الروبوت الذي يعتمد على اللغة فقط في حوالي سدس المرات فقط. أما طرق التأشير، فقد حققت نسبة نجاح مثالية؛ فلم يكن الروبوت بحاجة لمعرفة اسم اللعبة أو الفئة التي تنتمي إليها، بل كان يحتاج فقط لرؤية أين يشير الإنسان.
تشير النتائج إلى أن مستقبل التفاعل بين الإنسان والروبوت قد لا يكون بالاختيار بين التحدث أو التأشير، بل بتوفير كليهما في وقت واحد. يسمح النظام للمستخدم ببدء جملة، وإذا بدا الروبوت مرتبكاً، يمكنه ببساطة التأشير للتوضيح. أو، لأداء مهمة روتينية سريعة، يمكن للمستخدم مجرد التأشير دون قول كلمة واحدة. تشير الأبحاث إلى أنه بينما تعد اللغة قوية في وصف الأفكار المعقدة، فإن التأشير وسيلة أكثر موثوقية لتحديد أشياء محددة في عالم فوضوي ومتغير. ومن خلال توحيد هذه الأساليب في نظام واحد، خلق الباحثون طريقة أكثر مرونة وقوة لتوجيه البشر للآلات، مما يضمن أن الروبوت لا يفهم فقط ما نقوله، بل يفهم ما نقصده.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.