SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control
يُعد SelfWAM نموذجاً موحداً لأفعال العالم يعزز تعلم سياسات الروبوت من خلال التنبؤ المشترك بالأفعال والملاحظات المستقبلية المشروطة بالفعل والمستندة إلى أقنعة الروبوت الذاتية، مما يضمن أن تعكس التنبؤات عواقب أفعال محددة مع الحفاظ على سرعات استدلال سريعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتاً كيفية صنع شطيرة. تعرض عليه مقطع فيديو لإنسان يقطع حبة طماطم. قد يقوم روبوت بسيط بمجرد حفظ صورة الطماطم والسكين، ثم يحاول تقليد حركات اليد. لكن الجزء الصعب هنا هو: إذا نظر الروبوت إلى الصورة فقط، فإنه لا يفهم حقاً "لماذا" تتحرك الطماطم. هو لا يعرف أنه إذا ضغط بالسكين بقوة أكبر، فستُقطع الطماطم بشكل أسرع، أو إذا ضغط في الاتجاه الخاطئ، فقد تتدحرج الطماطم بعيداً عن الطاولة.
هذا هو التحديد الذي تواجهه "نماذج عالم الأفعال" (World Action Models) في مجال الروبوتات. هذه النماذج هي عقول ذكاء اصطناعي خاصة تحاول التنبؤ بما سيبدو عليه المستقبل بناءً على ما يفعله الروبوت الآن. فكر فيها كأنها "خيال" الروبوت. إذا كان بإمكان الروبوت تخيل المستقبل، فيمكنه التخطيط بشكل أفضل. ولكن لفترة طويلة، كانت هذه التخيلات تشبه أحلام اليقظة: كان بإمكانها تخمين كيف سيبدو المشهد في غضون ثوانٍ قليلة، لكنها لم تكن جيدة جداً في ربط تلك التخمينات بالحركات المحددة التي قام بها الروبوت بالفعل. كانت مثل مشاهدة فيلم وتخمين نهايته دون معرفة ما فعله الشخصيات للتو. السؤال الكبير الذي يواجه العلماء هو: كيف نعلم الروبوت أن يتخيل المستقبل خصيصاً كنتيجة لأفعاله الخاصة، بحيث يتعلم ليس فقط ما يحدث، بل كيف تتسبب أجزاء جسده في حدوث الأشياء؟
هنا يأتي دور SelfWAM، وهو نهج جديد يعمل كمدرب خيال "واعٍ بذاته" للروبوتات. أدرك الباحثون وراء هذا العمل أن الطرق السابقة كانت تفتقد إلى رابط حيوي: لم يكن الروبوت مُجبراً على ربط حركاته المحددة بالتغيرات البصرية التي يراها. ولإصلاح ذلك، بنوا نظاماً يجبر الروبوت على الانتباه إلى شيئين في آن واحد: الفيديو المستقبلي للمشهد، و"مخطط شبحي" لجسمه وهو يتحرك عبر ذلك المشهد.
إليك كيف يعمل SelfWAM، باستخدام تشبيه بسيط. تخيل أنك تتعلم مهارة التلاعب بالكرات (الجوغلة). قد يشاهد ذكاء اصطناعي قياسي فيديو لشخص يتلاعب بالكرات ويحاول التنبؤ بمكان ذهاب الكرات تالياً. لكنه قد يتشتت بانتباهه بسبب لون الكرات أو الجدار في الخلفية. أما SelfWAM فهو مختلف؛ فهو يعطي الروبوت نسخة "نظيفة" خاصة من الحركة التي قام بها للتو — مثل مخطط مثالي وخالٍ من الضجيج للرمية — ويستخدم هذا المخطط للتنبؤ بالمستقبل. والأهم من ذلك، أنه يطلب من الروبوت أيضاً التنبؤ بـ "قناع ذاتي" (self-mask)، وهو مجرد صورة ظلية بالأبيض والأسود لأذرع الروبوت ويديه وهي تتحرك.
لماذا هذه الصورة الظلية مهمة جداً؟ فكر في الأمر كأنه كشاف ضوئي. إذا حاولت التنبؤ بمستقبل عرض تلاعب بالكرات، فإن الجدار في الخلفية وتغيرات الإضاءة ليست سوى ضجيج؛ فهي لا تخبرك ما إذا كان التلاعب سينجح أم لا. ولكن حركة أذرع الروبوت نفسه؟ هذا هو الإشارة. من خلال تدريب الروبوت على التنبؤ بدقة بكيفية تحرك جسده في الثواني القليلة القادمة (مع تجاهل تفاصيل الخلفية الفوضوية)، يتعلم الروبوت صلة أوثق بين "لقد قمت بهذه الحركة" و"هذا ما حدث بعد ذلك".
يصف البحث خدعة ذكية لجعل هذا يعمل دون إبطاء سرعة الروبوت. خلال مرحلة التدريب، يحصل الروبوت على المخطط "النظيف" للفعل لمساعدته على تعلم الربط بين الحركات والمناظر البصرية المستقبلية. ولكن عندما يعمل الروبوت فعلياً في العالم الحقيقي (الاستدلال/inference)، فإنه لا يحتاج إلى توليد تلك الفيديوهات المستقبلية أو الصور الظلية. إنه يستخدم فقط الجزء خفيف الوزن من عقله الذي تعلم الحركات. إنه يشبه طالباً يستخدم دليل دراسة مفصلاً مع رسوم توضيحية ليتعلم من أجل اختبار ما، ولكن في يوم الاختبار، يحتاج فقط إلى استحضار الحقائق بسرعة. العمل الشاق المتمثل في التنبؤ بالمستقبل يحدث فقط أثناء التدريب، وليس أثناء الوظيفة الفعلية.
اختبر الباحثون هذه الفكرة بطريقتين رئيسيتين. أولاً، استخدموا محاكاة حاسوبية معقدة تسمى RoboTwin 2.0، والتي تتميز بروبوت ذي ذراعين يقوم بأكثر من 50 مهمة مختلفة. وجدوا أن SelfWAM كان أفضل في هذه المهام مقارنة بالطرق السابقة، خاصة عندما تم تغيير الخلفية أو جعلها عشوائية (مثل تغيير الأثاث أو الإضاءة). لقد حقق معدل نجاح بلغ حوالي 92.6% في المتوسط، متفوقاً على النماذج الرائدة الأخرى. ثانياً، جربوه على ذراع روبوت حقيقية ومادية في مختبر. أعطوه أربع مهام محددة، مثل وضع كوب على حامل أو وضع قلم في كوب. نجح SelfWAM في 95% من المحاولات، متفوقاً على الطرق الأخرى.
ولعل الاكتشاف الأكثر إثارة هو أن هذا "التخيل الفائق" لم يجعل الروبوت بطيئاً. يوضح البحث أن الوقت الذي يستغرقه الروبوت لاتخاذ قراره بشأن حركته التالية زاد بنسبة أقل من 1% (تحديداً 0.97%). وهذا يعني أن الروبوت يصبح أذكى دون أن يصبح ثقيلاً أو بطيئاً. علاوة على ذلك، عندما اختبر الباحثون "خيال" الروبوت، وجدوا أن SelfWAM كان أفضل بكثير في التنبؤ بالمستقبل. إذا أخبروا الروبوت بتحريك ذراعه قليلاً للأعلى، أظهر خيال الروبوت الذراع وهي تتحرك للأعلى بشكل صحيح. أما النماذج القديمة فكانت غالباً ما ترتبك ولا تغير تنبؤاتها كثيراً، حتى عندما تتغير الحركة.
باختصار، يشير SelfWAM إلى أنه من خلال ربط خيال الروبوت بحركة جسده، وتعليمه تصور "ظله" وهو يتحرك عبر العالم، فإنه يصبح متعلماً أفضل بكثير. إنه يتعلم التمييز بين ما "فعله" الروبوت وبين ما حدث بمحض الصدفة. والنتيجة هي روبوت أسرع، وأكثر دقة، وأكثر قدرة على التكيف مع التغييرات في بيئته، كل ذلك مع الحفاظ على سرعة اتخاذ القرار كما هي تقريباً. إنها خطوة نحو روبوتات لا تكتفي بمجرد الاستجابة للعالم، بل تفهم حقاً كيف تشكل أفعالها هذا العالم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.