OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
تقدم هذه الورقة OpenWAM، وهو عبارة عن حزمة بحثية مفتوحة ونمطية تستقصي بشكل منهجي التدريب المسبق لنماذج العالم والعمل (World-Action Model) من خلال تجارب محكومة لاستخلاص مبادئ التصميم الأساسية، وصولاً إلى إصدار نموذج OpenWAM- عالي الأداء الذي تم تدريبه على 6,400 ساعة من البيانات المتجسدة المتنوعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إن الذكاء لا يقتصر فقط على رؤية العالم، بل يتعلق بمعرفة كيفية تغييره. فعلى مدى عقود، بنى العلماء أنظمة حاسوبية يمكنها التعرف على الأشياء في صورة فوتوغرافية أو وصف مشهد في جملة. وفي الآونة الأخيرة، ابتكروا نماذج يمكنها تخيل كيف قد يتطور المشهد بمرور الوقت، من خلال التنبؤ بالإطار التالي لمقطع فيديو بناءً على ما سبقه. تتعلم هذه الأنظمة فيزياء العالم — كيف تسقط الكأس، كيف يتأرجح الباب — من خلال مشاهدة كميات هائلة من مقاطع الفيديو. ومع ذلك، هناك فجوة بين مشاهدة العالم والعمل بداخله. فالروبوت يحتاج إلى ما هو أكثر من مجرد التنبؤ بما سيحدث؛ إنه يحتاج إلى معرفة الحركات المحددة التي ستجعل ذلك التنبؤ حقيقة. هذا هو تحدي التعلم المتجسد: سد الفجوة بين فهم المستقبل البصري وتوليد الأفعال الفيزيائية للوصول إليه.
قدم فريق من الباحثين نهجاً جديداً يسمى OpenWAM لحل هذه المشكلة. فبدلاً من بناء عقل روبوت واحد صلب يصعب تغييره أو فهمه، أنشأوا نظاماً مفتوحاً ونموذجياً يعامل تصميم وحدة التحكم في الروبوت كمجموعة من الأجزاء القابلة للتبديل. لقد قسموا المهمة المعقدة لتعليم الروبوت كيفية التصرف إلى ثلاثة أسئلة متميزة: ما هي المعرفة التي يجب أن يرثها الروبوت من مشاهدة الفيديوهات، كيف يجب أن يعمل فهم الروبوت للعالم وقدرته على الحركة معاً، وكيف يمكن توسيع نطاق هذا التعلم عبر أنواع مختلفة من الروبات والبيئات؟ ومن خلال الإجابة على هذه الأسئلة عبر تجارب منضبطة، استخلصوا مجموعة من المبادئ التي أدت إلى إنشاء OpenWAM-α، وهو نموذج جديد قوي يمكنه تعلم كيفية التحكم في الأشياء في كل من البيئات المحاكية والواقع الحقيقي.
بدأ الباحثون بالتساؤل عن نوع "معرفة العالم" التي يجب أن يبدأ بها الروبوت. فقد اختبروا ما إذا كان ينبغي للروبوت أن يتعلم من مولد فيديوهات ضخم شاهد ملايين الساعات من اللقطات، أم إذا كان يجب أن يعتمد على مشفر بصري أبسط. ووجدوا أن أفضل النتائج جاءت من استخدام مولد فيديوهات ضخم ومُدرب مسبقاً كقاعدة أساسية. هذا النموذج يفهم بالفعل كيف تتحرك الأشياء وتتفاعل، مما يوفر بداية غنية. ومع ذلك، لم يكن مجرد إلحاق ذراع روبوت بهذا النموذج كافياً. فقد اكتشف الباحثون أن الروبوت يحتاج أيضاً إلى طريقة مدمجة وفعالة لتمثيل ما يراه. واختبروا طرقاً مختلفة لضغط المعلومات البصرية في شكل أصغر وأكثر قابلية للإدارة، ووجدوا أن نوعاً معيناً من الضغط الذي يحتفظ بالتفاصيل الجوهرية للعالم مع التخلص من الضجيج كان هو الأفضل. سمح هذا للروبوت بالتركيز على الأجزاء المهمة من المشهد دون أن يغمره تدفق البيانات.
بعد ذلك، بحث الفريق في كيفية هيكلة "عقل" الروبوت لربط فهمه للعالم بقدرته على الحركة. وقارنوا بين تصميمات معمارية مختلفة، تتراوح من النماذج التي تكون فيها أجزاء الفيديو والعمل منفصلة تماماً إلى تلك التي تكون فيها متداخلة بعمق. وأظهرت تجاربهم أن التصميم الأكثر فعالية كان نهج النظام المزدوج. في هذا الإعداد، يركز جزء من النموذج على التنبؤ بالحالة البصرية المستقبلية للعالم، بينما يركز جزء مخصص على توليد تسلسل الحركات. والأهم من ذلك، أن هذين الجزءين كانا مسموحاً لهما بالتواصل مع بعضهما باستمرار؛ حيث يمكن لمولد الأفعال النظر في المستقبل المتوقع لاتخاذ القرار، ويمكن لمتنبئ العالم استخدام الأفعال المخطط لها لتنقيح رؤيته لما سيحدث تالياً. هذا الحوار المستمر ثنائي الاتجاه سمح للنموذج بتعلم تآزر حقيقي بين الرؤية والعمل، بدلاً من مجرد تعلمهما جنباً إلى جنب.
استكشف الباحثون أيضاً كيفية تدريب هذه النماذج باستخدام أنواع مختلفة من البيانات. كان لديهم مصدران رئيسيان: فيديوهات لبشر يؤدون مهام من منظور الشخص الأول، والتي قدمت تنوعاً واسعاً من المشاهد البصرية ولكن بدون بيانات حركة روبوتية، وتسجيلات لروبوتات فعلية تؤدي مهام، والتي وفرت تعليمات حركة دقيقة ولكنها غطت مشاهد أقل تنوعاً. واختبروا ما إذا كان من الأفضل التدريب على بيانات الروبوت وحدها، أو بيانات البشر وحدها، أو مزيج منهما. ووجدوا أن دمج المصدرين في جلسة تدريب واحدة كان الاستراتيجية الأكثر قوة؛ حيث علمت الفيديوهات البشرية النموذج عن التنوع الواسع للعالم، بينما قامت بيانات الروبوت بترسيخ تلك المعرفة في الواقع الفيزيائي. هذا الجمع سمح للنموذج بالتعميم بشكل أفضل بكثير في مواقف جديدة وغير مرئية مما لو تم تدريبه على نوع واحد فقط من البيانات.
باستخدام هذه المبادئ، بنى الفريق OpenWAM-α، وهو نموذج تم تدريبه على أكثر من 500 مليون إطار من بيانات الفيديو والروبوت. واختبروا هذا النموذج عبر ثمانية معايسات محاكاة مختلفة وعلى روبوتات حقيقية بذراع واحدة، وذراعين، وحتى أيدٍ بشرية المهارة. كانت النتائج متسقة ومبهرة؛ ففي عمليات المحاكاة، حقق النموذج مستوى رفيعاً عبر مجموعة واسعة من المهام، من تكديس الكتل إلى التحكم في أشياء معقدة. وعند نقله إلى العالم الحقيقي، حافظ على هذا الأداء العالي، حيث نجح في إتمام المهام على روبوتات فيزيائية لم يرها من قبل. أظهر النموذج قوة خاصة في التكيف مع البيئات الجديدة، مما يشير إلى أن الجمع بين المعرفة بالعالم القائمة على الفيديو والتأسيد القائم على الفعل قد خلق أساساً متيناً للذكاء العام.
كان أحد أهم النتائج هو كيفية مقارنة هذا النهج بالأساليب الشائعة الأخرى. تعتمد بعض الأنظمة بشكل كبير على اللغة والفهم البصري لكنها لا تصيغ المستقبل بشكل صريح، بينما تركز أنظمة أخرى بحت على ميكانيكا الحركة. وجد الباحثون أن نهجهم القائم على الفيديو يتفوق في ملاءمة بيانات التدريب والأداء الجيد في الإعدادات المألوفة، بينما كانت الطرق الأخرى أحياناً تعمم بشكل أفضل في البيئات الجديدة والفوضوية تماماً. ومع ذلك، خلصوا إلى أنه لا يوجد نهج مثالي بمفرده؛ فالمفتاح للتقدم المستقبلي يكمن في دمج نقاط القوة في كليهما: استخدام المعارف البصرية والفيزيائية الغنية لتوليد الفيديو لتوجيه الفعل، مع ضمان تدريب النظام على بيانات متنوعة وعالية الجودة تغطي النطاق الكامل لتحديات العالم الحقيقي.
مشروع OpenWAM لا يقدم مجرد وحدة تحكم جديدة للروبوت، بل يقدم مجموعة أدوات كاملة للمجتمع العلمي. فمن خلال إتاحة البنية التحتية، وبيانات التدريب، وبروتوكولات التقييم، حول الباحثون تطوير نماذج "العالم-الفعل" إلى علم شفاف وقابل للتكرار. وهذا يسمح للعلماء الآخرين باختبار أفكار محددة، واستبدال المكونات، وفهم السبب وراء تفوق تصميمات معينة على غيرها بدقة. ويشير العمل إلى أن الطريق نحو روبوتات أكثر قدرة ليس من خلال بناء أنظمة أكبر وأكثر غموضاً، بل من خلال الفهم الدقيق لكيفية تفاعل قطع المعرفة والتعلم المختلفة. ومن خلال التعامل مع عقل الروبوت كمجموعة من الأجزاء القابلة للتركيب، فتح الباحثون الباب أمام عصر جديد من الاستكشاف المنهجي في الذكاء الاصطناعي، حيث يمكن اختبار كل خيار تصميمي، وقياسه، وتحسينه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.