Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions
تقدم هذه الورقة مراجعة شاملة ومنهجية للنماذج التأسيسية في مجال الروبوتات، حيث تتبع تطور المجال عبر خمس مراحل بحثية، وتقدم تصنيفاً مفصلاً لأنواع النماذج وبنياتها ونماذج التعلم، وتحلل مجموعات البيانات والتطبيقات، وتحدد التحديات الراهنة واتجاهات البحث المستقبلية.
تخيل عالماً تكون فيه الروبوتات مثل أدوات صلبة وحيدة الغرض: محمصة لا تستطيع إلا التحميص، ومكنسة لا تستطيع إلا تنظيف الأرضيات، وذراع مصنع لا يمكنها إلا ربط مسمار واحد محدد. لعقود من الزمن، كان هذا هو واقع الروبوتات؛ فقد كانت بارعة في وظيفتها الواحدة، لكنها كانت تائهة تماماً إذا طلبت منها القيام بأي شيء مختلف قليلاً أو إذا تغيرت البيئة المحيطة بها. ولكن مؤخراً، دخل نوع جديد من "الأدمغة" إلى المشهد، وهو ما غير كل شيء. تُسمى هذه الأدمغة "النماذج التأسيسية" (Foundation Models). فكر فيها كطلاب أذكياء للغاية ومطلعين على الإنترنت، قرأوا كل كتاب تقريباً، وشاهدوا كل فيديو، ودرسوا كل صورة تقريباً على كوكب الأرض قبل أن يخطوا خطوة واحدة داخل المختبر. ولأنهم شاهدوا الكثير، يمكنهم فهم العالم بطريقة عامة، بدلاً من مجرد اتباع كتاب قواعد صارم. وعندما تجمع هذه الأدمغة "العالمة بكل شيء" مع جسد روبوت مادي، فإنك تحصل على شيء يمكنه فهم جملة بسيطة مثل "أنا جائع، هل يمكنك إحضار وجبة خفيفة لي؟"، ومن ثم يستطيع استنتاج كيفية المشي إلى المطبخ، وفتح الثلاجة، وإيجاد الطعام، وتقديمه لك، حتى لو لم يسبق له رؤية هذا المطبخ تحديداً. هذا هو الأفق المثير حيث يلتقي الذكاء الاصطناعي بالعمل المادي، وهو ما يعد بتحويل الروبوتات من آلات خرقاء ومتخصصة إلى رفقاء متكيفين ومفيدين.
هذه الورقة البحثية هي خريطة شاملة وضخمة لهذا الأفق الجديد. المؤلفون، وهم فريق من الباحثين من جامعات عبر أوروبا والولايات المتحدة، لم ينظروا فقط إلى نوع واحد من الروبوتات أو خدعة واحدة محددة؛ بل استعرضوا المشهد بأكرله حول كيفية تعليم هذه الأدمغة الضخمة للذكاء الاصطناعي التحكم في أجساد الروبوتات. لقد نظموا الأبحاث في السنوات القليلة الماضية في خمس "عصور" متميزة من التطور. بدأ الأمر ببساطة عبر توصيل أدوات الذكاء الاصطناعي الموجودة للرؤية واللغة، ثم انتقل إلى ربط تلك الأدوات ببعضها لوضع الخطط، ثم إلى تدريب الروبوتات على التعلم من خلال مراقبة البشر، وصولاً أخيراً إلى إنشاء روبوتات يمكنها تذكر التجارب السابقة، وتعلم مهارات جديدة فورياً، والعمل في العالم الحقيقي الفوضوي وغير المتوقع.
تعمل الورقة البحثية كموسوعة ضخمة، حيث تصنف مئات المشاريع البحثية المختلفة في فئات مرتبة. فهي تنظر إلى نوع "الدماغ" المستخدم (مثل المفكر النصي فقط، أو المراقب البصري فقط، أو نموذج الرؤية واللغة والعمل المدمج)، وكيف يتعلم الروبوت (عن طريق تقليد البشر، أو تجربة الأشياء والحصول على مكافآت، أو قراءة التعليمات)، وما الذي يفعله الروبوت فعلياً (مثل التنقل في غرفة، أو التقاط الأشياء، أو التحدث مع الناس). وقد وجد المؤلفون أنه بينما تعد هذه النماذج قوية للغاية ويمكنها التعميم في مهام جديدة، إلا أنها ليست مثالية بعد؛ إذ يمكن أن تكون بطيئة، وأحياناً "تهلوس" أو تخترع حقائق، وتواجه صعوبة في التفاصيل المادية للمس الأشياء وتحريكها بأمان. وتختتم الورقة بذكر أكبر العقبات المتبقية التي يجب تجاوزها، مثل الحاجة إلى مزيد من البيانات حول كيفية فشل الروبوتات وكيفية تعافيها، وتحدي جعل هذه الأنظمة سريعة بما يكفي للعمل في الوقت الفعلي. وفي النهاية، تشير هذه المراجعة إلى أنه بينما نبني الأساس لروبوتات ذكية حقاً، فإننا لا نزال في المراحل الأولى من معرفة كيفية جعلها موثوقة وآمنة بما يكفي لحياتنا اليومية.
ملخص تقني: النماذج التأسيسية في الروبوتات: مراجعة شاملة
بيان المشكلة
يشهد مجال الروبوتات تحولاً جذرياً من الحلول الثابتة، أحادية المهمة، والمتخصصة في نطاق محدد، نحو وكلاء متعددي الوظائف، تكيفي، وعام القدرة، قادرين على العمل في بيئات معقدة، مفتوحة، وديناميكية. وبينما توفر التحكمات التقليدية القائمة على النماذج كفاءة عالية في البيئات المنظمة، إلا أنها تفتقر إلى القدرة على التكيف. وفي المقابل، توفر أساليب تعلم الآلة (ML) القياسية قدرة عالية على التكيف، لكنها غالباً ما تتطلب مجموعات بيانات ضخمة وتفتقر إلى الفهم الدلالي اللازم للاستنتاج في العوالم المفتوحة. إن ظهور النماذج التأسيسية (FMs) — وهي شبكات عصبية واسعة النطاق مدربة على مجموعات بيانات ضخمة وغير متجانسة من الإنترنت — يعد بسد هذه الفجوة من خلال توفير قدرات غير مسبوقة في الفهم متعدد الوسائط، والتخطيط طويل الأمد، والتعميم عبر مختلف الهياكل الجسدية (cross-embodiment). ومع ذلك، أدى الانتشار السريع لتطبيقات النماذج التأسيسية في الروبوتات إلى خلق مشهد بحثي مجزأ؛ حيث تركز المسوحات الحالية غالباً بشكل ضيق على مهام أو نماذج أو مجالات تطبيقية محددة، وتفتقر إلى تصنيف منهجي متعدد المعايير يغطي الطيف الكامل للأساليب والبيانات والتحديات.
المنهجية
تعتمد هذه الدراسة منهجية مراجعة أدبية منظمة ومنهجية لرسم خريطة المشهد البحثي للنماذج التأسيسية في الروبوتات. تضمنت العملية ما يلي:
البحث الأدبي: تم إجراء استعلامات عبر ست قواعد بيانات علمية كبرى (IEEE Xplore، Google Scholar، Scopus، DBLP، arXiv، وWeb of Science) باستخدام كلمات مفتاحية مستهدفة (مثل "foundation model"، "robotics"، "vision-language-action") مدمجة مع معاملات منطقية (Boolean operators). وقد أعطت عملية البحث الأولوية للأعمال المنشورة في السنوات الخمس الماضية مع تضمين الدراسات الأساسية السابقة.
الفحص والاختيار: تضمنت عملية الفرز متعددة المراحل استبعاد النسخ المكررة، والأوراق غير الإنجليزية، والمقالات التي لا يتوفر لها نص كامل. احتفظ الاختيار النهائي بـ 438 مقالاً حيث عمل النموذج التأسيسي كمكون خوارزمي رئيسي مع مساهمات نظرية أو تجريبية جوهرية.
التحليل التصنيفي: تم تحليل الأدبيات المختارة من خلال تصنيف دقيق للغاية متعدد المعايير. فحصت المراجعة الأساليب بناءً على ستة معايير متميزة:
نوع النموذج التأسيسي (LLMs، VFMs، VLMs، VLAs).
بنية الشبكة العصبية الأساسية (Transformers، SSMs، Diffusion، CNNs، النماذج الرسومية).
نموذج التعلم (التعلم الخاضع للإشراف، التعلم ذاتي الإشراف، الضبط الدقيق، تكييف النطاق، التعلم بالتقليد، التعلم التعزيزي، التعلم داخل السياق/التعلم عبر التلقين، نماذج العالم، التعلم التوليدي).
مرحلة التعلم (ما قبل التدريب، الضبط الدقيق خارج الخط، التكيف عبر الإنترنت، التعلم المستمر).
المهمة الروبوتية (الإدراك، التخطيط، الملاحة، المناولة، التفاعل بين الإنسان والروبوت).
مجال التطبيق (التنقل الوكيل، المناولة الصناعية، عمليات الإمداد، روبوتات الخدمة، الروبوتات الطبية، الأنظمة الزراعية الإدراكية، وكلاء الأزمات، الروبوتات البحرية، روبوتات الفضاء).
توليف مجموعات البيانات: تم توليف مجموعات البيانات المتاحة علناً وتنظيمها حسب العائلات المتكررة، مع تفصيل استخداماتها النموذجية والفجوات الحالية فيها.
تحليل التحديات والتوجهات: تمت صياغة مناقشة هرمية فيما يتعلق بالتحديات المفتوحة الحالية واتجاهات البحث الواعدة في المستقبل.
ملاحظة: يصرح المؤلفون صراحةً بأن هذا المسح لا يتضمن مقارنة تجريبية/كمية للأساليب التي تمت مراجعتها، إقراراً منهم بأن هذا يعتبر لقطة لمجال يتطور بسرعة.
المساهمات الرئيسية
تقدم الورقة استقصاءً شاملاً ومنهجياً لمشهد النماذج التأسيسية الروبوتية، مقدمة المساهمات المحددة التالية:
الإطار التطوري: يحدد البحث تطور أبحاث النماذج التأسيسية الروبوتية إلى خمس مراحل متميزة:
المرحلة 1 (2018-2021): دمج نماذج معالجة اللغات الطبيعية (NLP) والرؤية الحاسوبية (CV) الأصلية لدعم الإدراك.
المرحلة 2 (2021-2022): التخطيط المرتكز على تمثيلات الرؤية واللغة (VL).
المرحلة 3 (2022-2023): ظهور سياسات الرؤية واللغة والعمل (VLA) المرتكزة على الجسم، والمدربة على بيانات روبوتية واسعة النطاق.
المرحلة 4 (2023-2024): أنظمة قادرة على الذاكرة، وتكوين المهام المستقل، والنقل من الويب إلى الروبوت.
المرحلة 5 (2024-الحاضر): التعميم متعدد الحواس والنشر في العالم الحقيقي.
التصنيف متعدد المعايير: تم تقديم تصنيف شامل للأساليب عبر ستة معايير. تشمل النتائج الرئيسية ما يلي:
أنواع النماذج: تتفوق نماذج LLMs في الاستنتاج عالي المستوى ولكنها تفتقر إلى التجذر الفيزيائي؛ تقدم نماذج VFMs إدراكاً قوياً ولكنها متخصصة في نطاقات معينة؛ تعمل نماذج VLMs على الربط بين اللغة والرؤية ولكنها تتطلب سياسات خارجية؛ توفر نماذج VLAs سياسات نهاية إلى نهاية (end-to-end) ولكنها تواجه تكاليف عالية في البيانات وزمن الاستجابة (latency).
البنى (Architectures): تهيمن نماذج Transformers على المحاذاة متعددة الوسائط؛ توفر نماذج State-Space Models (SSMs) تعقيداً خطياً للتحكم في الوقت الفعلي؛ تمكن نماذج Diffusion توليد حركات دقيقة؛ وتدعم النماذج الرسومية الاستنتاج المهيكل.
نماذج التعلم: يتم تقديم توليف لتقنيات التعلم الخاضع للإشراف، والتعلم ذاتي الإشراف، والتعلم بالتقليد، والتعلم التعزيزي، والتعلم التوليدي، مع تسليط الضوء على المقايضات بين كفاءة العينات، والتعميم، والسلامة.
مشهد مجموعات البيانات: تقوم الورقة بتوليف مجموعات البيانات العامة، وتحديد التحول نحو مجموعات مسارات ضخمة عابرة للهياكل الجسدية (مثل Open X-Embodiment، AgiBot World) والمعايير المرجعية عالية الدقة في العالم الحقيقي. وتشير الورقة نقدياً إلى الفجوات الحالية، وتحديداً ندرة بيانات استشعار اللمس/القوة ونقص تسجيلات الفشل والاستعادة في مجموعات البيانات الموجودة.
مجالات التطبيق: تفصل المراجعة نشر النماذج التأسيسية عبر قطاعات متنوعة، بما في ذلك المناولة الصناعية (التعميم من الصفر لأجسام جديدة)، وروبوتات الخدمة (اتباع التعليمات باللغة الطبيعية)، والروبوتات الطبية (تقدير العمق الجراحي)، وروبوتات الفضاء (تحليل التضاريس المستقل).
التحديات والتوجهات المستقبلية: تحدد الورقة التحديات الحرجة، بما في ذلك زمن استجابة الاستدلال، ونقص التجذر الدلالي/الفيزيائي، وندرة البيانات، وتحيز الهيكل الجسدي، ومخاطر السلامة، وضرورات المواءمة الأخلاقية. كما تم اقتراح توجهات مستقبلية نحو التكامل متعدد الحواس، والنقل من المحاكاة إلى الواقع (sim-to-real)، والنشر القوي في العالم الحقيقي.
النتائج والرؤى
تكشف المراجعة أنه بينما قامت النماذج التأسيسية بإعادة تشكيل تصميم وبرمجة الروبوتات بشكل جذري، إلا أنها ليست حلاً متجانساً.
المقايضات: هناك مقايضة أساسية بين الاتساع الدلالي (الذي توفره نماذج LLMs و VLMs) والتنفيذ الجسدي في الوقت الفعلي (الذي توفره نماذج VFMs و VLAs). وتصبح الأنظمة الهجينة ضرورية بشكل متزايد لموازنة هذه السمات.
التعميم مقابل الدقة: تمكن النماذج التأسيسية من التعميم من الصفر (zero-shot) على أجسام وبيئات غير مرئية، مما يقلل غالباً من الحاجة إلى البرمجة الخاصة بكل مهمة. ومع ذلك، يأتي هذا على حساب تقليل دقة الحركة في المجالات المتخصصة وزيادة القابلية للهلوسة والفجوات المنطقية في التخطيط.
الاعتماد على البيانات: رغم الوعد الذي تقدمه النماذج "التأسيسية"، لا يزال المجال يعتمد بشدة على توافر مجموعات بيانات ضخمة وعالية الجودة ومتعددة الوسائط. وتظل ندرة بيانات الفشل في العالم الحقيقي وردود فعل اللمس عائقاً كبيراً أمام النشر القوي.
الاتجاه التطوري: ينتقل المجال من المسارات النمطية (إدراك وتحكم منفصلين) نحو سياسات عامة "نهاية إلى نهاية" تدمج الإدراك والاستنتاج والعمل ضمن بنية واحدة.
الأهمية
تدعي الورقة أهميتها كأول مسح يقدم استقصاءً شاملاً ومنهجياً وعالي التفصيل متعدد المعايير لكامل مشهد النماذج التأسيسية الروبوتية. وبخلاف الأعمال السابقة التي تركز على مجموعات فرعية محددة (مثل VLAs فقط أو المناولة فقط)، فإن هذه الدراسة:
توثق المسار التطوري الكامل للمجال، بما في ذلك التطورات الأخيرة حتى عام 2026.
توفر تصنيفاً مهيكلاً يسم يسمح للباحثين بمقارنة الأساليب عبر أنواع النماذج، والبنى، ونماذج التعلم، ومجالات التطبيق في آن واحد.
تولف الحالة الراهنة لمجموعات البيانات العامة، وتسلط الضوء على الفجوات الحرجة التي تعيق التقدم.
تقدم مناقشة شاملة حول التحديات والتوجهات المستقبلية، مما يجعلها بمثابة خارطة طريق للباحثين الذين يهدفون إلى نقل النماذج التأسيسية من النماذج البحثية الأولية إلى وكلاء روبوتات موثوقين في العالم الحقيقي.
يؤكد المؤلفون أنه بينما لا تقدم المراجعة معايير تجريبية جديدة، إلا أنها تضع فهماً تأسيسياً ضرورياً للحالة الراهنة للمجال، وحدوده، وإمكاناته، مما يسهل البحث والتطوير الأكثر استنارة في عصر النماذج التأسيسية للروبوتات.