← أحدث الأبحاث
🤖 machine learning

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

يُعد SPEAR-1 نموذجاً تأسيسياً روبوتياً يحقق تحكماً تجسيدياً فائقاً من خلال تعزيز نموذج رؤية ولغة مُدرب مسبقاً بقدرات الاستدلال المكاني ثلاثي الأبعاد المُدرَّبة على بيانات غير روبوتية واسعة النطاق وموسومة ثلاثياً، مما يسمح له بالتفوق على النماذج الرائدة مع استخدام عروض توضيحية روبوتية أقل بمقدار 20 ضعفاً.

المؤلفون الأصليون: Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

نُشر 2026-04-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طفلاً كيف يلعب لعبة فيديو معقدة. معظم الأساليب الحالية تحاول تعليم الطفل من خلال جعله يشاهد ملايين الساعات من اللعب الاحترافي. في النهاية، يتعلم الطفل أي الأزرار يجب أن يضغطها، لكنه لا يفهم حقاً لماذا يضغطها. إذا حركت وحدة التحكم أو غيرت الإضاءة في الغرفة، يصاب الطفل بالذعر لأنه لا يفهم المساحة ثلاثية الأبعاد؛ هو فقط يعرف نمط الأزرار.

SPEAR-1 هي طريقة جديدة لتعليم الروبوتات تغير المنهج الدراسي. فبدلاً من مجرد تعليمها "كيف تتحرك"، فإنها تعلمها أولاً "كيف يعمل العالم".

إليك تفصيل كيفية قيامهم بذلك، باستخدام بعض التشبيهات البسيطة:

1. المشكلة: الروبوت "المُقلد"

معظم نماذج الروبوتات الأساسية (RFMs) الحالية تشبه المقلدين المهرة للغاية. فهي تنظر إلى فيديو لإنسان يحرك كوباً وتحاول محاكاة الحركة بدقة. ومع ذلك، ولأنها تتدرب على صور ثنائية الأبعاد (صور مسطحة)، فإنها تفتقر إلى "العمق المكاني". بالنسبة لها، الكوب ليس سوى مجموعة من البكسلات الملونة. إذا حركت الكوب بوصتين إلى اليسار أو غيرت لون الطاولة، يرتبك "المُقلد" لأن النمط ثنائي الأبعاد قد تغير.

2. الحل: مدرسة "الرؤية ثلاثية الأبعاد" (SPEAR-VLM)

قبل أن يسمح الباحثون للروبوت بلمس أي جسم حقيقي، أخضعوه لمعسكر تدريبي لـ "الوعي المكاني" يسمى SPEAR-VLM.

فكر في هذا كتعليم شخص كيفية التنقل في غرفة وهو معصوب العينين، باستخدام حاسة اللمس وخريطة ذهنية فقط. بدلاً من مجرد عرض صور مسطحة على النموذج، أعطوه "مستشعر عمق" (مثل المستشعرات الموجودة في السيارات ذاتية القيادة). ثم طرحوا عليه أسئلة مثل: "كم تبعد الملعقة عن الوعاء؟" أو "ما هي الزوايا ثلاثية الأبعاد لتلك الجزرة؟"

من خلال القيام بذلك باستخدام ملايين الصور العادية من الإنترنت (ليست حتى فيديوهات روبوت!)، طور النموذج "خريطة ذهنية ثلاثية الأبعاد". لقد تعلم أن الأشياء ليست مجرد أشكال مسطحة؛ بل هي أشياء صلبة توجد في عالم ثلاثي الأبعاد له طول وعرض وعمق.

3. النتيجة: "الرياضي الذكي" (SPEAR-1)

بمجرد أن امتلك النموذج هذا "الدماغ" ثلاثي الأبعاد، قدموه أخيراً لأذرع الروبوت الحقيقية. ولأن الروبوت كان يفهم بالفعل المساحة ثلاثية الأبعاد، لم يكن بحاجة لرؤية مليار مثال لكل حركة بمفردها.

معجزة "الكفاءة بمقدار 20 ضعفاً":
تخيل طالبين يدرسان لامتحان رياضيات.

  • الطالب (أ) (الطريقة القديمة) يحاول حفظ كل مسألة رياضية ممكنة في الكتاب المدرسي. يحتاج لرؤية 1,000,000 مسألة لينجح.
  • الطالب (ب) (SPEAR-1) يقضي وقتاً في تعلم قواعد الرياضيات أولاً. ولأنه يفهم المنطق، فإنه يحتاج فقط لرؤية 50,000 مسألة لينجح.

SPEAR-1 هو الطالب (ب). لقد حقق نفس النتائج (أو أفضل) التي حققتها أفضل روبوتات العالم مع استخدام بيانات عرض روبوتية أقل بـ 20 مرة.

لماذا يهم هذا؟

جمع البيانات من الروبوتات الحقيقية مكلف للغاية، وبطيء، ومرهق. عليك تحريك ذراع الروبوت مادياً آلاف المرات، مما قد يؤدي إلى تعطل الآلة أو يستغرق شهوراً من العمل البشري.

يثبت SPEAR-1 أنه يمكننا "الغش" في النظام. يمكننا أخذ الكم الهائل من الصور ثنائية الأبعاد والبيانات ثلاثية الأبعاد المتوفرة بالفعل على الإنترنت واستخدامها لمنح الروبوتات "بداية قوية". هذا يقربنا أكثر من مستقبل حيث يمكن للروبوتات الدخول إلى مطبخ جديد لم تره من قبل ومعرفة كيفية الإمساك بكوب دون الحاجة إلى إنسان ليعلمها كل حركة بمفردها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →