← أحدث الأبحاث
💻 computer science

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

يقدم نموذج JEPA-WAM نموذج عمل عالمي كامن مبني على فضاء V-JEPA مدرب مسبقاً يوحد بين التنبؤ المستقبلي ذو البنية المكانية وتوليد الأفعال المستمرة من خلال متنبئ مشترك، محققاً أداءً رائداً في معايير قياس التلاعب الروبوتي دون الحاجة إلى تدريب مسبق للسياسات على نطاق واسع.

المؤلفون الأصليون: Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

نُشر 2026-08-11
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيفية الطبخ. يمكنك ببساطة أن تريه مقطع فيديو لطاهٍ يقطع البصل وتقول له: "افعل مثله". ولكن إذا قام الروبوت فقط بحفظ المظهر الدقيق لذلك الفيديو المحدد، فقد يصاب بالذعر إذا ارتدى الطاهي قبعة مختلفة أو إذا تغيرت أضواء المطبخ. هذا هو تحدي نماذج (الرؤية-اللغة-الفعل) أو ما يعرف بـ VLA: فهي بارعة في اتباع التعليمات في البيئات المألوفة، لكنها غالباً ما تتعثر عندما يبدو العالم مختلفاً قليلاً عما تدربت عليه.

لإصلاح ذلك، حاول العلماء تعليم الروبوتات أن تكون "متوقعة". فبدلاً من مجرد الاستجابة، يحاول الروبوت تخيل ما سيحدث بعد ذلك. إذا كان بإمكانه التنبؤ بأن "إذا دفعت هذا الكوب، فسوف ينزلق عن الطاولة"، فبإمكانه التخطيط بشكل أفضل. ومع ذلك، فإن جعل الروبوت يُنشئ فيديوهات كاملة وعالية الدقة للمستقبل يشبه مطالبة طالب بكتابة رواية كاملة لمجرد تقرير ما سيفعله تالياً—فهذا يستغرق الكثير من الوقت وقوة الحوسبة. لذا، بحث الباحثون عن اختصار: نموذج "كامن" يتنبأ بـ فكرة المستقبل دون رسم الصورة بأكملة. ولكن هنا تكمن المشكلة: العديد من هذه الاختصارات إما تفقد الكثير من التفاصيل أو تعامل التنبؤ والفعل كمهمتين منفصلتين وغير متصلتين.

هذا يقودنا إلى JEPA-WAM، وهو نهج جديد يحاول تعليم الروبوتات كيف "تشعر" بتدفق الوقت دون أن تغرق في رسم كل إطار على حدور. إنه يطرح سؤالاً بسيطاً: هل يمكننا تعليم الروبوت كيف يفهم كيف يتغير العالم، واستخدام هذا الفهم للتحرك بشكل أفضل، كل ذلك في حركة واحدة سلسة؟


اختصار "حس الزمن" للروبوت

تعرف على JEPA-WAM. فكر فيه كروبوت لا يكتفي فقط بالنظر إلى صورة للحاضر وتخمين الصورة التالية؛ بل يتعلم العلاقة بين الاثنين.

تخيل أنك تشاهد خدعة سحرية. يضع ساحر كرة حمراء في صندوق، ثم يخرج كرة زرقاء. الروبوت التقليدي قد يحفظ فقط "كرة حمراء ← كرة زرقاء". لكن JEPA-WAM يشبه المحقق الذي يلاحظ الانتقال: "الكرة الحمراء اختفت، الصندوق اهتز، وظهرت كرة زرقاء". إنه يتعلم قصة التغيير، وليس فقط ما قبل وما بعد.

بنى الباحثون هذا النظام فوق "دماغ رؤية" مدرب مسبقاً يسمى V-JEPA. يمكنك التفكير في V-JEPA كروبوت شاهد بالفعل ملايين الفيديوهات وتعلم كيف تتحرك الأشياء وتتفاعل. يأخذ JEPA-WAM هذا الدماغ ويضيف إليه وحدة "سفر عبر الزمن" خاصة.

إليك الخدعة السحرية: بدلاً من مطالبة الروبوت بإنشاء فيديو ضبابي للمستقبل (وهو أمر بطيء ومكلف)، يطلب JEPA-WAM من الروبوت التنبؤ بـ خريطة مشتركة. تخيل أخذ صورة للمطبخ الآن وصورة للمطبخ بعد خمس ثيوانٍ، ووضعهما فوق بعضهما البعض. لا يحاول JEPA-WAM رسم صورة المستقبل من الصفر، بل ينظر إلى الفرق بين الصورتين المتراصتين ويتعلم بدقة كيف تحركت البكسلات. إنه يتعلم أن "الكوب تحرك بوصتين لليسار" وأن "الدرج فُتح"، مما يحافظ على التفاصيل الدقيقة لـ أين حدثت الأشياء.

الدماغ المشترك: متنبئ واحد، وظيفتان

الجزء الأكثر ذكاءً في JEPA-WAM هو كيفية استخدام دماغه. في العديد من الأنظمة القديمة، كان الجزء الذي يتنبأ بالمستقبل والجزء الذي يحرك أذرع الروبوت مثل شخصين مختلفين يتحدثان عبر جدار؛ أحدهما يخمن المستقبل، والآخر يحاول الاستماع.

يستخدم JEPA-WAM متنبئاً مشتركاً. تخيل طالباً واحداً ذكياً جداً يؤدي اختباراً:

  1. المهمة أ: ينظر الطالب إلى المشهد الحالي ويتنبأ بكيفية تغير العالم ("حس الزمن").
  2. المهمة ب: يستخدم الطالب نفس هذا الفهم ليقرر كيف يحرك أذرع الروبوت ("الفعل").

ولأن الطالب يقوم بكلتا المهمتين في نفس الوقت، فإن تعلم التنبؤ بالمستقبل يشكل مباشرة كيفية اتخاذ قرار الحركة. تشير الورقة البحثية إلى أن هذا الاقتران الوثيق يجعل الروبوت أكثر ذكاءً. إنه مثل الراقص الذي لا يحفظ الخطوات فحسب، بل يفهم إيقاع الموسيقى؛ فتكون الحركة انسيابية لأن التنبؤ والفعل ينبعان من نفس الفهم.

هل ينجح الأمر حقاً؟

اختبر الباحثون هذه الفكرة في ثلاثة عوالم مختلفة: محاكاة للعبة فيديو قياسية، محاكاة أكثر فوضوية مع أشياء عشوائية، وروبوت حقيقي بذراع في مختبر.

في عمليات المحاكاة:
في اختبار معيار يسمى LIBERO-Plus، والذي يختبر مدى قدرة الروبوتات على التعامل مع التغيرات في البيئة (مثل اختلاف الإضاءة أو مواقع الأشياء)، سجل JEPA-WAM نسبة 79.2%. وكانت هذه هي النتيجة الأفضل بين الروبوتات التي لم يتم تدريبها مسبقاً على كميات هائلة من بيانات الروبوتات. والأكثر إثارة للإعجاب هو أنه عندما طبقوا خدعة "حس الزمن" هذه على دماغ روبوت قوي بالفعل يسمى π0.5، قفزت النتيجة من 84.5% إلى 86.3%. وهذا يشير إلى أنه حتى الروبوتات الذكية يمكن أن تصبح أكثر ذكاءً إذا تعلمت التنبؤ بتدفق الوقت.

في العالم الحقيقي:
أخذ الفريق الروبوت الخاص بهم إلى مختبر حقيقي مع إعداد ذي ذراع مزدوجة (ذراعان آليتان تعملان معاً). طلبوا منه القيام بمهام مثل تكديس الكتل، أو وضع الفاكهة على طبق، أو فتح درج.

  • عندما كان الإعداد مطابقاً تماماً لما هو متوقع (داخل التوزيع - In-Distribution)، سجل JEPA-𝗪𝗔𝗠 حوالي 59.8%.
  • عندما عبثوا بالخلفية أو حركوا الأشياء حولها (خارج التوزيع - Out-of-Distribution)، تمكن JEَّ𝗔-𝗪𝗔𝗠 من تحقيق 54.2%.
  • بالمقارنة، فإن الروبوت القياسي (π0) انخفض من 51.8% إلى 22.5% مهتزة عندما تغيرت البيئة.

يظهر هذا أن JEPA-WAM أكثر قوة ومتانة. فهو لا يحفظ مشهداً معيناً فحسب، بل يتعلم منطق كيفية تحرك الأشياء، لذا يمكنه التعامل مع المفاجآت.

ما ليس عليه (وما يستبعده)

توضح الورقة البحثية بعناية ما ليس JEPA-WAM.

  • هو ليس مولداً للفيديو. فهو لا يحاول إنشاء فيديو جديد عالي الدقة للمستقبل. ويرى المؤلفون أن محاولة توليد كل بكسل هي عملية مكلفة وغير ضرورية غالباً للتحكم في الروبوت.
  • هو ليس مجرد تنبؤ بالحالة النهائية. اختبر الباحثون نسخة تنظر فقط إلى صورة "المستقبل" دون صورة "الحاضر"، وكان أداؤها أسوأ (77.3% مقابل 79.2%). وهذا يثبت أن فهم العلاقة بين "الآن" و"لاحقاً" أكثر أهمية من مجرد تخمين النتيجة النهائية.
  • هو ليس حلاً سحرياً لكل شيء. يشير المؤلفون إلى أنه إذا أدى نفس المشهد البصري إلى نتيجتين مختلفتين تماماً بناءً على تعليمات محددة (مثلاً: "ادفع الكوب" مقابل "اسحب الكوب")، فقد يواجه النموذج صعوبة لأنه يركز على التغيرات البصرية بدلاً من الأهداف المرتبطة باللغة.

الخلاصة

يشير JEPA-WAM إلى أن سر جعل الروبوتات أكثر قدرة على التكيف ليس مجرد إعطائها المزيد من البيانات أو أدمغة أكبر، بل تعليمها فهم تدفق الوقت بطريقة توجه أفعالها مباشرة. من خلال استخدام دماغ مشترك للتنبؤ بكيفية تغير العالم واتخاذ قرار الحركة، يصبح الروبوت أشبه بإنسان ماهر يمكنه التكيف مع مطبخ فوضوي دون ذعر.

تشير النتائج، التي تم قياسها في عمليات المحاكاة والتجارب الواقعية، إلى أن نهج "التنبؤ المشترك" هذا هو طريقة قوية لبناء روبوتات يمكنها التعامل مع الطبيعة غير المتوقعة للعالم الحقيقي. وبينما لا يعد هذا حلاً نهائياً لكل مهمة ممكنة، إلا أنه يفتح مساراً واعداً لبناء روبوتات ليست مجرد مطيعة، بل قابلة للتكيف حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →