← أحدث الأبحاث
💻 computer science

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

يقترح MoWM إطار عمل لخليط من نماذج العالم يعزز تخطيط العمل المجسد من خلال دمج التمثيلات الكامنة المدركة للحركة مع ميزات فضاء البكسل دقيقة التفاصيل لالتقاط كل من الديناميكيات المدمجة والتفاصيل المرئية ذات الصلة بالعمل.

المؤلفون الأصليون: Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية طي قميص (T-shirt) أو التقاط مكعب محدد. للقيام بذلك، يحتاج الروبوت إلى شيئين: رؤية فائقة الدقة (لرؤية حواف القماش بدقة متناهية) وإحساس بالحركة (لفهم كيف تتحرك الأشياء وتتدفق عند لمسها).

وجد الباحثون أن الروبوتات الحالية تعاني عادةً لأنها تختار نمط "عين" واحد وتتجاهل الآخر. تقدم هذه الورقة البحثية MoWM، وهي وسيلة لمنح الروبوتات "رؤية هجينة".

إليك التفاصيل باستخدام تشبيه بسيط.

المشكلة: "المصور" مقابل "المخرج"

تخيل أنك تحاول تعلم رقصة معقدة من خلال مشاهدة نوعين مختلفين من الفيديوهات:

  1. المصور (نماذج العالم القائمة على البكسل - Pixel-based World Models): هذا الفيديو فائق الدقة. يمكنك رؤية كل مسام على جلد الراقص وكل خيط في ملابسه. إنه فيديو جميل، لكنه يحتوي على معلومات كثيرة جداً. تقضي وقتاً طويلاً في النظر إلى ورق الحائط في الخلفية أو نسيج الأرضية لدرجة أنك تفقد تتبع حركة الراقص الفعلية. أنت "تضيع في التفاصيل".
  2. المخرج (نماذج العالم القائمة على التمثيل الكامن - Latent-based World Models): هذا الفيديو يشبه رسماً تخطيطياً ضبابياً ومجرداً. لا يمكنك رؤية وجه الراقص، لكن يمكنك رؤية تدفق الحركة بشكل مثالي. أنت تفهم الإيقاع والاتجاه، لكن لا يمكنك رؤية أين تلمس يد الراقص الأرض بالضبط. لديك "الجو العام"، لكنك تفتقر إلى الدقة.

عادة ما تختار الروبوتات الحالية واحداً منهما: فإما أن تتشتت بسبب "ورق الحائط" (الخلفية) أو تكون "ضبابية" جداً بحيث لا تستطيع أداء المهام الدقيقة.


الحل: MoWM (الـ "تراكب الذكي")

ابتكر الباحثون MoWM (خليط نماذج العالم - Mixture-of-World-Models). بدلاً من جعل الروبوت يختار، سمحوا له باستخدام كليهما في نفس الوقت من خلال عملية تسمى تعديل الميزات (Feature Modulation).

فكر في الأمر كأنك تستخدم نظارات الواقع المعزز (AR):

  • ينظر الروبوت من خلال عيني المصور ليرى العالم عالي الدقة.
  • لكنه يرتدي نظارات المخرج للواقع المعزز التي تضع "إبرازات الحركة" فوق الرؤية.

عندما يرى الروبوت قطعة من القماش، يقوم جزء "المخرج" في دماغه بتحديد المسار الذي ستتخذه قطعة القماش عند تحريكها، بينما يخبره جزء "المصور" بمكان حافة القميص بالضبط. ومن خلال دمج هذين الاثنين، يتجاهل الروبوت "الضجيج" (الخلفية الثابتة) ويركز فقط على "الإشارة" (الأجزاء من الصورة التي تهم المهمة فعلياً).


هل نجح الأمر؟

اختبر الباحثون ذلك بطريقتين:

  1. في ملعب رقمي (CALVIN): أعطوا الروبوت تسلسلات طويلة ومعقدة من المهام (مثل لعبة البحث عن الكنز). تفوق MoWM على معظم الطرق الأخرى، خاصة في المهام الطويلة حيث "يفقد الروبوت طريقه" عادةً.
  2. في العالم الحقيقي: أعطوا ذراع روبوت حقيقية مهمة صعبة للغاية: طي قميص (T-shirt) ليصبح مستطيلاً مرتباً. ولأن الروبوت استطاع رؤية التفاصيل الدقيقة للقماش مع فهم "تدفق" حركة الطي، فقد نجح في المهمة.

ملخص "طويل جداً؛ لم أقرأ" (TL;DR)

معظم الروبوتات إما تركز بشدة على التفاصيل الصغيرة (وتفقد الصورة الكبيرة) أو تركز بشدة على الصورة الكبيرة (وتفقد التفاصيل الصغيرة). يعمل MoWM كفلتر ذكي يجمع بين الرؤية عالية الدقة والإحساس بالحركة، مما يسمح للروبوتات بأداء مهام معقدة ودقيقة بنجاح أعلى بكثير.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →