← أحدث الأبحاث
🤖 AI

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

يُعد AcrossVAM1.0 نموذجاً خفيفاً للفيديو المعتمد على النصوص والمساعد في الأفعال، يعمل على تحسين التنبؤ بالفيديو للروبوتات من خلال تحليل الإطارات المستقبلية إلى ديناميكيات جسيمات متمحورة حول الأشياء ومظهر كثيف، مما يثبت أن نمذجة الجسيمات الصريحة تقلل من خطأ المسار رغم القيود الحالية في الربط اللغوي والجودة الإدراكية.

المؤلفون الأصليون: Yafei Zhang, Nan Wu

نُشر 2026-08-31
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yafei Zhang, Nan Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لفهم كيف يمكن للروبوت أن يتعلم رؤية المستقبل، يجب علينا أولاً أن نفهم كيف يرى الحاضر. في عالم الذكاء الاصطناعي الفيزيائي، لا يقوم الروبوت بمجرد معالجة صورة ثابتة؛ بل يجب عليه توقع كيفية تغير تلك الصورة عندما يتفاعل مع العالم. هذا هو تحدي التنبؤ بالفيديو: تعليم الآلة كيف تنظر إلى مشهد وتخمن ما سيحدث في اللحظات القليلة القادمة. بالنسبة للإنسان، هذه غريزة طبيعية؛ فإذا رأيت كوباً على حافة طاولة، فأنت تعرف أنه سيسقط إذا دُفع. أما بالنسبة للروبوت، فإن هذا يتطلب محاكاة داخلية معقدة؛ إذ يجب عليه فصل أجزاء المشهد التي ستتحرك عن الأجزاء التي ستظل ثابتة، ويجب أن يفهم أن أمراً بسيطاً مثل "التقط المكعب الأزرق" يمكن أن يؤدي إلى نتائج بصرية مختلفة تماماً اعتماداً على ذراع الروبوت والبيئة المحيطة. الهدف ليس مجرد إنشاء صورة جميلة للمستقبل، بل إنشاء خريطة حركة موثوقة يمكن للروبوت استخدامها لتخطيط أفعاله بأمان وفعالية.

لقد اتبع الباحثون في "Across Physical AI" والأكاديمية الصينية للعلوم نهجاً جديداً لهذه المشكلة من خلال نظام أطلقوا عليه اسم "AcrossVAM1.0". فبدلاً من محاولة التنبؤ بكل بكسل في إطار الفيديو دفعة واحدة، وهو ما يؤدي غالباً إلى نتائج ضبابية أو مشوشة، قاموا بتفكيك المهمة إلى وظيفتين متميزتين. لقد أدركوا أنه في فيديو الروبوت النموذجي، يكون معظم الصورة في الواقع ثابتاً؛ فالطاولة، والجدار، والأرضية لا تتحرك؛ فقط ذراع الروبوت، وقبضته، والشيء الذي يحمله هي التي تغير موقعها. صمم الفريق نموذجاً يعامل هذه الأجزاء المتحركة كجسيمات دلالية متميزة. تخيل ذراع الروبوت وقبضته ليس كتدفق مستمر من البكسلات، بل كبضعة أشياء محددة يتم تتبعها، لها مواقع وأحجام وسرعات خاصة بها. يركز النموذج قدرته الحسابية على التنبؤ بدقة بكيفية تحرك هذه الأجزاء المتحركة القليلة عبر الفضاء، بينما يعامل بقية المشهد كخلفية مستقرة.

يعمل النظام أولاً من خلال النظر في أربعة إطارات من الفيديو وتعليمة مكتوبة، مثل "التقط المكعب الأزرق". يستخدم النظام نظام رؤية مدرباً ومجمداً لتحديد الروبوت، وذراعه، وقبضته، وتحويلها إلى نقاط بيانات بسيطة تصف مكانها وحجمها. ثم يأخذ "عقل صغير وفعال"، يحتوي على 0.28 مليون معلمة قابلة للتدريب فقط، نقاط البيانات هذه ويحسب أين ستكون في اللحظات الخمس القادمة. هذا الجزء من النموذج يركز حصرياً على الحركة ويوجه بواسطة التعليمات النصية، مما يضمن أن الحركة المتوقعة تتوافق بالفعل مع الأمر المعطى. وبمجرد أن يحدد النموذج مسار الأجزاء المتحركة، تبدأ عملية ثانية منفصلة لملء التفاصيل؛ حيث يأخذ آخر إطار معروف من الفيديو ويستخدمه لاستعادة الأنسجة والألوان الدقيقة للخلفية الثابتة، مما يضمن أن يبدو الجدار والطاولة حادين وواقعيين. أخيراً، تقوم آلية دمج ذكية بدمج حركة الروبوت المتوقعة مع الخلفية الثابتة عالية الجودة، لإنشاء فيديو كامل للمستقبل.

تظهر نتائج هذا النهج مقايضة واضحة بين الحركة وجودة الصورة. فعندما اختبر الباحثون النموذج على معيار لحركات الروبوت الحقيقية، أدى التنبؤ القائم على الجسيمات إلى تحسين دقة الحركة نفسها بشكل كبير. انخفض الخطأ في مسار ذراع الروبوت بنسبة 21.0 بالمائة مقارنة بطريقة بسيطة تفترض عدم تحرك أي شيء. نجح النموذج في التنبؤ بمسار الذراع والقبضة بدقة أكبر بك jauh من الطرق السابقة التي حاولت تخمين الصورة بأكملها دفعة واحدة. ومع ذلك، فإن النموذج ليس مثالياً؛ فبينما يتفوق في تحريك أجزاء الروبوت بشكل صحيح، فإنه لا يزال يعاني قليلاً من جودة الصورة الإجمالية. في الاختبارات التي تقيس مدى تشابه الفيديو المتوقع مع الفيديو الحقيقي، سجل النموذج الجديد درجة أقل قليلاً من الطريقة البسيطة التي تكتفي بنسخ الإطار الأخير، لا سيما في كيفية تعامله مع الأنسجة الدقيقة للمشهد. وجد الباحثون أنه بينما يمكن للنموذج اتباع التعليمات النصية لتحريك الروبوت، فإن العلاقة بين اللغة والمسار المحدد المتبع لا تزال ضعيفة؛ حيث إن تغيير التعليمات بشكل طفيف لم يغير المسار المتوقع في معظم الحالات.

يسلط هذا العمل الضوء على رؤية جوهرية حول تعليم الروبوتات الرؤية: غالباً ما يكون من الأفضل فهم حركة أشياء محددة بدلاً من محاولة التنبؤ بكل بكسل في المشهد في آن واحد. من خلال فصل مهمة التنبؤ بالحركة عن مهمة استعادة تفاصيل الصورة، أنشأ الباحثون نظاماً خفيفاً وقابلاً للتفسير؛ إذ يمكنهم النظر إلى "الجسيمات" الداخلية ورؤية ما يعتقد الروبوت أنه يتحرك بالضبط وإلى أين يعتقد أنه ذاهب. وبينما لا يزال النظام غير جاهز لاستبدال جميع الأساليب الحالية، حيث لا يزال بحاجة إلى تحسين قدرته على توليد صور واقعية والالتزام الصارم بالأوامر اللغوية المعقدة، إلا أنه يقدم اتجاهاً جديداً واعداً. إنه يشير إلى أن مستقبل رؤية الروبوت قد يكمن في نماذج بسيطة ومنظمة تفهم فيزياء الأجزاء المتحركة، بدلاً من الأنظمة الضخمة والمعقدة التي تحاول حفظ كل تفصيل في المشهد. ويتضمن المسار المستقبلي تحسين كيفية دمج هذين التدفقين من المعلومات — الأجزاء المتحركة والخلفية الثابتة — وإيجاد طرق لجعل فهم الروبوت للغة أكثر قوة وموثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →