← أحدث الأبحاث
💻 computer science

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

تقدم هذه الورقة البحثية EmbodiedVAE، وهو مشفر تلقائي تبايني (VAE) للفيديو يتميز ببنية ذات مشفر مزدوج ووحدة اتساق قائمة على النقل الأمثل، لتوليد تمثيلات كامنة مدمجة ومنفصلة تفصل حركة الروبوت عن الخلفية، مما يتيح تدريباً أكثر كفاءة وتحكماً دقيقاً لنماذج العالم الخاصة بالتلاعب المجسد.

المؤلفون الأصليون: Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

نُشر 2026-08-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية صنع شطيرة. أنت لا تريد فقط أن يرى الخبز واللحم؛ بل تحتاج إلى أن يفهم بدقة كيف تتحرك قبضته، وكيف ينزلق اللحم، وكيف يقطع السكين، كل ذلك مع تجاهل حقيقة أن طاولة المطبخ مائلة قليلاً أو أن الضوء يرتعش. هذا هو عالم "التعلم المتجسد" (Embodied Learning)، حيث يحاول الذكاء الاصطناعي التعلم من خلال التفاعل مع العالم المادي، تمامًا كما يفعل البشر. وللقيام بذلك بكفاءة، يستخدم العلماء نوعًا خاصًا من الدماغ الرقمي يسمى "نموذج الانتشار الكامن" (Latent Diffusion Model). فكر في هذه النماذج كحالمين أذكياء للغاية؛ فهي لا تحفظ كل بكسل في الفيديو (الذي سيكون بمثابة محاولة لتذكر كل حبة رمل على الشاطئ)، بل تضغط الفيديو إلى "حلم" تجريدي صغير أو تمثيل "كامن". هذا الحلم يلتقط جوهر ما يحدث. ومع ذلك، حتى الآن، كانت الأدوات المستخدمة لإنشاء هذه الأحلام مصممة لمشاهدة الأفلام أو الوثائقيات الطبيعية؛ فقد كانت بارعة في التقاط غروب الشمس أو مطاردة سيارات، لكنها كانت سيئة للغاية في فصل ذراع الروبوت المتحركة عن الفوضى في الخلفية. كان الأمر يشبه محاولة تتبع راقص معين في غرفة مزدحمة أثناء ارتداء نظارات ضبابية؛ حيث تضيع حركات الروبوت في الضجيج، مما يجعل من الصدد تعليم الروبوت مهارات دقيقة.

هنا يأتي دور اختراع جديد يسمى EmbodiedVAE. أدرك الباحثون وراء هذا المشروع أنه لتعليم روبوت كيفية التعامل مع الأشياء، فأنت بحاجة إلى نوع مختلف من "آلات الأحلام". لقد بنوا ضاغط فيديو جديدًا يعمل مثل نظارات سحرية ذات تركيز مزدوج. فبدلاً من سحق الفيديو بأك its بالكامل في كتلة واحدة فوضوية، يقوم هذا النظام الجديد تلقائيًا بفصل الفيديو إلى قصتين متمايزتين ومدمجتين للغاية: قصة واحدة تركز بالكامل على ذراع الروبوت وحركاتها الدقيقة، بينما تلتقط القصة الأخرى البيئة المحيطة. إنه يشبه وجود مخرج يخبر الكاميرا: "اقتربي بشدة من يد الروبوت لمشهد الحركة"، بينما يخبر كاميرا ثانية في الوقت نفسه: "فقط حافظي على الغرفة في الخلفية، لكن لا تقلقي بشأن التفاصيل". ومن خلال القيام بذلك، يصبح "حلم" الروبوت واضحًا وقابلًا للتحكم بشكل مذههل. وجد الباحثون أن هذا الفصل يسمح للروبوت بالتعلم بشكل أسرع والتحرك بدقة أعلى بكثير. وفي اختباراتهم، لم يكتفِ هذا الأسلوب بجعل الفيديو يبدو جيدًا فحسب، بل حسن أيضًا قدرة الروبوت على اتباع التعليمات بفارق كبير، حيث أظهر تحسنًا بنسبة 2 ديسيبل (2dB) في جودة الصورة مقارنة بأفضل الأساليب الموجودة. كما أثبتوا أن هذا النهج يعمل حتى عندما تشغل ذراع الروبوت جزءًا كبيرًا من الشاشة، وهو سيناريو تفشل فيه الأساليب القديمة عادةً.

السر وراء هذا النجاح هو بنية ذكية مكونة من جزأين. أولاً، يستخدم النظام إعداد "المشفر المزدوج" (Dual-Encoder). تخيل فنانين مختلفين ينظران إلى نفس الفيديو؛ أحدهما مهووس بذراع الروبوت، فيقترب منها جدًا بحيث يضغط الخلفية في رسم تخطيطي صغير وضبابي، والآخر مهووس بالغرفة، فيضغط حركة الروبوت في تدفق بسيط وسلس ليركز على الإضاءة والأثاث. ثم يسلم هذان الفنانان رسوماتهما إلى "مفكك تشفير" (Decoder) واحد يقوم بتجميعهما مرة أخرى في فيديو مثالي. هذا يضمن عدم اختلاط حركات الروبوت بضجيج الخلفية.

ولضمان بقاء حركات الروبوت سلسة وواقعية بمرور الوقت، أضاف الفريق "وحدة اتساق" (Consistency Module) تعتمد على مفهوم رياضي يسمى "النقل الأمثل" (Optimal Transport). فكر في هذا كمنظم حركة لروبوت الحركة؛ إذا تحركت يد الروبوت من النقطة (أ) إلى النقطة (ب)، فإن هذه الوحدة تضمن أن "حلم" تلك الحركة لا يحدث فيه خلل أو قفزات بين الإطارات. فهي تجبر النظام على حساب المسار الأكثر كفاءة ومنطقية لتتحرك الحركة عبره، مما يضمن عدم انتقال الروبوت فجأة أو اهتزازه بشكل غير منضبط. لقد درب الباحثون هذا النظام على مجموعة بيانات ضخمة تتكون من حوالي مليون فيديو روبوتي، تغطي كل شيء من الإمساك البسيط إلى المهام المعقدة للتجميع.

كانت النتائج مبهرة. فعندما اختبروا EmbodiedVAE ضد أفضل ضواغط الفيديو الرائدة الأخرى، لم يكن مجرد أفضل في المظهر فحسب، بل كان أيضًا أكثر كفاءة. فقد حقق معدل ضغط قدره 0.39% فقط، مما يعني أنه قلل بيانات الفيديو إلى أقل من نصف بالمائة من حجمها الأصلي مع الحفاظ على التفاصيل الحرجة حادة. وللمقارنة، حققت بعض الأساليب الراقية الأخرى معدلات ضغط بلغت 2.08% أو حتى 6.85%، ومع ذلك أنتجت نتائج أكثر ضبابية. وفي المهمة المحددة المتمثلة في التنبؤ بما سيفعله الروبوت بعد ذلك (وهي مهارة حاسمة ليتعلمها الروبوت)، تفوق EmbodiedVAE على النماذج السابقة الأفضل، بما في ذلك نموذج شهير يسمى Wan-VAE، بفارق واضح. ويشير الفريق إلى أن هذا النهج يحل مشكلة رئيسية في الروبوتات: وهي عدم القدرة على فصل "الممثل" (الروبوت) عن "المسرح" (البيئة). ومن خلال إبقاء هذين الاثنين متميزين، يمكن للروبوت أن يتعلم كيفية التعامل مع العالم بدقة وكفاءة لم يكن من الممكن الوصول إليهاما سابقًا. وبينما يركز البحث على النجاح التقني لهذه البنية الجديدة، فإن الدلالة واضحة: إذا أردنا للروبوتات أن تبني، وتطبخ، وتنظف في منازلنا، فنحن بحاجة إلى أن يكون لديهم رؤية واضحة وغير مشوشة لأفعالهم، ويوفر EmbodiedVAE ذلك بالضبط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →