← أحدث الأبحاث
🤖 AI

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

يُعد CLAP إطار عمل مبتكر يُمكّن من المحاكاة الفيزيائية بأسلوب الصفر-مُعطى (zero-shot) عبر هيئات روبوتية وبشرية متنوعة، وذلك من خلال التدريب على فيديوهات غير متجانسة بمقياس الإنترنت، مع التوفيق بين فضاءات العمل المختلفة عبر وصفة تعلم قائمة على المنهج الدراسي لتحقيق أداء رائد في التكيف بأسلوب القليل-المُعطى (few-shot) وفهم فيزيائي قابل للتعميم.

المؤلفون الأصليون: Kechen Liu, Ola Shorinwa

نُشر 2026-08-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kechen Liu, Ola Shorinwa

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات من أجل فهم العالم المادي بالطريقة التي يفعلها البشر. فبينما يتعلم الطفل أن الكوب سيسقط إذا دُفع من فوق الطاولة، أو أن المنشفة يمكن طيها عن طريق سحب أطرافها، غالبًا ما تحتاج الروبوتات إلى آلاف الأمثلة المحددة لتعلم حتى أبسط هذه القواعد. وينبع هذا الصعوبة من حقيقة أن معظم أنظمة تعلم الروبوتات يتم تدريبها على بيانات من نوع واحد من الآلات؛ فالروبوت ذو الذراع الطويلة والنحيفة يتعلم الفيزياء بشكل مختلف عن الروبوت ذي القابض أو اليد البشرية، مما يخلق حاجزًا حيث لا يمكن نقل المعرفة المكتسبة من واحد إلى آخر بسهما. وللتغلب على ذلك، بدأ العلماء يتطلعون نحو نماذج توليد الفيديو، وهي برامج حاسوبية قادرة على تخيل ما سيحدث بعد ذلك في مشهد ما. فإذا استطاع الروبوت مشاهدة فيديو والتنبؤ بالحركة المستقبلية للأجسام، فإنه يستطيع التخطيط لأفعاله دون الحاجة لتجربتها فعليًا أولًا. ومع ذلك، كانت هذه النماذج التنبؤية تاريخيًا محدودة بنوع واحد من الروبوتات، مما حال دون تعلمها من المكتبة الضخمة والمتنوعة من فيديوهات البشر والروبوتات المتاحة على الإنترنت.

قام فريق من الباحثين في جامعة برينستون بتطوير إطار عمل جديد يسمى (CLAP) لسد هذه الفجوة. ويظهر عملهم أن نموذج فيديو واحد يمكنه تعلم القوانين العالمية للفيزياء من خلال التدريب على مزيج هائل من الفيديوهات التي تضم بشرًا وأنواعًا مختلفة من الروبوتات. وتتمثل الفكرة الجوهرية في أنه بينما تبدو اليد البشرية، والذراع الروبوتية، والقابض مختلفة في المظهر، إلا أنها جميعًا تخضع لنفس القواعد الفيزيائية عند تحريك الأشياء. ومن خلال تعليم الكمبيوتر التنبؤ بمستقبل مشهد ما بغض النظر عن هو أو ما الذي يقوم بالفعل، نجح الباحثون في إنشاء نظام يفهم الميكانيكا الأساسية للعالم بدلاً من مجرد الحركات المحددة لآلة واحدة. ويسمح هذا النهج للنموذج بالتعلم من فيديوهات الإنترنت غير المصنفة، حيث لا تتوفر تعليمات، وكذلك من بيانات الروبوتات التفصيلية، مما يخلق فهمًا أغنى لكيفية تحرك الأشياء وتفاعلها.

واجه الباحثون عقبة كبيرة لأن البيانات التي أرادوا استخدامها كانت فوضوية وغير متسقة؛ ففيديوهات البشر لا تأتي مع تعليمات حول كيفية تحرك أيديهم، وتستخدم الروبوتات المختلفة طرقًا متباينة لوصف حركاتها. ولحل هذه المشكلة، ابتكر الفريق طريقة لترجمة كل لغات الحركة المختلفة هذه إلى تنسيق مشترك. وقد استخدموا ثلاث أدوات رئيسية: الموقع الدقيق ليد الروبوت، والأوصاف النصية البسيطة للحركة، وتمثيل خفي متعلم للفعل يستنتجه الكمبيوتر من تلقاء نفسه. وتضمن الاستراتيجية الأكثر فعالية عملية تعلم خطوة بخطوة؛ أولاً، تعلم النموذج القواعد الأساسية للفيزياء من خلال مشاهدة فيديوهات غير مصنفة باستخدام التمثيلات الخفية للفعل. وبمجرد أن استوعب الديناميكيات الأساسية، قام الباحثون بصقل معرفته باستخدام بيانات دقيقة من روبوتات ذات حركات مصنفة. سمح هذا النهج ثنائي المراحل للنظام بالتوسع باستخدام كميات هائلة من فيديوهات الإنترنت مع الحفاظ على الدقة الكافية للتحكم في الروبوتات الحقيقية.

تظهر نتائج هذا العمل أن النظام الجديد يؤدي بنفس كفاءة، بل وأحيانًا أفضل من، أفضل النماذج الحالية التي تم تدريبها على نوع واحد فقط من الروبوتات. وفي بيئات اختبار صعبة، استطاع النموذج التنبؤ بالإطارات المستقبلية للفيديو بدقة عالية، محاكيًا بشكل صحيح كيفية سقوط الأجسام أو انزلاقها أو التلاعب بها. والأهم من ذلك، تمكن النظام من تعميم هذه المعرفة على مهام واقعية دون الحاجة لإعادة تدريبه لكل روبوت جديد. فعند اختباره على روبوت ذي ذراع واحدة، ساعد النظام الروبوت بنجاح في التخطيط لالتقاط أجسام متنوعة، مثل الشريط أو السمك أو جراد البحر، متفوقًا على السياسات الروبوتية القياسية. والأكثر إثارة للإعجاب هو أنه أمكن تطبيق النظام على روبوت ذي ذراعين وروبوت بشري ذي هيكل جسم مختلف، رغم عدم تدريبه أبدًا على بيانات من تلك الآلات المحددة. فمن خلال مجرد تعديل الطبقة النهائية من النموذج لتتناسب مع حركات الروبوت الجديد، احتفظ النظام بفهمه العميق للفيزياء واستمر في تقديم تنبؤات دقيقة.

يشير هذا البحث إلى أن الطريق نحو روبوتات أكثر قدرة لا يتطلب بناء دماغ فريد لكل آلة جديدة. بدلاً من ذلك، ومن خلال التدريب على مزيج متنوع من البيانات، يمكن لنموذج واحد تعلم مجموعة عامة من المبادئ الفيزيائية التي تنطبق على أي وكيل تقريبًا. ووجد الباحثون أنه بينما نجحت الحركات النسبية، التي تصف التغيير بدلاً من الموضع، في التعامل مع التعليمات القائمة على النصوص، كانت المواقع المطلقة ضرورية للتحكم الدقيق في أذرع الروبوتات. كما اكتشفوا أنه بينما كانت فيديوهات البشر ممتازة لتعليم النموذج أساسيات الفيزياء، كانت بيانات الروبوتات الفعلية ضرورية لترجمة تلك المعرفة إلى أفعال ناجحة في العالم الحقيقي. يضع هذا العمل طريقة جديدة لتدريب الروبوتات، منتقلاً من الأنظمة المعزولة أحادية الغرض نحو نهج أكثر توحيدًا حيث يمكن للتعلم من تجسد واحد أن يفيد مباشرة تجسداً آخر. ورغم أن النظام ليس مثاليًا ويمكن أن يرتكب أخطاءً في تنبؤاته أحيانًا، إلا أنه يمثل خطوة كبيرة للأمام في تعليم الآلات فهم العالم المادي من خلال الملاحظة والخيال.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →