← أحدث الأبحاث
💻 computer science

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

يقدم البحث AnyWorld، وهو إطار عمل لنمذجة العالم قائم على التفكيك، يقوم بتخليق تجارب روبوتية متنوعة ومتعددة التجسيد من فيديوهات بشرية أحادية المنظور (egocentric)، وذلك عبر فصل عوامل الحركة، والكاميرا، والتجسد، مما يتيح توليد بيانات قابلة للتحكم تعمل على تحسين سياسات التحكم في المناولة بشكل كبير على كل من الروبوتات البشرية المحاكية والحقيقية.

المؤلفون الأصليون: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

نُشر 2026-09-02
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تتعلم الروبوتات القيام بأكثر من مجرد التحرك في خطوط مستقيمة؛ إنها تتعلم كيفية التعامل مع العالم من حولها، مثل التقاط الأشياء، وفتح الأبواب، وتجميع الأجزاء. ولتعلم هذه المهارات، يحتاج الروبوت إلى الخبرة. يجب أن يرى آلاف الأمثلة لكيفية امتداد يد نحو كوب، وكيفية ضغط قابض على إسفنجة، وكيفية انزلاق أداة عبر طاولة. لفترة طويلة، كانت الطريقة الوحيدة للحصول على هذه الخبرة هي جعل الروبوت يؤدي المهمة بنفسه، مراراً وتكراراً. وهذا أمر بطيء ومكلف ومحدود بعدد الروبوتات التي يمكن للمختبر تحمل تكلفة بنائها وعدد الساعات التي يمكنها العمل فيها دون تعطل.

وقد ظهر بديل واعد من مصدر غير متوقع: الفيديوهات البشرية. ففي كل يوم، يسجل الناس أنفسهم وهم يطبخون، أو ينظفون، أو يبنون أشياءً ما. وهذه الفيديوهات مليئة بالتفاعلات الفيزيائية الغنية التي يمكن للروبوتات التعلم منها. ومع ذلك، هناك مشكلة رئيسية؛ ففيديو لإنسان يطبخ يظهر يداً بشرية، وجسداً بشرياً، ووجهة نظر بشرية. والروبوت ليس لديه جسد بشري، ولا يرى العالم من رأس بشري. إذا حاول الروبوت تقليد فيديو بشري مباشرة، فقد يفشل لأن ذراع الإنسان أطول، أو لأن كاميرا الروبوت في مكان مختلف، أو لأن قابض الروبوت يعمل بشكل مختلف. التحدي الذي يواجه العلماء هو معرفة كيفية أخذ "القصة" المفيدة لما يحدث في الفيديو البشري وإعادة سردها بطريقة منطقية للروبوت.

قام فريق من الباحثين بتطوير نظام جديد يسمى "AnyWorld" لحل هذه المشكلة. وبدلاً من محاولة نسخ فيديو بشري بدقة، يقوم النظام بتفكيك الفيديو إلى ثلاثة مكونات منفصلة: الفعل الذي يتم القيام به، والطريقة التي تتحرك بها الكاميرا، والجسد والمشهد اللذان يقومان بالعمل. فكر في "الفعل" كأنه نص السيناريو لما يحدث، و"حركة الكاميرا" كأنها توجيه التصوير، و"الجسد والمشهد" كأنهما الممثلون والديكور. ومن خلال فصل هذه العناصر، يمكن للباحثين أخذ فيديو واحد لإنسان يقوم بمهمة ما وإعادة دمج تلك المكونات لإنشاء فيديو جديد تماماً. في هذا الفيديو الجديد، يكون "الممثل" هو الروبوت، و"الديكور" هو بيئة الروبوت، و"الكاميرا" هي عين الروبوت، لكن "سيناريو" الفعل يظل كما هو.

درب الباحثون نظامهم باستخدام مجموعة ضخمة من الفيديوهات البشرية حيث يتفاعل الناس مع الأشياء. وعلموا النموذج التمييز بين حركة المهمة وبين الجسد المحدد الذي يؤديها. وبمجرد أن تعلم النموذج ذلك، اختبروه عن طريق تغذيته بفيديو بشري وطلب توليد نسخة من نفس المهمة يؤديها روبوت. لم يحتاجوا إلى أي فيديوهات تظهر إنساناً وروبوتاً يقومان بنفس المهمة جنباً إلى جنب. لقد أخذ النظام ببساطة حركات الإنسان ومسار الكاميرا، ثم استبدلهما بجسم روبوت ومشهد روبوت. وكانت النتيجة فيديو يبدو وكأن روبوتاً يؤدي المهمة، مع منظور كامل وقيود فيزيائية خاصة بآلة معينة.

اختبر الفريق هذه القدرة على تغيير الجسم، وزاوية الكاميرا، والمشهد. فقد أظهروا أن النظام يمكنه أخذ فيديو بشري وتوليد نسخة يؤدي فيها روبوت يُدعى "RoboCasa GR1" المهمة، ونسخة أخرى يؤديها روبوت مختلف يُدعى "IRON". كما أظهروا أنه يمكنهم الإبقاء على الروبوت والمهمة كما هما وتغيير زاوية الكاميرا، مما يخلق رؤية من منظور مختلف. والأهم من ذلك، حافظ النظام على منطق التفاعل؛ فإذا قام إنسان في الفيديو الأصلي بالتقاط كوب ونقله إلى رف، فإن فيديو الروبوت الناتج أظهر الروبوت وهو يقوم بنفس تسلسل الحركات تماماً، ولكن بعد تكييفها مع شكل جسمه وموقع كاميرته.

ولإثبات أن هذه الفيديوهات المولدة مفيدة حقاً، استخدمها الباحثون لتدريب روبوتات حقيقية. فقد أخذوا نظاماً قياسياً لتعلم الروبوتات وأعطوه تدريباً إضافياً باستخدام الفيديوهات التي أنشأها نظام "AnyWorld". واختبروا ذلك على محاكاة لذراع روبوت وعلى روبوت بشري حقيقي. في المحاكاة، تحسن معدل نجاح الروبوت في التقاط ووضع الأشياء بشكل ملحوظ بعد التدريب على البيانات المولدة. أما على الروبوت الحقيقي، فقد كان التحسن أكثر دراماتيكية؛ فروبوت كان قادراً فقط على الإمساك بموزة بنجاح في 20 بالمائة من المحاولات، قفز إلى معدل نجاح 55 بالمائة بعد التدريب على فيديوهات (من إنسان إلى روبوت). وقد أظهر هذا أن النظام لم يكن يصنع مجرد صور جميلة، بل كان ينشئ بيانات تدريب صالحة ساعدت الروبوت على التعلم بشكل أفضل.

كما بحث الباحثون بدقة في سبب نجاح ذلك؛ أرادوا معرفة ما إذا كان مجرد إخبار الروبوت بالفعل الذي يجب اتخاذه كافياً، أم أن رؤية المشهد البصري ضرورية أيضاً. أجروا اختباراً حيث أعطوا الروبوت أوامر الفعل الصحيحة ولكنهم أبقوا على بيانات التدريب البصرية من فيديوهات الروبوت الأصلية غير المعدلة. فشلت هذه الطريقة في تعليم الروبوت كيفية اتباع تعليمات محددة، مثل اختيار الموزة اليسرى بدلاً من اليمنى. ومع ذلك، عندما استخدموا النظام الكامل لتوليد كل من المشهد البصري الجديد والفعل الصحيح، تعلم الروبوت اتباع التعليمات بشكل موثوق. أثبت هذا أن إعادة التكوين البصري كانت ضرورية؛ فقد كان الروبوت بحاجة لرؤية العالم من منظوره الخاص ليفهم كيفية تطبيق الفعل.

تشير الدراسة إلى أن هذه الطريقة المتمثلة في تفكيك التفاعلات إلى عوامل منفصلة تسمت بإمكانية إعادة استخدام تجربة بشرية واحدة مرات عديدة. فالفيديو البشري الذي كان محدوداً بجسم بشري وكاميرا بشرية يمكن أن يصبح مصدراً لبيانات تدريب للعديد من أنواع الروبوتات المختلفة وفي بيئات متنوعة. وأشار الباحثون إلى أنه بينما يعد النظام قوياً، إلا أن له حدوداً؛ فهو لا يستطيع بعد التقاط الشعور باللمس أو القوة الدقيقة اللازمة للضغط على جسم ناعم، لأن هذه الأمور تتطلب مستشعرات فيزيائية لا توفرها عملية توليد الفيديو. بالإضافة إلى ذلك، يعتمد النظام على القدرة على تتبع الحركات البشرية بوضوح؛ فإذا كان الفيديو مهتزاً جداً أو إذا كان الشخص مختبئاً خلف جسم ما، فإن النظام يواجه صعوبة.

رغم هذه القيود، يفتح هذا العمل مساراً جديداً لتعلم الروبوتات. فهو يشير إلى أن المكتبة الهائلة من الفيديوهات البشرية على الإنترنت، والتي كان من الصعب استخدامها للروبوتات بسبب الاختلافات في الأجسام ووجهات النظر، يمكن الآن الاستفادة منها. فمن خلال استخدام نموذج يفهم كيفية فصل الفعل عن الفاعل، يمكن للعلماء تحويل التجارب البشرية إلى تجارب روبوتية دون الحاجة إلى تسجيل كل مهمة مع كل روبوت. قد يسمح هذا للروبوتات بتعلم مهارات معقدة بشكل أسرع بكثير، باستخدام البيانات الوفيرة للحياة اليومية البشرية كأساس لقدراتها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →