Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph
يُعد Scene2Demo إطار عمل ذاتي التطور يستفيد من الرسوم البيانية للكائنات والأفعال والتحسين القائم على التغذية الراجعة لتوليد بيانات تجسيدية عالية الجودة وقابلة للتنفيذ تلقائياً من صورة واحدة، مما يحسن بشكل كبير نجاح تخطيط المهام ويمكّن من التعلم الفعال لسياسات الروبوت في المهام اللاحقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كان وجود روبوتات يمكنها التحرك عبر منازلنا والمساعدة في المهام اليومية حلمًا من أحلام الخيال العلمي، لكن بناءها أثبت أنه واقع صعب للغاية. لا تكمن المشكلة الجوهرية في تعليم الآلة كيفية تحريك ذراعها فحسب، بل في تعليمها كيفية فهم عالم فوضوي وغير متوقع واتخاذ القرار بشأن ما ستفعله بعد ذلك. لتعلم هذه المهارات، تحتاج الروبوتات تقليديًا إلى كميات هائلة من البيانات: آلاف الساعات من الفيديو التي تُظهر إنسانًا يؤدي مهمة ما، أو ملايين المحاولات القائمة على التجربة والخطأ في محاكاة حاسوبية. إن جمع هذه البيانات يدويًا عملية بطيئة ومكلفة، وغالبًا ما تكون مستحيلة في السيناريوهات النادرة أو الخطيرة. وقد لجأ الباحثون إلى الذكاء الاصطناعي لتوليد هذه البيانات تلقائيًا، لكن المحاولات المبكرة غالبًا ما أنتجت عمليات محاكاة تبدو واقعية ولكنها تنتهك قوانين الفيزياء، أو تعليمات لا يستطيع الروبوت اتباعها فعليًا. لقد تمثل التحدي في إنشاء نظام يمكنه أخذ صورة واحدة لغرفة وطلب بسيط، ثم بناء محاكاة تعمل وفقًا للفيزياء حيث يمكن للروبوت ممارسة المهمة بنجاح، بالفشل والتصحيح الذاتي حتى يتقنها.
قدم فريق من الباحثين نظامًا جديدًا يسمى SCENE2DEMO يعالج هذه المشكلة من خلال العمل كـ "مصنع بيانات ذاتي التحسين". تبدأ العملية بصورة واحدة لغرفة في العالم الحقيقي، مثل المطبخ، وأمر نصي بسيط من المستخدم، مثل "ارفع الكأس". يستخدم النظام أولاً رؤية حاسوبية متقدمة لإعادة بناء تلك الصورة إلى محاكاة ثلاثية الأبعاد تفاعلية بالكامل. فهو يحدد الأشياء، وأشكالها، وأماكن تواجدها، مما يخلق توأمًا رقميًا للمشهد يحترم القوانين الفيزيائية مثل الجاذبية والاصطدام. وبمجرد بناء هذه الغرفة الافتراضية، لا يكتفي النظام بتخمين كيفية تحرك الروبوت؛ بل يقوم بتفكيك طلب المستخدم إلى تسلسل منطقي من الخطوات الصغيرة التي يمكن إدارتها. إنه يتعامل مع المهمة كخريطة، حيث يمثل كل توقف في الرحلة إجراءً محددًا، مثل فتح باب أو رفع جسم ما، ويضمن أن نهاية خطوة ما تهيئ بداية الخطوة التالية تمامًا.
بعد ذلك، يحاول النظام تنفيذ هذه الخطة في المحاكاة. إذا نجح الروبوت، يسجل النظام تسلسل الحركات ومشاهد الكاميرا بالكامل كنموذج مثالي للتعلم المستقبلي. ومع ذلك، تكمن القوة الحقيقية لـ SCENE2DEMO فيما يحدث عندما يفشل الروبوت. في العديد من الأنظمة السابقة، كان يتم ببساطة تجاهل الفشل. أما هنا، فيستخدم النظام آلية تطور ذاتي. فعندما تسوء خطوة ما — ربما يصطدم الروبوت بباب أو يسقط جسمًا ما — يتدخل وكيلان رقميان متخصصان للتحقيق. يعمل أحد الوكلاء كمفتش سلامة، حيث يراقب فيديو الفشل من زوايا كاميرا متعددة لتحديد ما حدث بالضبط. أما الوكيل الآخر فيعمل كمشرف، مستخدمًا تلك الأدلة المرئية لإعادة كتابة الخطة. قد يقترح تحريك قاعدة الروبوت قليلاً إلى اليسار، أو مد الذراع قليلًا للأمام، قبل تجربة المهمة مرة أخرى. وتستمر حلقة المحاولة، والفشل، والتحليل، والتصحيح هذه تلقائيًا حتى يكمل الروبوت المهمة بنجاح.
اختبر الباحثون هذا النهج في أكثر من مائة سيناريو مختلف، تراوحت بين مهام بسيطة مثل التقاط كوب ومهام معقدة متعددة الخطوات مثل وضع كأس داخل ثلاجة. بدون ميزة التصحيح الذاتي، نجح النظام في حوالي 72 بالمائة من المهام البسيطة. وعندما أضافوا حلقة التطور الذاتي للمهام الأكثر تعقيدًا وطويلة المدى، تحسن معدل النجاح بشكل كبير، وأصبحت جودة الخطوات الفردية أكثر موثوقية. تمكن النظام من توليد بيانات تدريب عالية الجودة استُخدمت لاحقًا لتعليم سياسة (policy) روبوت حقيقي. وعندما تعلم الروبوت من هذه الأمثلة المولدة تلقائيًا، حقق نسبة نجاح بلغت 96 بالمائة في فتح الثلاجة و92 بالمائة في التقاط الكأس، مما يثبت أن البيانات التي أنشأتها الآلة كانت قوية بما يكفي لتعليم الروبوت كيفية أداء المهمة في العالم الحقيقي.
يشير هذا العمل إلى أننا لسنا بحاجة إلى تسجيل كل طريقة محتملة يتفاعل بها الروبوت مع العالم يدويًا. بدلاً من ذلك، من خلال الجمع بين محاكاة واقعية وحلقة تغذية راجعة تسمح للنظام بالتعلم من أخطائه، يمكننا توليد مكتبات ضخمة من بيانات التدريب الموثوقة. لا يعتمد النظام على السحر أو الرؤية المثالية؛ بل يعتمد على عملية منظمة لتفكيك المشكلات، واختبارها، وصقل الحل بناءً على الأدلة المرئية. وبينما يظل النظام الحالي محدودًا بأنواع معينة من الحركات والأشياء، ولا يزال يواجه صعوبات مع القيود الفيزيائية الأكثر تعقيدًا، إلا أنه يوضح مسارًا واضحًا للمضي قدمًا. ومن خلال أتمتة إنشاء بيانات التدريب، يمكن لهذا النهج أن يسمح للروبوتات في النهاية بتعلم مهارات جديدة بسرعة وأمان، بمجرد النظر إلى صورة لغرفة وإخبارها بما يجب القيام به.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.