← أحدث الأبحاث
💻 computer science

IM-ENGINE: Image Editing for Embodied Data Generation

إن IM-ENGINE هو مسار معالجة قائم على المحاكاة يستفيد من تحرير الصور كتمثيل وسيط لتوليد إشراف قابل للتوسع، وذي معنى دلالي، وقابل للتنفيذ فيزيائياً لتعلم الروبوتات المجسدة، وبالتحديد لتمكين تخليق القبض الماهر وتوليد حالة الهدف.

المؤلفون الأصليون: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

نُشر 2026-09-09
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات من الفعل البسيط المتمثل في التقاط كوب أو تعليق معطف. وبينما يمكن للآلات أن تتحرك بسرعة ودقة مذهلتين، إلا أنها غالبًا ما تفتقر إلى الفهم الحدسي لكيفية إمساك جسم ما لجعله مفيدًا. قد ينجح الروبوت في رفع زجاجة رذاذ، ولكن إذا أمسك بجسم الزجاجة بدلاً من الزناد، فلن يتمكن من الرش. هذه الفجوة بين القدرة البدنية والقصد الوظيفي تمثل عقبة رئيسية في تعليم الروبوتات كيفية مساعدتنا. تقليديًا، حاول الباحثون حل هذه المشكلة إما عن طريق تصوير البشر وهم يؤدون المهام أو من خلال جعل الحواسيب تحاما ملايين الحركات العشوائية حتى تنجح إحداها. النهج الأول بطيء ومكلف، بينما النهج الثاني غالبًا ما ينتج نتائج ممكنة بدنيًا ولكنها عديمة الفائدة عمليًا، مثل يد تمسك كوبًا من حافته بدلاً من مقبضه.

قام فريق من الباحثين في جامعة ماساتشوستس أمهرست وشركة جينيسيس إيه آي (Genesis AI) بتطوير طريقة جديدة لسد هذه الفجوة، تسمى IM-ENGINE. يعامل نهجهم عملية تعلم الروبوت كأنها محادثة بين فنان مبدع ومهندس صارم. يبدأون بمحاكاة حاسوبية لغرفة تحتوي على أشياء، ثم يستخدمون أداة لتحرير الصور لرسم يد بشرية تمسك جسمًا ما أو تضعه في مكان محدد. تعمل هذه الصورة المعدلة كتعليمات بصرية، تخبر النظام بالضبط كيف يجب أن تبدو النتيجة المرجوة. بعد ذلك، يأخذ النظام هذه الصورة ثنائية الأبعاد ويعمل بشكل عكسي، مستخدمًا القواعد المعروفة للمحاكاة لتحديد الموقع والاتجاه الدقيق ثلاثي الأبعاد لليد والجسم. وأخيرًا، يتحقق محرك فيزيائي مما إذا كان الإجراء المقترح ممكنًا بالفعل، رافضًا أي أفكار قد تؤدي إلى جعل الجسم يطفو، أو يسقط، أو يصطدم بالطاولة. والنتيجة هي مكتبة من حركات الروبوت التي ليست صالحة بدنيًا فحسب، بل صحيحة دلاليًا أيضًا، مما يعلم الروبوت كيفية الإمساك بمثقاب من مقبضه أو تعليق كوب على غصن شجرة تمامًا كما يفعل الإنسان.

يعتمد جوهر هذه الطريقة على عملية مكونة من أربع خطوات تحول رسمًا بسيطًا إلى تعليمات جاهزة للروبوت. أولاً، يقوم النظام بإنشاء مشهد من محاكاة، كاملًا بقياسات دقيقة للعمق والهندسة. ثم يقوم نموذج لتحرير الصور بتعديل هذه الصورة، عبر إدخال يد بشرية في وضعية وظيفية أو تحريك جسم إلى حالة نهائية مرغوبة، مثل تمرير طبق في رف الأطباق. توفر هذه الخطوة "القصد"، حيث تلتقط الرغبة البشرية في التفاعل مع العالم بطريقة محددة. بعد ذلك، يستخدم النظام بيانات المحاكاة الأصلية كدليل لإعادة بناء المشهد في ثلاثة أبعاد. ولأن الكمبيوتر يعرف بالضبط أين كانت الكاميرا ومدى عمق الأشياء في الصورة الأصلية، فإنه يستطيع حساب مكان اليد أو الجسم في العالم الحقيقي بدقة، حتى بعد تعديل الصورة.

بمجرد حصول النظام على نموذج ثلاثي الأبعاد للإجراء المطلوب، يخضعه لاختبار فيزيائي صارم. يحاكي الكمبيوتر الحركة، متحققًا من الاصطدامات والاستقرار. إذا كان الإمساك المقترح سيؤدي إلى الانزلاق، أو إذا كان الجسم سيتعثر عند وضعه، فإن النظام يتجاهل تلك المحاولة ويحاول مرة أخرى. يضمن هذا أن كل حركة يتم إنتاجها ليست مجرد صورة جميلة، بل هي إجراء قابل للتنفيذ بدنيًا. بالنسبة للمهام التي تتطلب حركة معقدة، مثل تمرير كوب على غصن ضيق، يخطط النظام مسارًا يتجنب العوائق، مما يضمن قدرة الروبوت على الوصول إلى الهدف دون صدم أي شيء. المخرج النهائي هو مجموعة من المسارات التي يمكن للروبوت الحقيقي اتباعها، مع تحديد مواضع الأصابع وحركات الذراع اللازمة لتحقيق المهمة.

اختبر الباحثون هذا النظام في مجموعة متنوعة من المهام الصعبة، بما في ذلك الإمساك بالأدوات الكهربائية، وزجاجات الرذاذ، وكؤوس النبيذ، وكذلك وضع الأشياء في حاويات مثل رفوف الأطباق وأشجار الأكواب. في الاختبارات التي شملت روبوت ShadowHand، حقق النظام نسبة نجاح بلغت 99.4% في رفع الأشياء و83.2% في تنفيذ الإمساك الوظيفي الصحيح. ويمثل هذا تحسنًا كبيرًا مقارنة بالأساليب السابقة، التي كانت تنجح غالبًا في رفع الجسم ولكنها تفشل في إمساكه بالطريقة الصحيحة. فعلى سبيل المثال، بينما نجحت الأنظمة الأخرى في رفع زجاجة رذاذ بنسبة 97% من الوقت، إلا أنها أمسكت بالزناد بشكل صحيح بنسبة 7% فقط. وفي المقابل، أمسك النهج الجديد بالزنتر بشكل صحيح بنسبة 69% من المرات، مما يثبت أن التوجيه البصري علم الروبوت بفعالية الفروق الدقيقة للإمساك الوظيفي.

كما أثبت النظام فعاليته في توليد الحالة النهائية للهدف، حيث يجب على الروبوت وضع جسم ما في تكوين محدد، مثل تعليق مقص على رف أو إدخال أنبوب في حامل. في هذه المهام التي تعتمد بكثافة على العلاقات، حيث يعتمد الموقع النهائي على المحاذاة الدقيقة بين جسمين، نجحت الطريقة الجديدة في 35 حالة من أصل 40 محاولة. وقد تفوق هذا الأداء كثيرًا على الأساليب الأخرى التي اعتمدت على التخمين أو استخدام إشارات بصرية بسيطة، والتي غالبًا ما فشلت في مراعاة القيود الضيقة للمهمة. وجد الباحثون أنه من خلال البدء بهدف بصري واضح وتحسينه من خلال الفيزياء، يمكن للنظام حل المشكلات التي كانت صعبة للغاية على توليد البيانات الآلي.

للتحقق مما إذا كانت هذه الدروس المحاكاتية يمكن أن تترجم إلى العالم الحقيقي، قام الفريق بتدريب روبوت باستخدام البيانات التي أنتجها IM-ENGINE، ثم اختبروه باستخدام أشياء مادية. نجح الروبوت في تنفيذ مهام مثل الإمساك بالأكواب وتعليق الشماعات، محققًا نسب نجاح بلغت 80% و70% على التوالي. أظهر هذا أن البيانات التي تم إنشاؤها في العالم الافتراضي كانت قوية بما يكفي لتعليم روبوت مادي كيفية التعامل مع أشياء من العالم الحقيقي. وأشار الباحثون إلى أنه على الرغم من فعالية النظام العالية، إلا أنه ليس مثاليًا؛ إذ يمكنه أحيانًا إنشاء صورة تصور تفاعلاً مستحيلاً، أو قد تغفل محاكاة الفيزياء عن اصطدام طفيف. ومع ذلك، يوفر الإطار العام طريقة قوية لتوليد نوعية البيانات عالية الجودة والمخصصة للمهام التي يحتاجها الروبوت لتعلم مهارات التحكم المعقدة.

تمتد آثار هذا العمل إلى ما هو أبعد من مجرد تحسين أيدي الروبوتات. فمن خلال إظهار أن تحرير الصور يمكن أن يعمل كجسر بين القصد البشري والتنفيذ الآلي، فتح الباحثون مسارًا جديدًا لتعلم الروبوتات. فبدلاً من الاعتماد على عروض بشرية مكلفة أو تجارب عشوائية لا تنتهي، يمكن للروبوتات الآن التعلم من الأمثلة البصرية المتجذرة في الواقع الفيزيائي. يسمح هذا النهج بالتوليد السريع لبيانات تدريب متنوعة، تغطي مجموعة واسعة من الأشياء والمهام دون الحاجة إلى تدخل بشري مستمر. ومع ازدياد دمج الروبوتات في حياتنا اليومية، ستكون القدرة على تعليمها ليس فقط كيفية التحرك، بل كيفية التفاعل بشكل هادف مع العالم، أمرًا ضروريًا. يقدم نظام IM-ENGINE خطوة واعدة نحو ذلك المستقبل، محولًا التعليمات البصرية البسيطة إلى أفعال فيزيائية موثوقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →