← أحدث الأبحاث
💻 computer science

DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation

يُعد DeformSmith إطار عمل هرمي موجه بالفيزياء، يعمل على أتمتة توليد أصول قابلة للتشوه عالية الجودة ومنطقية فيزيائياً من أجل التلاعب الروبوتي، وذلك عبر البناء والتحسين المتكرر لخصائص الهندسة والمواد والتفاعل من خلال مدخلات نصية أو صورية.

المؤلفون الأصليون: Can Li, Jie Gu, Zishun Deng, Jingmin Chen, Lei Sun

نُشر 2026-09-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Can Li, Jie Gu, Zishun Deng, Jingmin Chen, Lei Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في العوالم الافتراضية حيث تتعلم الروبوتات كيفية الحركة، غالبًا ما تكون الأشياء التي تتفاعل معها مثالية للغاية. فالتفاحة الرقمية هي كرة صلبة لا تنبعج أبدًا؛ والمنشفة الرقمية هي ورقة مسطحة لا تنثني أبدًا. لكي يتعلم الروبوت كيفية الإمساك بشيء ما، أو رفعه، أو حمله في محاكاة، يجب أن يتصرف هذا الشيء مثل الشيء الحقيقي. يجب أن ينضغط عند الضغط عليه، وينسدل عند إسقاطه، ويحافظ على شكله عند رفعه. إن إنشاء هذه الأشياء الرقمية من الصفر أمر صعب لأن المظهر البصري للشيء — أي كيف يبدو — ليس سوى نصف القصة. النصف الآخر هو طبيعته الفيزيائية الخفية: كم يزن، ومدى نعومة أو صلابة مادته، وكيف يتفاعل عند لمسه. وبدون معرفة هذه الخصائص غير المرئية، قد يحاول روبوت التقاط موزة رقمية ليجدها تتحطم مثل الزجاج أو تنزلق من بين أصابعه مثل الماء، ببساطة لأن الكمبيوتر لم يعرف كيف يجعلها تنثني.

لطالما حاول الباحثون توليد هذه الأشياء ثلاثية الأبعاد باستخدام الأوصاف النصية أو الصور الفوتوغرافية الفردية، ولكن حتى الآن، كانت النتائج غالبًا مقنعة بصريًا ولكنها "مكسورة" فيزيائيًا. قد تبدو كدمية محشوة، لكنها في المحاكاة، قد تنهار تحت وزنها أو تفشل في التفاعل مع قبضة الروبوت. يكمن التحدي في أن الصورة أو الجملة لا تحتويان على معلومات كافية لإخبار الكمبيوتر بدقة بكيفية تشوه الشيء. ولحل هذه المشكلة، طور فريق من الباحثين نظامًا جديدًا يسمى DeformSmith. هذا الإطار لا يكتفي بتخمين كيف يجب أن يبدو الشيء فحسب؛ بل يبني الشيء في طبقات، ويختبر سلوكه الفيزيائي في كل خطوة، ويستخدم روبوتًا محاكيًا لمحاولة التلاعب بالشيء قبل انتهاء العملية.

جوهر هذا النهج الجديد هو عملية بناء خطوة بخوة تحاكي كيف قد يبني مهندس بشري نموذجًا أوليًا، ولكن مع قيام الكمبيوتر بالعمل الشاق. يبدأ النظام بوصف بسيط أو صورة واحدة ويبني أولاً الشكل ثلاثي الأبعاد للشيء. بمجرد وجود الشكل، يمنحه النظام هوية فيزيائية، فيقرر كم يزن وكيف يتفاعل مع الأرض. ثم يضيف الخصائص المادية، ليحدد ما إذا كان الشيء ناعمًا مثل الإسفنج أو صلبًا مثل كرة مطاطية. والأهم من ذلك، أن النظام لا يضع هذه القيم فقط ويأمل في الأفضل. بل يجري سلسلة من الاختبارات الفيزيائية، مثل إسقاط الشيء أو الضغط عليه، ليرى ما إذا كان يتصرف بشكل صحيح. إذا انهار الشيء بسهولة كبيرة أو ارتد بطريقة خاطئة، يقوم النظام تلقائيًا بتعديل إعداداته الداخلية ويحاول مرة أخرى.

ما يجعل هذا الأسلوب فريدًا هو كيفية إدخال الروبوت في الحلقة. بعد أن يجتاز الشيء الاختبارات الفيزيائية الأساسية، يحاول ذراع روبوت محاكي التقاطه، وحمله، ووضعه. هنا يتعلم النظام أكثر؛ حيث يحاول الروبوت الإمساك بالشيء، ويراقب النظام عن كثب ليرى ما إذا كان الشيء يحافظ على شكله، أو إذا كان ينزلق، أو إذا كان يتشوه بطريقة تجعل من المستحيل تحريكه. إذا فشل الروبوت، يستخدم النظام ذلك الفشل كدليل. فقد يدرك أن الشيء شديد الانزلاق، أو أن القبضة كانت ضعيفة جدًا، أو أن المادة ناعمة للغاية بالنسبة للمهمة. ثم يعود النظام لتنقيح خصائص الشيء أو تغيير كيفية حركة الروبوت، مكررًا الدورة حتى يتمكن الروبوت من إكمال المهمة بنجاح. وهذا يخلق حلقة تغذية راجعة حيث يتم تحسين الشيء باستمرار بناءً على مدى نجاحه في سيناريو من العالم الحقيقي.

اختبر الباحثون هذا النظام من خلال إنشاء عشرات الأشياء المختلفة، من كرة الرغبي إلى فقمة محشوة، باستخدام كل من الأوصاف النصية والصور الفردية. وقارنوا نتائجهم مع طرق متقدمة أخرى تحاول القيام بالشيء نفسه. في هذه المقارنات، كانت الأشياء التي أنشأها DeformSmith أكثر واقعية بشكل ملحوظ. فعند سقوطها، حافظت على شكلها وارتدت أو انضغطت بطريقة تبدو طبيعية، بينما كانت الأشياء من الأنظمة الأخرى غالبًا ما تتسطح مثل الفطيرة أو تتفكك. وفي اختبارات عمياء حيث حكم الناس على أي الأشياء بدا ويتصرف بشكل أفضل، فاز النظام الجديد بالأغلبية. وقد نجح بشكل خاص في إنشاء أشياء يمكن للروبوت التلاعب بها بنجاح، حيث قفز معدل النجاح في التقاط الأشياء وتحريكها من أقل من النصف إلى أكثر من الثلثين عند استخدام التنقيح الموجه بواسطة الروبوت.

يعمل النظام عن طريق تقسيم المشكلة إلى مراحل يمكن إدارتها، مما يضمن صحة الشكل قبل القلق بشأن الوزن، وصحة الوزن قبل القلق بشأن المادة. هذا يمنع الكمبيوتر من الارتباك بسبب محاولة إصلاح كل شيء في وقت واحد. يعمل "حزام" مركزي كـمشرف، يتتبع جميع القواعد ويضمن أن التغييرات التي تُجرى في مرحلة ما لا تفسد العمل الذي تم في مرحلة سابقة. على سبيل المثال، إذا قرر النظام جعل شيء ما أكثر نعومة، فإنه يتحقق من أن هذا التغيير لا يجعل الشيء ثقيلًا جدًا أو يتسبب في غوصه في الأرض. هذا النهج الهرمي الدقيق يسمح للنظام ببناء أشياء تفاعلية معقدة جاهزة للاستخدام في محاكاة تدريب الروبوتات.

بينما يعد النظام قويًا، يشير الباحثون إلى أنه يعمل حاليًا بشكل أفضل مع الأجسام الصلبة التي يمكن ضغطها أو تمديدها، وليس مع السوائل أو المواد الحبيبية مثل الرمل. كما أن الخصائص الفيزيائية التي يستنتجها هي تقديرات بناءً على الإشارات البصرية والمحاكاة، مما يعني أنها ستظل بحاجة إلى التحقق من خلال قياسات العالم الحقيقي إذا استُخدمت لروبوتات فيزيائية فعلية. ومع ذلك، فإن القدرة على توليد مجموعة متنوعة من الأشياء ذات المصداقية الفيزيائية من مدخلات بسيطة تفتح بابًا جديدًا أمام الروبوتات. فبدلاً من نمذجة كل شيء قد يواجهه الروبوت يدويًا، يمكن للمهندسين الآن وصف شيء ما أو عرض صورة له، وسيقوم النظام ببناء توأم رقمي جاهز للاختبار، والتلاعب به، والتعلم منه. تشير هذه القدرة إلى مستقبل حيث يمكن للروبوتات تعلم التعامل مع عالم الأشياء المتغيرة وغير المنتظمة في الحياة اليومية بشكل أسرع بكثير، ببساطة من خلال التدرب على مكتبة واسعة من الأصول الرقمية المولدة تلقائيًا والدقيقة فيزيائيًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →