Multi-Domain Motion Embedding: Expressive Real-Time Mimicry for Legged Robots
تقدم هذه الورقة البحثية تمثيل الحركة متعدد المجالات (MDME)، وهو تمثيل حركي مبتكر يوحد الميزات الدورية المهيكلة والميزات غير الدورية غير المهيكلة عبر مشفر يعتمد على المويجات وتضمين احتمالي لتمكين محاكاة حركة تعبيرية، في الوقت الفعلي، وصفرية القدرة (zero-shot) عبر مختلف الروبوتات البشرية والرباعية الأرجل دون الحاجة إلى ضبط لكل حركة أو إعادة استهداف عبر الإنترنت.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما عانت الروبوتات في سبيل التحرك بمرونة طبيعية تشبه الكائنات الحية. وبينما يستطيع المهندسون برمجة الآلات للمشي في خطوط مستقيمة أو تسلق السلالم، فإن تعليمها محاكاة الإيماءات المعقدة والتعبيرية للبشر أو المشية الفريدة للحيوانات ظل تحديًا مستعصيًا. وتكمن الصعوبة الجوهرية في الترجمة: فجسم الإنسان وجسم الروبوت مبنيان بشكل مختلف، بمجموعات مختلفة من المفاصل وحدود فيزيائية مختلفة. تقليديًا، لجعل الروبوت ينسخ حركة إنسان، كان على الباحثين إعادة كتابة حركات الإنسان يدويًا إلى كود يمكن للروبوت فهمه، وهي عملية تشبه ترجمة قصيدة كلمة بكلمة إلى لغة ذات قواعد مختلفة تمامًا. هذه الترجمة اليدوية بطيئة، وغالبًا ما تكسر انسيابية الحركة، وتفشل عندما يواجه الروبوت نوعًا جديدًا من الحركة لم يره من قبل.
قام فريق من الباحثين في جامعة ETH Zurich بتطوير نهج جديد يتجاوز هذه الترجمة اليدوية بالكامل. لقد أنشأوا نظامًا يسمح للروبوتات ذات الأرجل بمراقبة حركة إنسان أو حيوان وفهم كيفية تكرار تلك الحركة على أجسادها فورًا، دون الحاجة إلى نص مكتوب مسبقًا. ومن خلال تعليم الروبوت التعرف على الإيقاع والبنية الأساسية للحركة بدلاً من مجرد نسخ زوايا مفاصل معينة، تمكن الباحثون من جعل الآلات تتعلم من مقاطع الفيديو وبيانات الحركة الخام في الوقت الفعلي. ويشير هذا العمل إلى مستقبل يمكن فيه للروبوتات تعلم مهارات جديدة ببساطة عن طريق مراقبتها، والتكيف فورًا مع أشكالها الفيزيائية الفريدة.
ركز الباحثون، بقيادة ماتياس هيرمان وزملاؤه، على مشكلة حيرت المجال لسنوات: كيف يتم تمثيل الحركة بطريقة تلتقط كلاً من الأنماط المنتظمة والمتكررة والموجات المفاجئة وغير المتوقعة للإيماءات. غالبًا ما كانت الطرق السابقة تعامل هذين الجانبين بشكل منفصل أو تحاول فرض جميع الحركات في قالب رياضي واحد صلب. أدرك الفريق أن الحركة الطبيعية هي مزيج من شيئين: أنماط دورية مهيكلة مثل تأرجح الأرجل المنتظم أثناء المشي، وتغيرات غير هيكلية وغير دورية مثل الالتفات المفاجئ أو التلويح بالذراع. ولحل ذلك، بنوا نظامًا يسمى "تضمين الحركة متعدد المجالات" (Multi-Domain Motion Embedding)، والذي يعمل ككاميرا ذات عدستين للحركة؛ حيث تركز إحدى العدسات على الأنماط المتكررة الشبيهة بالموجات في الحركة، بينما تلتقط الأخرى التفاصيل الفوضوية والفريدة التي تجعل كل حركة متميزة.
بدلاً من ترجمة وضعية جسم الإنسان يدويًا إلى أوامر للروبوت، قام الباحثون بتغذية نظامهم مباشرة ببيانات الحركة الخام. جاءت هذه البيانات من مصدرين: تسجيلات لممثلين بشريين يتحركون بطرق متنوعة، وفيديوهات لكلاب تركض وتمشي. يعالج النظام هذه المعلومات عبر مسارين متوازيين؛ المسار الأول يستخدم أداة رياضية تُعرف باسم "تحويل المويجات" (wavelet transform) لتفكيك الحركة إلى مكوناتها الترددية، مما يسمح للروبوت برؤية "نبض" الحركة، وتحديد الدورات المستقرة للمشية أو إيقاع الرقص. أما المسار الثاني، فيستخدم مشفرًا احتماليًا لالتقاط التفاصيل الفوضوية وغير المتكررة، مثل الطريقة المحددة التي يميل بها الشخص أثناء الدوران أو كيفية تعديل الكلب لتوازنه على أرض غير مستوية. يتم دمج هذين التدفقين من المعلومات في وصف واحد غني للحركة يمكن للروبوت فهمه.
كان الاختبار الحقيقي لهذا النظام هو ما إذا كان بإمكانه العمل في العالم الحقيقي دون تدخل بشري. قام الباحثون بتدريب روبوتاتهم في بيئة محاكية باستخدام "التعلم المعزز"، وهي طريقة يتعلم فيها الروبوت من خلال التجربة والخطأ لتعظيم المكافأة. لقد علموا روبوتًا بشريًا، وهو Fourier N1، لمحاكاة الحركات البشرية، وروبوتًا رباعي الأرجل، وهو ANYmal D، لمحاكاة حركة الكلاب. والأهم من ذلك، أنهم لم يقدموا للروبوتات أي تعليمات تمت معالجتها أو ترجمتها مسبقًا؛ بل توجب على الروبوتات اكتشاف كيفية مطابقة حركة الإنسان أو الحيوان الخام على أجسادها الخاصة بمفردها تمامًا. كانت النتائج مذهلة؛ ففي عمليات المحاكاة، نجحت الروبوتات في تتبع مجموعة واسعة من الحركات، من المشي البسيط إلى الإيماءات المعقدة والتعبيرية، بمستوى من الدقة فاق الطرق السابقة.
لإثبات أن النظام يعمل خارج جهاز الكمبيوتر، قام الفريق بنشر السياسات المدربة على الأجهزة الفعلية. شاهد الروبوت البشري فيديو لممثل بشري وبدأ فورًا في محاكاة الحركات، بما في ذلك المشي والدوران والإيماء، دون أي تعديل يدوي للكود. وبالمثل، شاهد الروبوت رباعي الأرجل لقطات لكلب ونجح في إعادة إنتاج مشية الحيوان. والأكثر إثارة للإعجاب هو أن النظام أظهر نوعًا من "التعلم الصفري" (zero-shot learning)، مما يعني أنه استطاع التعامل مع حركات لم يسبق له رؤيتها من قبل. فعندما عُرضت عليه نوع جديد من مشية الكلاب لم تكن موجودة في بيانات تدريبه، لم يفشل الروبوت، بل قام بتكييف الحركة إلى نسخة مستقرة وممكنة تتناسب مع جسده. تشير هذه القدرة على التعميم إلى أن النظام قد تعلم المبادئ الأساسية للحركة بدلاً من مجرد حفظ قائمة من الوضعيات المحددة.
قارن الباحثون أيضًا طريقتهم الجديدة بالتقنيات القديمة التي اعتمدت على إعادة الاستهداف اليدوي. ووجدوا أنه بينما قد تكون الطرق القديمة أكثر دقة قليلاً عند نسخ حركة مطابقة تمامًا لما تدربت عليه، إلا أنها تفشل فشلاً ذريعًا عند مواجهة حركات جديدة أو غير متوقعة. وفي المقابل، حافظ النظام الجديد على أدائه عبر مجموعة واسعة من الحركات غير المرئية. تشير الدراسة إلى أنه من خلال ترك الروبوت يتعلم بنية الحركة مباشرة من البيانات الخام، بدلاً من إجبارها على المرور عبر مرشح ترجمة صارم، يكتسب الجهاز فهمًا أعمق لكيفية الحركة. هذا النهج يلغي الحاجة إلى قيام المهندسين بصياغة القواعد يدويًا لكل حركة جديدة، مما يفتح الباب للروبوتات للتعلم من التنوع الهائل للحركة الموجودة في العالم الطبيعي.
كان أحد أهم النتائج هو كيفية تعامل النظام مع الاختلافات بين الروبوت والممثل. اكتشف الباحثون أن الروبوت لم يحاول إجبار جسده على اتخاذ شكل مستحيل لمطابقة الإنسان تمامًا، بل فسر الحركة بطريقة ممكنة فيزيائيًا لبنيته الخاصة. فعلى سبيل المثال، عندما قام ممثل بشري بحركة قد تكون غير مستقرة للروبوت، قام النظام بتعديل الحركة للحفاظ على توازن الروبوت، مما يعني "إعادة تفسير" قصد الحركة بدلاً من نسخ الهندسة الدقيقة لها. سمحت هذه المرونة للروبوتات بالبقاء مستقرة ووظيفية حتى عند محاكاة ممثلين من أحجام مختلفة أو أداء حركات ديناميكية معقدة.
كما سلطت الدراسة الضوء على أهمية بنية الترميز المزدوجة. فعندما اختبر الباحثون النظام عبر إزالة أحد المسارين، انخفض الأداء بشكل كبير؛ حيث عانى الروبوت من صعوبة في التقاط النطاق الكامل للحركة، إما بفقدان الاستقرار الإيقاعي للمشية أو الفشل في التكيف مع التفاصيل الفريدة للإيماءة. وقد أكد هذا أن كلاً من الأنماط الهيكلية الشبيهة بالموجات والتفاصيل الفوضوية غير المهيكلة ضرورية للفهم الكامل للحركة. يعمل النظام لأن هذين الجانبين يكملان بعضهما البعض، حيث يوفر أحدهما الأساس ويضيف الآخر التفاصيل اللازمة.
في النهاية، يمثل هذا العمل تحولًا في كيفية تعلم الروبوتات للحركة. فبدلاً من الاعتماد على المهندسين لترجمة الحركة البشرية إلى كود روبوتي، أظهر الباحثون أن الروبوتات يمكنها تعلم فهم الحركة مباشرة. ومن خلال الجمع بين طريقة لالتقاط الأنماط الإيقاعية وطريقة لالتقاط الاختلافات الفريدة، أنشأوا نظامًا يتسم بالمتانة والمرونة. لم تكن الروبوتات التي ظهرت في الدراسة تتبع نصًا فحسب؛ بل تعلمت تفسير لغة الحركة والتحدث بها بصوتها الخاص. تشير هذه القدرة إلى مستقبل يمكن فيه للروبوتات تعلم مهارات جديدة فورًا، والتكيف مع البيئات والمهام الجديدة بمستوى من الطبيعية كان بعيد المنال سابقًا. ويخلص الباحثون إلى أن هذا النهج يوفر أساسًا متينًا للجيل القادم من التحكم الروبوتي، حيث تصبح القدرة على التعلم من الملاحظة ميزة قياسية وليست استثناءً نادرًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.