← أحدث الأبحاث
💻 computer science

PFM-HR: Pose Flow Matching for Humanoid Robots

تقدم الورقة البحثية "Pose Flow Matching for Humanoid Robots (PFM-HR)"، وهو نموذج مسبق قابل لإعادة الاستخدام تم تدريبه على بيانات وضعيات غير مرتبة واسعة النطاق ويستخدم "درجة هندسة الوضعية" (Pose Geometry Score) مبتكرة لتعديل مكافآت التتبع، مما يحسن أداء التعلم التعزيزي لكل من مهام تتبع الحركة الفردية والعامة.

المؤلفون الأصليون: Yukang Gao, Yi Gu, Yangchen Zhou, Xingyu Chen, Zhaorui Wang, Fanghai Zhang, Hanyang Cao, Zhengyang Shen, Ji Ma, Runhan Zhang, Lei Han, Renjing Xu

نُشر 2026-08-05
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yukang Gao, Yi Gu, Yangchen Zhou, Xingyu Chen, Zhaorui Wang, Fanghai Zhang, Hanyang Cao, Zhengyang Shen, Ji Ma, Runhan Zhang, Lei Han, Renjing Xu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت الرقص. لا يمكنك مجرد إخبار أرجله بالتحرك؛ بل عليك تعليم دماغه كيفية تنسيق مئات العضلات الصغيرة حتى لا يتعثر في قدميه. هذا هو عالم التعلم التعزيزي (reinforcement learning)، حيث تتعلم الروبوتات من خلال التجربة والخطأ، تماماً مثل الطفل الصغير الذي يتعلم المشي. ولكن هنا تكمن المشكلة: إذا تركت الروبوت يحاول فقط تقليد رقصة بشرية، فقد يجد طريقة للحركة تكون ممكنة جسدياً ولكنها تبدو كشخصية في لعبة فيديو مليئة بالأخطاء التقنية (glitchy)، أو والأسوأ من ذلك، قد يسقط لأنه لا يفهم كيف "تتحدث" المفاصل البشرية مع بعضها البعض بشكل طبيعي. ولإصلاح ذلك، يستخدم العلماء المسبقات الحركية (motion priors)—وهي ببساطة مكتبة من "الأفكار الجيدة" حول كيفية تحرك الأجسام البشرية عادةً. فكر في الأمر كأنك تعطي الروبوت كتاب قواعد للحركة الطبيعية حتى لا يضطر لاكتشاف الجاذبية أو التوازن من الصفر. والسؤال الكبير كان دائماً: كيف نعطي الروبوت كتاب القواعد هذا دون أن نجعله جامداً جداً أو بطيئاً جداً في تعلم حركات جديدة؟

هنا يأتي دور PFM-HR (مطابقة تدفق الوضع للروبوتات البشرية - Pose Flow Matching for Humanoid Robots)، وهي طريقة جديدة تعمل كمدرب رقص ذكي وغير مرئي للروبوتات. بدلاً من إجبار الروبوت على حفظ تسلسل محدد من الحركات (مثل مدرب رقص يصرخ "خطوة، خطوة، قفزة!")، يعلم PFM-HR الروبوت هندسة الحركة. تخيل سحابة ضخمة وغير مرئية من جميع الوضعيات البشرية الممكنة. يتعلم PFM-HR شكل هذه السحابة. عندما يحاول الروبوت القيام بحركة جديدة، يتحقق النظام: "هل تبدو هذه الحركة وكأنها تنتمي إلى السحابة؟" إذا حاول الروبوت لوي ركبته بطريقة تخالف التشريح البشري، يقول النظام: "لا، هذا خارج السحابة". ولكن إذا حاول الروبوت القيام بدوران ديناميكي رائع يتناسب مع التدفق الطبيعي للمفاصل البشرية، فإن النظام يعطيه درجة عالية ومكافأة.

وجد الباحثون أن هذا النهج يعد تغييراً جذرياً، خاصة في الحركات البهلوانية الجامحة مثل الشقلبة الخلفية (backflips) أو العجلات الجانبية (cartwheels). باستخدام تقنية تسمى مطابقة التدفق (Flow Matching)، قاموا بتدريب نظامهم على مجموعة ضخمة وغير مرتبة من 60 مليون وضعية بشرية—مثل النظر إلى مليار لقطة عشوائية لأشخاص في وضعيات مختلفة بدلاً من مشاهدة فيلم واحد. سمح لهم هذا ببناء "مسبق مجمد" (prior frozen) (كتاب قواعد لا يتغير أثناء تعلم الروبوت) وهو فعال للغاية. في اختباراتهم، تعلمت الروبوتات التي تستخدم PFM-HR تتبع الحركات المعقدة بشكل أسرع وبأخطاء أقل مقارنة بالروبوتات التي تستخدم الطرق القديمة. على سبيل المثال، في الاختبارات الواقعية على روبوت مادي، قللت الطريقة الجديدة من وقت التدريب اللازم لإتقان ركلة دورانية (spinkick) بنحو 25% مقارنة بالتقنيات السابقة. تشير الورقة البحثية إلى أنه من خلال التركيز على كيفية تغير المفاصل معاً في لحظة واحدة، بدلاً من مجرد حفظ الجدول الزمني، يمكن للروبوتات أن تتعلم التحرك بشكل طبيعي أكثر وتتعامل مع المهام الديناميكية عالية الطاقة بشكل أفضل بكثير.

الفكرة الجوهرية: "سحابة الوضع" و"درجة الهندسة"

لفهم كيفية عمل PFM-HR، دعونا نتجاهل الرياضيات للحظة ونفكر في أرضية الرقص.

في الماضي، كان تعليم الروبوت الرقص يشبه إعطاءه نصاً (script). كان عليه اتباع تسلسل محدد من الإطارات: الإطار 1، الإطار 2، الإطار 3. إذا أخطأ الروبوت في خطوة، كان عليه إعادة التشغيل والمحاولة مرة أخرى. هذا ما كانت تفعله الطرق القديمة؛ حيث اعتمدت على المسبقات الزمنية (temporal priors)، والتي تشبه مشاهدة فيديو لراقص ومحاولة تقليد الفيديو إطاراً بإطار. المشكلة هي أن الفيديوهات جامدة. إذا احتاج الروبوت للتكيف مع أرضية زلقة أو دفعة مفاجئة، فإن نص الفيديو لن يساعد.

حاولت طرق أخرى استخدام مسبقات الوضع (pose priors)، والتي تشبه ألبوم الصور. فهي تخبر الروبوت: "هذه الوضعية جيدة، وتلك الوضعية سيئة". لكن لديها نقطة عمياء: فهي لا تهتم بـ كيف وصلت إلى هناك. قد تقول لك: "من الجيد أن تكون في وضعية الوقوف على اليدين"، لكنها لا تخبرك ما إذا كان من الجيد القفز إلى وضعية الوقوف على اليدين من وضعية الوقوف العادية. إنها تفتقد للربط بين المفاصل.

PFM-HR يسد هذه الفجوة. فهو لا يهتم بترتيب الصور، ولا ينظر إلى الصور فحسب. بدلاً من ذلك، يتعلم الهندسة المحلية لأرضية الرقص.

تخيل أن الروبوت يقف على ترامبولين. "درجة هندسة الوضع" (PGS) تشبه مستشعراً يقيس التوتر في النوابض.

  1. التدريب: ينظر النظام إلى 60 مليون صورة عشوائية لوضعيات بشرية. لا يهتم إذا كانت مرتبة أم لا. إنه يتعلم فقط "شكل" الأماكن التي تحب المفاصل البشرية أن تتواجد فيها.
  2. الرياضيات السحرية: يستخدم النظام خدعة رياضية (مطابقة التدفق) لمعرفة كيف تفضل المفاصل أن تتحرك معاً. يقوم بحساب "جاكوبي" (Jacobian)، وهو مصطلح معقد لخريطة توضح كيف يؤثر تغيير طفيف في مفصل واحد على جميع المفاصل الأخرى.
  3. الدرجة: عندما يحاول الروبوت التحرك، يسأل النظام: "إذا حركت مفاصل الروبوت في هذا الاتجاه، هل يبدو الأمر وكأنه ينزلق على المنحنيات الطبيعية للجسم البشري؟"
    • إذا حاول الروبوت تحريك ذراعه وساقه بطريقة لا يفعلها البشر أبداً، تكون الدرجة منخفضة. يحصل الروبوت على "إشارة سلبية".
    • إذا تحرك الروبوت بطريقة تتماشى مع "التدفق" الطبيعي للمفاصل البشرية، تكون الدرجة عالية. يحصل الروبوت على "إشارة إيجابية" ومكافأة.

لماذا يهم هذا: "المدرب المجمد"

أحد أروع الأشياء في PFM-HR هو أن "المدرب" (المُسبق) يكون مجمداً. بمجرد أن يتعلم النظام هندسة الحركة البشرية من تلك الـ 60 مليون وضعية، فإنه لا يتغير. يظل ثابتاً بينما يتعلم الروبوت الرقص.

فكر في الأمر كمعلم موسيقى حفظ قواعد التناغم. المعلم لا يغير رأيه بشأن ما يبدو عليه "التوافق الموسيقي الجيد" لمجرد أن الطالب يتعلم أغنية جديدة. يظل المعلم ثابتاً، ويقدم دليلاً مستقراً. وهذا يجعل النظام قابلاً لإعادة الاستخدام. يمكنك أخذ هذا المدرب المجمد نفسه وربطه بروبوتات مختلفة أو مهام مختلفة (مثل المشي، الجري، أو الشقلبة) دون الحاجة لإعادة تدريب الشيء بأكمله من الصفر.

النتائج: شقلبات أسرع وروبوتات حقيقية

اختبر الباحثون هذا على مجموعة متنوعة من المهام، من المشي البسيط إلى الحركات البهلوانية الجنونية مثل الشقلبة الخلفية (backflips) وقفزة "الكونج المزدوج" (double kong vaults).

  • البيانات: قاموا بتدريب النظام على مجموعة بيانات تسمى BONES-SEED، والتي احتوت على ما يصل إلى 60 مليون وضعية. وجدوا أنه كلما استخدموا بيانات أكثر، كان أداء الروبوت أفضل. نسخة الـ 60 مليون وضعية كانت الأقوى.
  • الكفاءة: في عمليات المحاكاة، تعلمت الروبوتات التي تستخدم PFM-HR تتبع الحركات المعقدة بعدد محاولات أقل. على سبيل المثال، لتعلم "الشقلبة الخلفية"، فشلت الطرق القديمة (المسماة "vanilla ADD") تماماً. أما الطريقة التي تستخدم PFM-HR فقد نجحت وفعلت ذلك بشكل أسرع من الطرق المتقدمة الأخرى.
  • النجاح في العالم الحقيقي: لم يتوقفوا عند مجرد محاكاة الكمبيوتر. بل وضعوا النظام على روبوت بشري حقيقي. واختبروا أربع مهارات ديناميكية: الركلة الدورانية (spinkick)، مجموعة الركلات (kick combo)، العجلة الجانبية (cartwheel)، والشقلبة الخلفية (backflip).
    • بالنسبة لـ الركلة الدورانية (spinkick)، احتاج الروبوت إلى 251.425 مليون عينة محاكاة للوصم إلى نسبة نجاح 80% باستخدام PFM-HR.
    • بدون PFM-HR، احتاج الروبوت إلى 331.776 مليون عينة.
    • هذا يعني أن PFM-HR قلص وقت التدريب بنسبة تقارب 25% لتلك الحركة تحديداً.

تشير الورقة البحثية إلى أنه بينما يتفوق النظام في التقاط كيفية تحرك المفاصل معاً في لحظة واحدة، إلا أنه لا يعرف ترتيب الوقت. لا يمكنه معرفة ما إذا كانت الحركة تحدث للأمام أو للخلف في الزمن. ومع ذلك، لأغراض تعلم كيفية التحرك بشكل طبيعي وديناميكي، أثبت نهج "اللقطة الواحدة" هذا أنه قوي للغاية.

الخلا الخلاصة

PFM-HR هو طريقة جديدة لتعليم الروبوتات التحرك عبر منحها فهماً عميقاً لهندسة الجسم البشري بدلاً من إعطائها نصاً جامداً. من خلال استخدام مكتبة ضخمة من الوضعيات غير المرتبة ونظام تسجيل ذكي يتحقق مما إذا كانت الحركة "تبدو صحيحة"، فإنه يساعد الروبوتات على تعلم مهارات معقدة وديناميكية مثل الشقلبة الخلفية بشكل أسرع وأكثر موثوقية. إنه يشير إلى أنه في بعض الأحيان، لتعليم الروبوت الرقص، لا تحتاج إلى إظهار الرقصة بأكملها له؛ بل تحتاج فقط إلى إظهار شكل أرضية الرقص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →