← أحدث الأبحاث
🤖 AI

Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary

تقدم الورقة البحثية Humanoid-LLA، وهو نموذج لغوي حركي ضخم يُمكّن الروبوتات البشرية من تنفيذ حركات كاملة الجسم متنوعة وقابلة للتنفيذ فيزيائياً من خلال أوامر لغوية حرة عبر دمج مفردات حركة موحدة، ومتحكم مُقطّر، وتعلم تعزيزي مستند إلى الفيزياء.

المؤلفون الأصليون: Zhirui Liu, Kaiyang Ji, Ke Yang, Jingyi Yu, Ye Shi, Jingya Wang

نُشر 2026-04-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhirui Liu, Kaiyang Ji, Ke Yang, Jingyi Yu, Ye Shi, Jingya Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت الرقص. في الماضي، كان عليك أن تكون مبرمج روبوتات، تكتب آلاف الأسطر من الكود لتخبر الروبوت بالضبط كيف يحرك قدمه اليسرى، ثم ذراعه اليمنى، وهكذا. إذا قلت له ببساطة: "ارقص مثل ملك الديسكو"، فمن المرجح أن يسقط الروبوت أو يقف هناك مرتبكاً.

يقدم هذا البحث نظام Humanoid-LLA، وهو نظام يعمل بمثابة مترجم ومصمم رقصات فائق الذكاء في آن واحد. فهو يتيح لك التحدث إلى روبوت بشري بلغة إنجليزية طبيعية وانسيابية (مثل "امشِ في شكل رقم 8 منحني" أو "صافحني كصديق")، وسيفهم الروبوت تماماً ما يجب فعله دون أن يسقط.

إليك كيف يعمل، مقسماً إلى ثلاثة أجزاء بسيطة باستخدام تشبيهات من الحياة اليومية:

1. القاموس العالمي (مفردات الحركة الموحدة)

المشكلة: البشر والروبوتات مبنيون بشكل مختلف. إذا قلت لإنسان "لوّح بيدك"، فإنه يستخدم كتفه ومرفقه. أما إذا قلت لروبوت "لوّح بيدك"، فعليه حساب زوايا المحركات. عادةً ما تحاول الحواسيب ترجمة حركات البشر مباشرة إلى حركات الروبوت، لكن الأمر يشبه محاولة وضع وتد مربع في ثقب مستدير؛ حيث ينتهي الأمر بالروبوت وهو يتحرك بشكل غريب أو غير دقيق.

الحل: ابتكر الباحثون قاموس حركة عالمياً.

  • التشبيه: تخيل قاموساً لا تعني فيه كلمة "قفز" "أرجل بشرية" أو "محركات روبوت". بدلاً من ذلك، تعني "رمز قفز" مجرداً ومحدداً.
  • كيف يعمل: لقد أخذوا آلاف الفيديوهات لحركات البشر وآلاف الفيديوهات لحركات الروبوتات. وأجبروا كليهما على التحدث بنفس "اللغة" المكونة من هذه الرموز المجردة. الآن، عندما يرى الروبوت رمز "القفز"، فإنه يعرف بالضبط كيف يجب أن يتحرك جسده لتحقيق تلك القفزة، تماماً كما يعرف الإنسان كيف يجب أن يتحرك جسده. هذا يجسّر الفجوة بين الأسلوب البشري وفيزياء الروبوت.

2. مدرب البروفات (التقطير الموجه بالمفردات)

المشكلة: حتى لو امتلك الروبوت القاموس، فقد لا يعرف كيفية أداء الحركة فعلياً دون التعثر. فالروبوت الذي يسقط هو روبوت عديم الفائدة، بغض النظر عن مدى فهمه لكلماتك.

الحل: قاموا بتدريب روبوت "معلم" وروبوت "طالب".

  • التشبيه: فكر في معلم هو لاعب جمباز ماهر (ولكن فقط في لعبة فيديو مثالية وآمنة). المعلم يعرف تماماً كيف يتحرك ليحافظ على توازنه. ثم يقومون بتدريب طالب (الروبوت الحقيقي) لتقليد المعلم، ولكن مع لمسة مختلفة: لا يُسمح للطالب بمشاهدة روتين المعلم الكامل والمعقد. يمكن للطالب فقط رؤية رموز القاموس العالمي (مثل: "خطوة"، "دوران"، "توازن").
  • كيف يعمل: يتعلم الطالب كيفية تحويل تلك الرموز البسيطة إلى حركات فيزيائية معقدة ومتوازنة. وهذا يضمن أنه عندما يتلقى الروبوت الحقيقي تعليمات، فإنه لا يخمن فحسب، بل ينفذ حركات ممكنة فيزيائياً ولن تسبب تحطمه.

3. المخرج الإبداعي (نموذج اللغة والإجراء الضخم)

المشكلة: أنت تريد من الروبوت القيام بأشياء معقدة وإبداعية بناءً على تعليمات غامضة، وليس مجرد أوامر بسيطة مثل "تقدم للأمام".

الحل: قاموا ببناء "عقل" (نموذج لغة ضخم) يعمل بمثابة مخرج إبداعي.

  • التشبيه: تخيل أنك تعطي المخرج نصاً مسرحياً: "جندي يسير في عرض عسكري". المخرج لا يقول فقط "حرك الساق". بل يفكك الأمر إلى: "أولاً، قف باستقامة. ثم، ارفع الذراع اليمنى عالياً. ثم، اسير بركبة صلبة".
  • كيف يعمل:
    1. التفكير: يقرأ الذكاء الاصطناعي أمرك و"يفكر" بصوت عالٍ (سلسلة من الأفك "Chain of Thought")، حيث يفكك الفكرة الكبيرة إلى خطوات صغيرة ومنطقية.
    2. التحدث: يترجم تلك الخطوات إلى رموز الحركة العالمية من الخطوة الأولى.
    3. التدريب: لم يتركوا الذكاء الاصطناعي يخمن فحسب. بل استخدموا "نظام مكافأة" (مثل النتيجة في ألعاب الفيديو). إذا أنتج الذكاء الاصطناعي تسلسلاً من الرموز جعل الروبوت يسقط في المحاكاة، فإنه يحصل على درجة منخفضة. وإذا جعله يتحرك بسلاسة وطبيعية، فإنه يحصل على درجة عالية. هذا يعلم الذكاء الاصطناعي أن يكون مبدعاً ومتزناً فيزيائياً في آن واحد.

لماذا يعد هذا أمراً هاماً؟

  • لا مزيد من "لغة الروبوتات": لست بحاجة لأن تكون مهندساً. يمكنك فقط التحدث إلى الروبوت بشكل طبيعي.
  • لا يسقط أرضاً: على عكس الطرق السابقة التي كانت تبدو رائعة في الأفلام ولكنها تفشل في الحياة الواقعية، فقد تم تدريب هذا النظام على الفيزياء. إنه يعرف الفرق بين "الظهور بمظهر الراقص" وبين "القدرة الفعلية على الرقص دون كسر ساق".
  • إثبات في العالم الحقيقي: اختبروا هذا على روبوتات حقيقية (Unitree G1 و Booster T1) في العالم الحقيقي، ونجحت الروبوتات في أداء مهام معقدة مثل السير العسكري، والعناق، وتوجيه حركة المرور بناءً على جمل بسيطة.

باخت تختصر: Humanoid-LLA هو الحلقة المفقودة التي تحول الروبوت من آلة خرقاء تحتاج إلى دليل استخدام إلى شريك مفيد يفهم كلماتك ويتحرك ببراعة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →