← أحدث الأبحاث
🤖 AI

ExpertGen: Scalable Sim-to-Real Expert Policy Learning from Imperfect Behavior Priors

يُعد ExpertGen إطار عمل قابل للتوسع للنقل من المحاكاة إلى الواقع، حيث يقوم بأتمتة تعلم سياسة الخبير عبر تهيئة سياسة انتشار مجمدة باستخدام نماذج سلوكية سابقة غير مثالية، ثم صقلها عبر التعلم المعزز لتحقيق معدلات نجاح عالية في مهام المناولة المعقدة دون الحاجة إلى هندسة المكافآت.

المؤلفون الأصليون: Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper

نُشر 2026-03-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zifan Xu, Ran Gong, Maria Vittoria Minniti, Ahmet Salih Gundogdu, Eric Rosen, Kausik Sivakumar, Riedana Yan, Zixing Wang, Di Deng, Peter Stone, Xiaohan Zhang, Karl Schmeckpeper

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيفية أداء مهمة معقدة، مثل تجميع قطعة من الأثاث أو وضع موزة فوق علبة. عادةً، ستحتاج إلى توظيف خبير بشري ليري الروبوت ما يجب فعله بالضبط آلاف المرات. لكن هذا أمر مكلف، وبطيء، ويصعب توسيع نطاقه.

EXPERTGEN هو نظام "معلم روبوت" جديد يحل هذه المشكلة. إنه يشبه مدرباً ذكياً ولا يكلّ، يأخذ بضع محاولات خرقاء وغير مكتملة لمهمة ما، ويحولها إلى أداء بمستوى الخبراء داخل عالم افتراضي قبل أن يلمس الروبوت العالم الحقيقي.

إليك كيف يعمل، مقسماً إلى ثلاث خطوات بسيطة باستخدام تشبيه الطبخ:

1. "الوصفة السيئة" (السلوكيات الأولية غير المكتملة)

تخيل أن لديك وصفة لصنع كعكة، لكنها فوضوية بعض الشيء. ربما كُتبت بواسطة مبتدئ، أو ربما تم إنشاؤها بواسطة ذكاء اصطناعي لم يقم بالخبز كثيراً من قبل.

  • المشكلة: إذا اتبعت هذه الوصفة بدقة، فقد تخرج الكعكة مائلة، أو قد تنهار. إنها "غير مكتملة".
  • حل الورقة البحثية: بدلاً من رمي الوصفة، يتعامل EXPERTGEN مع هذه "الوصفة السيئة" كـ نقطة انطلاق. فهو يستخدم نوعاً خاصاً من الذكاء الاصطناعي (يسمى سياسة الانتشار - Diffusion Policy) لتعلم "الإحساس" العام للوصفة. إنه يتعلم الحركات الأساسية، مثل "خلط العجين" أو "وضعه في الفرن"، حتى لو كان التوقيت أو درجة الحرارة غير دقيقة تماماً.

2. "المطبخ الافتراضي" (المحاكاة المتوازية الضخمة)

الآن، تخيل أن لديك مطبخاً سحرياً حيث يمكنك تشغيل 1,000 محاكاة في نفس الوقت.

  • المشكلة: إذا تركت الروبوت يحاول التعلم من الصفر في هذا المطبخ، فسيصطدم بالجدران، ويسقط الكعكة، ولن يعرف أبداً كيف يخبز. إنه يحتاج إلى دليل.
  • حل الورقة البحثية: هنا يحدث السحر. يأخذ EXPERTGEN تلك "الوصفة السيئة" (الأولوية غير المكتملة) ويضعها في المطبخ الافتراضي. وهو يستخدم تقنية تسمى توجيه الانتشار (Diffusion Steering).
    • التشبيه: فكر في حركات الروبوت كأنها نهر يتدفق من منحدر. "الوصفة السيئة" تحدد الاتجاه العام للنهر (فهي تعرف أنه يحتاج للتدفق نحو المحيط/هدف المهمة). ومع ذلك، قد يكون النهر واسعاً جداً أو يصطدم ببعض الصخور.
    • الإصلاح: يعمل EXPERTGEN مثل مشغل السدود. هو لا يغير مسار النهر بالكامل (لأن ذلك سيجعل الروبوت ينسى الأسلوب البشري)، بل يقوم فقط بتوجيه المياه قليلاً عند بداية التدفق لتوجيهها حول الصخور ونحو الهدف.
    • النتيجة: يتعلم الروبوت النجاح من خلال إجراء تعديلات طفيفة على نقطة بدايته، مع الحفاظ على الأسلوب "البشري"، لكنه يصلح الأخطاء. يقوم بذلك ملايين المرات في المطبخ الافتراضي حتى يصبح طباخاً ماهراً.

3. "النقل إلى العالم الحقيقي" (من المحاكاة إلى الواقع - Sim-to-Real)

الآن أصبح الروبوت طباخاً ماهراً في المطبخ الافتراضي. ولكن هل يمكنه الطبخ في مطبخ حقيقي مع إضاءة حقيقية، وغبار حقيقي، وطاولات مهتزة حقيقية؟

  • المشكلة: العوالم الافتراضية مثالية؛ أما العوالم الحقيقية ففوضوية. الروبوت الذي يتم تدريبه في محاكاة مثالية غالباً ما يفشل عندما يرى جسماً حقيقياً.
  • حل الورقة البحثية: يستخدم EXPERTGEN تقنية تسمى DAgger (التي تبدو كاسم سيف، لكنها في الواقع طريقة تعليمية).
    • التشبيه: تخيل أن الروبوت الافتراضي (الطباخ الماهر) يعلم روبوتاً طالباً (الطالب) الذي يمتلك كاميرا فقط ولا يملك وصولاً إلى "الحالة السرية" للمطبخ.
    • العملية: يحاول الطالب الطبخ. وعندما يرتبك أو يرتكب خطأً، يتدخل الطباخ الماهر ويقول: "لا، افعل هذا بهذه الطريقة". يسجل الطالب هذا التصحيح. ويكرران ذلك مراراً وتكراراً.
    • النتيجة: يتعلم الطالب كيفية التعامل مع الإضاءة وزوايا الكاميرا الفوضوية في العالم الحقيقي من خلال التحقق باستمرار مع الطباخ الماهر. وفي النهاية، يصبح الطالب بارعاً جداً لدرجة أنه يستطيع الطبخ بشكل مثالي بمفرده، حتى لو تغيرت الإضاءة أو اهتزت الطاولة.

لماذا يعد هذا أمراً هاماً؟

  1. لا صداع "هندسة المكافآت": عادةً ما يتطلب تعليم الروبوت من البشر كتابة قواعد معقدة مثل "إذا أسقط الروبوت الكوب، امنحه -1 نقطة". هذا من الصعب ضبطه بدقة. أما EXPERTGEN فيكتفي بالقول: "هل أنهيت المهمة؟ نعم؟ جيد. لا؟ حاول مجدداً". وهو يكتشف الباقي من تلقاء نفسه.
  2. يتعلم من الفشل: معظم الروبوتات تستسلم عندما تفشل. أما EXPERTGEN فيتعلم تحديداً كيفية التعافي من الأخطاء. إذا أسقط الروبوت الموزة، فإنه يتعلم كيفية التقاطها مرة أخرى ووضعها فوق بعضها، بدلاً من مجرد التوقف.
  3. رخيص وسريع: لا تحتاج إلى توظيف بشر لتسجيل آلاف الساعات من الفيديو. يمكنك إنشاء البيانات "غير المكتملة" باستخدام نص برمجي حاسوبي أو نموذج لغوي كبير (LLM)، ثم تترك عملية المحاكاة تقوم بالعمل الشاق.

الخلا الخلاصة

EXPERTGEN يشبه أخذ مسودة أولية لسلوك الروبوت، وتمريرها عبر حلقة ممارسة فائقة السرعة ولا نهائية حيث يتعلم الربوات إصلاح أخطائه بنفسه، ثم تعليم طالب يعتمد على الكاميرا كيفية نسخ ذلك الكمال في العالم الحقيقي.

النتيجة؟ روبوتات يمكنها التعامل مع المهام الفوضوية في العالم الحقيقي (مثل التجميع الصناعي أو التقاط الفاكهة) بنسبة نجاح تزيد عن 90%، حتى عندما تبدأ ببيانات قليلة جداً وبدون خبراء بشريين لتوجيهها خطوة بخطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →