← أحدث الأبحاث
🤖 AI

Thousand-GPU Large-Scale Training and Optimization Recipe for AI-Native Cloud Embodied Intelligence Infrastructure

تقدم هذه الورقة أول منصة تدريب موزعة قائمة على السحابة في الصناعة، وتضم ألف وحدة معالجة رسومية للذكاء المجسد، والتي تستفيد من خط أنابيب بيانات مُعاد هيكلته، وتحسينات متقدمة للنماذج (بما في ذلك FlashAttention وتكميم FP8)، وبنية تحتية عالية الأداء لتحقيق تسريع في التدريب بمقدار 40 ضعفاً لنموذج GR00T-N1.5 مع إنشاء نظام تقييم مغلق الحلقة للروبوتات ذاتية القيادة من الجيل التالي.

المؤلفون الأصليون: Chen Zhou, Haoran Sun, Hedan Yang, Jing Long, Junwu Xiong, Luqiao Wang, Mingxi Luo, Qiming Yang, Shuai Di, Song Wang, Tianyun Zhao, Wanting Xu, Wen Huang, Xiaodong Bai, Xiaomeng Tian, Xiaolong Xiang
نُشر 2026-03-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chen Zhou, Haoran Sun, Hedan Yang, Jing Long, Junwu Xiong, Luqiao Wang, Mingxi Luo, Qiming Yang, Shuai Di, Song Wang, Tianyun Zhao, Wanting Xu, Wen Huang, Xiaodong Bai, Xiaomeng Tian, Xiaolong Xiang, Yicheng Gong, Yongjian Guo, Yucheng Guo, Yunxuan Ma, Yu Wei, Zhong Guan, Zhen Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت القيام بمهام منزلية معقدة، مثل طهي وجبة أو طي الملابس، تماماً كما يفعل البشر. يُسمى هذا الذكاء المتجسد (Embodied Intelligence). الأمر لا يقتقتصر فقط على عقل الروبوت (الذكاء الاصطائي)؛ بل يتعلق بكيفية اتصال ذلك العقل بجسد مادي للتحرك والتفاعل مع العالم الحقيقي.

هذه الورقة البحثية تشبه مخططاً لبناء "مدرسة روبوتات" ضخمة وفائقة السرعة حيث تعمل آلاف الحواسيب (وحدات معالجة الرسومات - GPUs) معاً لتدريب هذه الروبوتات. قام فريق من JD Technology وعدة جامعات مرموقة ببناء هذا النظام لحل مشكلة أن تدريب الروبوتات عادة ما يكون بطيئاً، ومكلفاً للغاية، وغير منظم.

إليك تفصيل لحلهم باستخدام تشبيهات بسيطة:

1. المشكلة: مدرسة "الازدحام المروري"

قبل هذا النظام الجديد، كان تدريب الروبوت يشبه محاولة تعليم فصل يضم 1000 طالب في غرفة صغيرة مع معلم واحد فقط.

  • اختناقات البيانات: كانت "الكتب المدرسية" (البيانات) غير منظمة ويصعب العثور عليها.
  • ألعاب الانتظار: كانت الحواسيب تقضي معظم وقتها في انتظار وصول البيانات أو انتظار انتهاء الحواسيب الأخرى من عملها.
  • الجهد الضائع: كان الروبوتات تُجبر على التدرب على خطوات "وهمية" أو فارغة (الحشو - padding)، مما يهدر الطاقة في أشياء لا تهم.

2. الحل: مصنع "الإنتاج فائق السرعة"

بنى الفريق بنية تحتية سحابية الأصل (Cloud-Native Infrastructure) (مصنع رقمي ضخم ومرن) يعمل على 1000 وحدة معالجة رسومات (GPU) في وقت واحد. فكر في الأمر كترقية من خدمة توصيل بالدراجات إلى أسطول من الطائرات بدون طيار عالية السرعة.

إليك "الخلطات السرية" الأربع الرئيسية التي استخدموها لإنجاح الأمر:

أ. خط أنابيب البيانات: "سير ناقل ذكي"

  • الطريقة القديمة: تخيل مصنعاً تصل فيه الصناديق بسرعات مختلفة، ويضطر العمال للتوقف والانتظار حتى وصول أبطأ صندوق قبل أن يتمكنوا من التعبئة.
  • الطريقة الجديدة: بنوا بحيرة بيانات ذكية ومرنة مدفوعة بـ Ray. هذا يشبه سير ناقل ذكي يقوم بفرز وتعبئة الصناديق فوراً. إذا كان الصندوق صغيراً، يتم تعبئته مع صناديق صغيرة أخرى لملء المساحة بشكل مثالي.
  • النتيجة: لا مزيد من الانتظار. يتم تغذية الحواسيب بالبيانات بسرعة كبيرة تجعلها لا تتوقف عن العمل أبداً.

ب. سرعة التدريب: "دفعة سرعة بمقدار 40 ضعفاً"

  • الطريقة القديمة: كان تدريب نموذج روبوت محدد (GR00T-N1.5) يستغرق 15 ساعة لجولة واحدة من التعلم.
  • الطريقة الجديدة: من خلال تحسين كيفية تحميل البيانات وكيفية تواصل الحواسيب مع بعضها البعض، تمكنوا من تقليص هذا الوقت إلى 22 دقيقة فقط.
  • التشبيه: إنه يشبه الانتقال من قيادة سيارة في زحام مروري إلى الطيران بطائرة مروحية. لقد حققوا تسارعاً بمقدار 40 ضعفاً.

ج. رياضيات أذكى: "قطع الدهون"

غالباً ما ترتبك الروبوتات بسبب "الحشو" (padding) — وهي بيانات إضافية عديمة الفائدة تُضاف لجعل كل شيء يبدو بنفس الحجم (مثل إضافة مساحة فارغة إلى حقيبة سفر فقط لجعلها تبدو ممتلئة).

  • آلية الانتباه الخاطف متغيرة الطول (Variable-Length FlashAttention): بدلاً من إجبار الروبوت على قراءة المساحة الفارغة، علموه كيف يتخطى الحشو ويركز فقط على المعلومات الحقيقية.
  • تعبئة البيانات (Data Packing): تعلموا كيفية دمج العديد من القصص القصيرة في قصة واحدة طويلة بحيث لا تضيع أي مساحة.
  • النتيجة: جعل هذا التدريب أسرع بنسبة 188% ووفر كمية هائلة من ذاكرة الحاسوب.

د. ثورة "العمل غير المتزامن": "سباق التتابع"

هذا هو الجزء الأكثر ذكاءً على الإطلاق.

  • الطريقة القديمة (المتزامنة): تخيل سباق تتابع حيث يجب على العداء الذي يحمل العصا الانتظار حتى يكون العداء التالي مستعداً تماماً قبل تسليم العصا. إذا كان أحد العدائين بطيئاً، ينتظر الجميع.
  • الطريقة الجديدة (RL-VLA3): قدموا نظاماً غير متزامن ثلاثي المستويات.
    • بينما تقوم مجموعة من الحواسيب بمحاكاة حركة الروبوت (Rollout)، تقوم مجموعة أخرى بتحديث العقل (Training)، وتعمل مجموعة ثالثة على توليد الحركة التالية.
    • هم لا ينتظرون بعضهم البعض. يمررون العصا بمجرد أن تصبح جاهزة.
  • النتيجة: يعمل النظام بكفاءة أعلى بنسبة 126% لأن أي حاسوب لا يبقى خاملاً أبداً.

3. حمية "التنحيف": التكميم (Quantization)

أحياناً يكون عقل الروبوت ثقيلاً جداً ليعمل على جهاز صغير (مثل ذراع روبوت).

  • الحل: استخدموا تكميم FP8. فكر في هذا كضغط فيلم عالي الدقة إلى ملف أصغر حجماً دون فقدان جودة الصورة.
  • النتيجة: أصبح النموذج أسرع بنسبة 140% واستهلك مساحة أقل، مما جعل من الممكن وضع هذه العقول الذكية على روبوتات فعلية، وليس فقط على خوادم ضخمة.

4. الصورة الكبيرة: لماذا يهم هذا؟

هذه الورقة البحثية لا تتعلق فقط بجعل الروبوتات أسرع؛ بل تتعلق بجعل الروبوتات عملية.

  • قبل: كانت المختبرات الكبيرة التي تملك ملايين الدولارات فقط هي من تستطيع تدريب روبوتات متقدمة.
  • الآن: يثبت هذا النظام أنه مع وجود "البنية التحتية" الصحيحة، يمكننا تدريب الروبوتات على نطاق واسع، وبطريقة رخيصة وسريعة.

التشبيه النهائي:
إذا كان الذكاء المتجسد هو حلم الحصول على روبوت يعمل كخادم منزلي، فإن هذه الورقة البحثية هي بناء المصنع النهائي الذي يمكنه إنتاج عقول هؤلاء الخدم بكميات كبيرة. لقد أخذوا عملية كانت بطيئة، وغير منظمة، ومكلفة، وحولوها إلى خط تجميع انسيابي فائق السرعة.

باختصار: لقد بنوا ساحة تدريب فائقة السرعة وذكية للغاية تسم تتيح للروبوتات التعلم من ملايين التجارب في دقائق بدلاً من أيام، مما يقربنا خطوة عملاقة نحو عصر يمكن للروبوتات فيه مساعدتنا حقاً في حياتنا اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →