GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
تقدم الورقة البحثية GigaBrain-0.7، وهو نموذج تأسيسي متجسد يستفيد من بنية مبتكرة مكونة من ثلاثة أنظمة وتم تدريبه على أكثر من 37,000 ساعة من البيانات غير المتجانسة لتحقيق تفوق في التعميم الصفري، واتباع التعليمات، ومعدلات نجاح المهام عبر مختلف التجسيدات الروبوتية مقارنة بالنماذج السابقة ذات الحالة الراهنة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً يستطيع فيه روبوت النظر إلى طاولة مطبخ فوضوية، وفهم طلب منطوق مثل "ضع التفاحة الحمراء في الوعاء"، ثم يكتشف بالضبط كيفية تحريك ذراعه للقيام بذلك دون الاصطدام بأي شيء. هذا هو الوعد الذي يقدمه الذكاء الاصطناعي المتجسد (Embodied AI): آلات لا تكتفي بمعالجة المعلومات فحسب، بل تتفاعل مع العالم المادي. لسنوات، حاول الباحثون تعليم الروبوتات من خلال عرض آلاف الفيديوهات لأيدي بشرية تحرك الأشياء، آملين أن تتعلم الآلة قواعد الفيزياء والسبب والنتيجة. ومع ذلك، ظل هناك عائق رئيسي؛ فالروبوتات تُبنى بشكل مختلف؛ فقد يكون لأحدها ذراعان، ولآخر قبضة واحدة، وثالث قد يتحرك على عجلات. وغالباً ما تؤدي البيانات التي جُمعت من نوع واحد من الروبوتات إلى إرباك نوع آخر. علاوة على على ذلك، فإن مجرد مشاهدة فيديو لا يعلم الآلة كيف تتنبأ بما سيحدث تالياً إذا ارتكبت خطأً، أو كيف تتعافى عندما تسوء المهمة. كان السؤال المطروح هو ما إذا كان بإمكاننا بناء "عقل" واحد ذكي يفهم اللغة، ويرى العالم، ويتحكم في أي نوع من أجساد الروبوتات، كل ذلك أثناء التعلم من مزيج هائل من التجارب المختلفة.
لقد قدم فريق من الباحثين الآن خطوة مهمة للأمام من خلال نظام يسمى GigaBrain-0.7. هذا ليس مجرد برنامج واحد، بل هو نظام منسق مصمم للتعامل مع تعقيدات التفاعل في العالم الحقيقي. وبدلاً من محاولة إجبار الروبوت على تعلم كل شيء في دفعة فوضوية واحدة، نظم الباحثون عملية التعلم في ثلاثة أجزاء متميزة ولكنها متصلة تعمل معاً. الجزء الأول يعمل كاليدين وردود الفعل، حيث يتولى التحكم الفوري في محركات الروبوت لتنفيذ الأفعال. الجزء الثاني يعمل كمخطط ومراقب، حيث ينظر إلى المشهد، ويفهم التعليمات اللغوية، ويقسم هدفاً كبيراً مثل "نظف الطاولة" إلى خطوات أصغر يمكن إدارتها مثل "التقط الكوب" و"انقله إلى الحوض". أما الجزء الثالث فهو الإضافة الأكثر ابتكاراً: فهو يعمل كمُتنبئ وحَكَم. إنه يتخيل كيف سيبدو المشهد بعد بضع ثوانٍ إذا استمر الروبوت في مساره الحالي، ويمنح درجة لهذا المستقبل ليقرر ما إذا كان الروبوت يحرز تقدماً أم يتجه نحو الفشل.
لتدريب هذا النظام، لم يعتمد الباحثون على مصدر واحد للبيانات؛ بل جمعوا مكتبة ضخمة تضم أكثر من 37,000 ساعة من الخبرة. تضمنت هذه المجموعة فيديوهات لروبوتات حقيقية تعمل في المصانع والمنازل، وتسجيلات لأيدي بشرية تتلاعب بالأشياء من منظور الشخص الأول، وبيانات ناتجة عن محاكاة حاسوبية. كما استخدموا الذكاء الاصطناعي لإنشاء سيناريوهات تدريبية جديدة، مما وسع فعلياً تنوع المواقف التي يمكن للروبوت التعلم منها. ومن خلال تغذية هذا المزيج المتنوع من البيانات في النظام، سمح الباحثون للنموذج بتعلم مبادئ عامة للحركة والتفاعل بدلاً من مجرد حفظ حيل محددة لروبوت معين. تم تدريب النظام للتعامل مع 16 نوعاً مختلفاً من أجساد الروبوتات، من الآلات ذات الذراعين المزدوجتين إلى الأشكال البشرية، مما علمه كيفية تكييف فهمه لـ "اليسار" و"اليمين" أو "الإمساك" و"الإفلات" بناءً على الجسم المحدد الذي يتحكم فيه.
تم اختبار نتائج هذا النهج على روبوتات حقيقية في كل من البيئات الصناعية والمنزلية. وعندما طُلب منها تنفيذ مهام لم ترها من قبل، أظهر النظام قدرة ملحوية على التعميم. في أحد الاختبارات، طُلب من روبوت طي قطعة من الملابس أُلقيت في كومة فوضوية، وهي مهمة تتطلب من الآلة تعديل قبضتها باستمرار مع تغير شكل القماش وتحركه. ودون الحاجة لإعادة تدريبه على تلك القميص تحديداً، نجح النظام في التعامل مع الجسم المرن. وفي سيناريو آخر، طُلب من الروبوت التقاط ملعقة ذات لون محدد من بين مجموعة من الأدوات المختلطة، مما أظهر قدرته على فهم التعليمات اللغوية الدقيقة وتطبيقها على أشياء جديدة. كما أثبت النظام قدرته على التعامل مع سلاسل طويلة من الأفعال، مثل تنظيم مكتب أو كنس الأرز، حيث توجب على الروبوت الحفاظ على إحساس بالهدف الإجمالي أثناء تنفيذ العديد من الحركات الصغيرة.
كانت النتيجة الرئيسية هي أن قدرة النظام على التنبؤ بالمستقبل وتقييم تقدمه أحدثت فرقاً ملموساً في معدلات النجاح. فعندما أزال الباحثون الجزء التنبئي من النظام، واجه الروبوت صعوبة أكبر في المهام المعقدة، وغالباً ما كان يعلق في حلقات من الحركة المتكررة أو يفشل في التعافي من الأخطاء الطفيفة. ومع تفعيل المكون التنبئي، استطاع الروبوت توقع أن حركة معينة قد تؤدي إلى اصطدام أو سقوط، فقام بتعديل مساره قبل وقوع الخطأ. سمحت هذه القدرة للروبوت بإكمال مهام صعبة، مثل تغليف هدية أو فرز المكعبات، بموثوقية أعلى بكثير من النماذج السابقة. ووجد الباحثون أنه كلما زاد حجم بيانات التدريب، تحسن أداء الروبوت باستمرار، مما يشير إلى أن النظام كان يتعلم حقاً من الحجم والتنوع الهائل لتجاربه.
كما سلطت الدراسة الضوء على أهمية كيفية دمج أنواع مختلفة من البيانات. فقد حقق النظام أفضل أداء له عندما تعلم من مزيج من تجارب الروبوتات الحقيقية، والعروض البشرية، والبيئات المحاكية. لقد قدم كل مصدر نوعاً مختلفاً من الدروس: الروبوتات الحقيقية علمت النظام القيود الفيزيائية لآلات محددة، والفيديوهات البشرية أظهرت له كيف يتفاعل الناس مع الأشياء بشكل طبيعي، والمحاكاة سمحت له بممارسة السيناريوهات النادرة أو الخطيرة بأمان. ومن خلال دمج هذه المصادر، طور النظام فهماً قوياً لكيفية عمل العالم يمكن تطبيقه عبر مختلف أجساد الروبوتات. وأشار الباحثون إلى أنه رغم أن النظام ليس مثالياً ولا يزال يواجه بعض الصعوبات في التفاعلات الفيزيائية الأكثر تعقيداً، إلا أنه يمثل تحولاً من بناء روبوتات متخصصة لمهام فردية إلى إنشاء ذكاء عام الغرض يمكنه التكيف مع التحديات الجديدة.
في نهاية المطاف، يوضح GigaBrain-0.7 أن رفع نطاق كمية وتنوع بيانات التدريب، جنباً إلى جنب مع بنية هيكلية تفصل بين التخطيط والعمل والتنبؤ، يمكن أن يؤدي إلى روبوتات أكثر قدرة وتكيفاً. إن النظام لا يتبع مجرد نص مكتوب؛ بل يفهم سياق المهمة، ويتوقع عواقب أفعاله، ويتعلم من تجربته الخاصة للتحسن بمرور الوقت. ورغم أنه لا يزال هناك عمل يتعين القيام به قبل أن تتمكن هذه الأنظمة من التعامل مع كل موقف ممكن في المنزل أو المصنع، إلا أن هذا البحث يوفر مساراً واضحاً للمضي قدماً. إنه يشير إلى أن مستقبل الروبوتات لا يكمن في بناء أجهزة (Hardware) أفضل فحسب، بل في خلق برمجيات أكثر ذكاءً ومرونة يمكنها التعلم من التجارب الواسعة والمتنوعة للعالم المادي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.