Technical Report: One-Step Drifting Action Heads for GR00T N1.7
يُقيّم هذا التقرير التقني نسخة GR00T N1.7 المزودة برأس حركة انزياحي أحادي الخطوة، والتي تقلل زمن استجابة الاستدلال بشكل كبير من 70.0 مللي ثانية إلى 30.6 مللي ثانية، ولكنها تتسبب في مقايضة نظامية تتمثل في انخفاض معدلات نجاح المهام عبر اختبارات LIBERO، مما يسلط الضرض على قيود التوليد أحادي الخطوة الحتمي في التحكم بالحلقة المغلقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لم تعد الروبوتات التي يمكنها الرؤية، والفهم، والتحرك بيديها مجرد حلم من أحلام الخيال العلمي؛ بل يتم بناؤها اليوم باستخدام أنظمة تجمع بين عين الكاميرا ودماغ مدرب لغوياً. هذه الأنظمة، المعروفة بنماذج (الرؤية واللغة والفعل)، تتيح للآلة النظر إلى مشهد ما، وقراءة أمر مثل "التقط الكوب الأحمر"، ثم تحديد تسلسل الحركات الدقيق للقيام بذلك. ومع ذلك، لكي تكون هذه الروبوتات مفيدة في العالم الحقيقي، يجب أن تفكر بسرعة كافية للاستجابة لبيئة متغيرة دون تعثر. فإذا استغرق الكمبيوتر وقتاً طويلاً جداً في اتخاذ القرار بشأن الحركة التالية، فقد يخطئ الروبوت هدفه أو يسقط شيئاً ما. ويتمثل التحدي المركزي للمهندسين في إيجاد طريقة لجعل هذه القرارات سريعة دون التضحية بالدقة اللازمة لإكمال المهمة.
يبحث تقرير تقني جديد من باحثين في جامعة تشجيانغ وشركة (LimX Dynamics) في اختصار محدد لتسريع هذه القرارات الروبوتية. تركز الدراسة على دماغ روبوتي قوي يسمى (GR00T N1.7). في شكله القياسي، يعمل هذا النظام مثل مخطط دقيق: لتقرير تسلسل من أربعين حركة مستقبلية، يقوم بتشغيل محرك الحساب الداخلي الخاص به عدة مرات، مع تحسين المخطط مع كل تمريرة حتى يشعر بالثقة. هذه العملية التكرارية دقيقة ولكنها بطيئة، حيث تستغرق حوالي 45 ميلي ثانية فقط لإنشاء قائمة الأفعال. وقد تساءل الباحثون سؤالاً بسيطاً: هل يمكنهم استبدال هذا التخطيط الدقيق متعدد الخطوات بتخمين واحد فوري؟ لقد بنوا نسخة من الروبوت تتخطى خطوات التحسين وتحاول التنبؤ بتسلسل الأربعين حركة بالكامل في دفعة واحدة.
تكشف نتائج هذه التجربة عن مقايضة حادة بين السرعة والنجاح. فمن خلال الانتقال إلى طريقة الخطوة الواحدة، حقق الباحثون انخفاضاً هائلاً في وقت التفكير. فقد انخفض الوقت المطلوب لإنشاء قائمة الأفعال من حوالي 45 ميلي ثانية إلى 5 ميلي ثانية فقط، أي زيادة في السرعة بمقدار تسعة أضعاف. وعندما قاسوا إجمالي الوقت الذي قضاه الكمبيوتر في معالجة المعلومات البصرية واللغوية لإنتاج مخطط، انخفض الوقت من حوالي 70 ميلي ثانية إلى ما يزيد قليلاً عن 30 ميلي ثانية. يعد هذا فوزاً هندسياً كبيراً، مما يشير إلى أن الروبوتات يمكن أن تستجيب بشكل أسرع بكثير إذا كانت هذه الطريقة مثالية.
ومع ذلك، يوضح التقرير أن هذه السرعة تأتي بتكلفة باهظة. فبينما أصبح الروبوت أسرع بكثير في التفكير، أصبح أسوأ بكثير في أداء المهمة. اختبر الباحثون النظام الجديد على مجموعة قياسية من المهام التي تتضمن نقل الأشياء إلى مواقع مختلفة، والوصول إلى الأهداف، وإكمال تسلسلات طويلة من الأفعال. وفي المهام التي تتطلب استدلالاً مكانياً، نجح النظام الجديد بنسبة 64 بالمائة فقط من المرات، مقارنة بمعدل نجاح أعلى بكثير للنظام الأصلي الأبطأ. وفي المهام التي تتطلب وصول الروبوت إلى هدف محدد، انخفض النجاح إلى 52 بالمائ. كما اتسعت الفجوة بشكل أكبر في المهام الطويلة والمعقدة، حيث نجح النظام الجديد بنسبة 26 بالمائة فقط من المرات.
لقد كان الباحثون حذرين لضمان أن هذه الإخفاقات لم تكن مجرد سوء حظ. فقد أجروا التجربة ثلاث مرات مع نقاط بداية عشوائية مختلفة، وكانت النتائج سيئة باستمرار في جميع الحالات. وتخبرنا هذه الاستمرارية أن المشكلة ليست مجرد صدفة، بل هي قيد جوهري في نهج الخطوة الواحدة تحت إعداداتهم الحالية. يبدو أن النظام يعاني لأنه مُجبر على الالتزام بتوقع واحد فوراً، بدلاً من امتلاك رفاهية تحسين فكرته عبر عدة تمريرات. وعندما تكون المهمة معقدة أو طويلة، يؤدي هذا النقص في التحسين إلى تراكم الأخطاء، مما يتسبب في فشل الروبوت.
كما يستكشف التقرير نسخة أكثر تقدماً من هذه الفكرة تسمى "DrifOv"، والتي تحاول التعامل مع مشكلة الفعل غير المتزامن في العالم الحقيقي. في الروبوت الحقيقي، غالباً ما تصل خطط جديدة بينما لا يزال الروبوت ينفذ الخطط القديمة. وقد بنى الباحثون نظاماً يمكنه أخذ خطة غير مكتملة وملء الخطوات المستقبلية المفقودة دون إعادة كتابة ما تم الالتزام به بالفعل. وبينما تم تنفيذ هذه الميزة واختبارها بنجاح في التدريب، إلا أن التجارب القياسية لم تستخدمها، مما يعني أن معدلات السرعة والفشل المبلغ عنها تنطبق فقط على النسخة الأبسط والمتزامنة. ويشير الباحثون إلى أن الإعداد الحالي لا يثبت بعد أن هذه الطريقة المتقدمة من شأنها حل مشكلة النجاح، رغم أنها تظل توجهاً واعداً للعمل المستقبلي.
في نهاية المطاف، تعمل هذه الدراسة كفحص واقعي لفكرة إمكانية جعل الروبوتات أسرع ببساطة عن طريق إزالة التعقيد. فقد وجد الباحثون أنه بينما استطاعوا جعل "دماغ" الروبوت أسرع تسعة أضعاف في إنشاء قائمة من الحركات، إلا أن الروبوت لم يستطع استخدام تلك السرعة بشكل موثوق لإكمال المهام. لم تترجم هذه السرعة إلى نظام أفضل إجمالاً لأن الدقة انخفضت كثيراً لدرجة تجعلها غير مفيدة. ويخلص التقرير إلى أن المسار للمضي قدماً ليس مجرد التخلص من التخطيط البطيء والدقيق، بل في إيجاد طريقة للحفاظ على الدقة مع اكتساب السرعة في الوقت ذاته. ويقترح الباحثون أن العمل المستقبلي يجب أن يركز على اختبار ما إذا كان تشغيل خطة الروبوت بشكل متكرر، بدلاً من تشغيلها في كتل طويلة، يمكن أن يساعد في سد الفجوة بين سرعة النظام الجديد وموثوقية النظام القديم. أما الآن، فالدرس واضح: في عالم التحكم الروبوتي، التفكير بشكل أسرع لا يعني بالضرورة الأداء بشكل أفضل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.