← أحدث الأبحاث
💻 computer science

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

يُعد GE-Act 2.0 نموذجاً جديداً للفعل في العالم، تم تدريبه من الصفر على بيانات المناولة، وهو يدمج مشفراً تلقائياً موجهاً للتحكم، ومخططاً بصرياً أحادي الخطوة، ونموذج ديناميكيات عكسية مع تحسين انتقائي متوافق معرفياً، محققاً نجاحاً كبيراً في القدرة على الصفر (zero-shot) عبر مهام وتجسيدات متنوعة من خلال التوسع الواسع والنقل عبر التجسيدات المختلفة.

المؤلفون الأصليون: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xion
نُشر 2026-09-09
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات أسياداً في أرض المصنع، حيث تكرر نفس الحركة الدقيقة آلاف المرات دون خطأ. ولكن بمجرد وضعها في مطبخ، أو غرفة معيشة، أو ورشة عمل فوضوية، فإنها غالباً ما تتجمد. لا يكمن التحدي في مجرد تحريك يد، بل في فهم كيف يتغير العالم عندما تلمس تلك اليد شيئاً ما. وللتنقل عبر هذا التحدي، يتعلم جيل جديد من الذكاء الاصطناعي تخيل المستقبل. فبدلاً من مجرد الاستجابة لما تراه الآن، تحاول هذه الأنظمة التنبؤ بما سيحدث بعد ذلك إذا اتخذت إجراءً معيناً. هذا النهج، المعروف باسم نموذج "العالم-الفعل" (world-action model)، يسمح للروبوت بمحاكاة تسلسل من الأحداث في ذهنه قبل أن يحرك عضلة واحدة، للتحقق مما إذا كانت النتيجة تتوافق مع هدفه. لسنوات، حاول الباحثون بناء هذه الأنظمة عبر أخذ مولدات الفيديو الموجودة بالفعل — وهي برامج مدربة على إنشاء أفلام مزيفة — وإجبارها على فهم حركات الروبوت. ومع ذلك، غالباً ما يترك هذا الأسلوب الروبوت بفهم غامض للفيزياء، لأن مولد الفيديو لم يصمم حقاً للتحكم في جسد مادي.

قدم فريق من "آجي بوت" (AgiBot) الآن نهجاً مختلفاً، يبني خيال الروبوت من الصفر باستخدام بيانات التفاعل في العالم الحقيقي فقط. لقد أنشأوا نظاماً يسمى "GE-Act 2.0"، يتعلم التنبؤ بالمستقبل واتخاذ القرارات بشأن الأفعال في آن واحد، ولكن مع تحول جوهري: كل جزء من النظام يتم تدريبه من الصفر بناءً على بيانات تم جمعها من روبوتات وبشر يتلاعبون بالأشياء. لم يعتمد الباحثون على نماذج فيديو جاهزة، بل علموا النظام لغة حركة مضغوطة، وهي طريقة لرؤية العالم تجرد التفاصيل غير الضرورية للتركيز على ما يهم للتحكم. سمح هذا للروبوت بالتعلم من مكتبة واسعة ومتنوعة من البيانات، بما في ذلك ساعات من العروض الناجحة، والمحاولات الفاشلة، وحتى فيديوهات لبشر يعملون دون أي تعليمات مسجلة. ومن خلال الجمع بين هذه الأنواع المختلفة من التعلم، تعلم النظام القدرة على التعميم، مما يعني أنه يمكنه تطبيق ما تعلمه في موقف ما على موقف جديد تماماً لم يره من قبل.

يكمن جوهر هذا الإنجاز في كيفية تعامل الباحثين مع الواقع الفوضوي للعالم المادي. فعندما يحاول الروبوت التعلم، فإنه غالباً ما يواجه مشكلة مربكة: يمكن إكمال التعليمات نفسها بطرق مختلفة عديدة. قد يُطلب من الروبوت "التقاط الكوب الأحمر"، ويمكنه الاقتراب من اليسار، أو اليمين، أو الإمساك به من المقبض أو الحافة. وإذا كانت بيانات التدريب تظهر طريقة واحدة فقط، بينما يتنبأ خيال الروبوت بطريقة أخرى، فقد يختل التوازن بين جزئي النظام. حدد الباحثون هذا التباين بوصفه "فجوة الصلاحية" (validity gap)، حيث لا يتوافق تنبؤ الروبوت بالمستقبل مع الفعل الذي من المفترض أن يقوم به. ولإصلاح ذلك، طوروا عملية اختيار تعمل كمرشح (فلتر). فقبل أن يتعلم الروبوت من مستقبل متوقع، يتحقق مما إذا كان ذلك المستقبل متوافقاً مع الفعل الذي يحتاج للقيام به. إنه يولد عدة مستقبليات ممكنة، ويختبرها مقابل الفعل المطلوب، ويتعلم فقط من تلك التي تبدو منطقية معاً. وهذا يضمن عدم تشويه فهم الروبوت لكيفية أداء الأفعال المختلفة لنتائج مختلفة.

نتائج هذا التدريب مذهلة، خاصة عند اختبارها على مهام لم يمارسها الروبوت من قبل. قيم الباحثون النظام في مائة مهمة تلاعب متميزة، تتراوح بين تكديم الكتل وسكب السوائل إلى طي المناشف وإدخال القوابس. أُجريت هذه الاختبارات على روبوتات حقيقية في بيئات ذات إضاءة وخلفيات وترتيبات أشياء مختلفة عن تلك المستخدمة أثناء التدريب. عندما تم تدريب النظام على مجموعة بيانات صغيرة تبلغ 300 ساعة، نجح في 17.1% فقط من المهام على نموذج روبوت واحد. ومع ذلك، عندما رفع الباحثون حجم بيانات التدريب إلى 30,000 ساعة، ارتفع معدل النجاح بثبات إلى 44.1%. حدث هذا التحسن دون أي ضبط دقيق خاص للمهام الفردية؛ فقد طبق الروبوت ببساطة المهارات العامة التي تعلمها على التحديات الجديدة. والأكثر إثارة للدهشة، هو أن النظام أظهر قدرات قوية على نموذج روبوت ثانٍ ومختلف، والذي شكل أقل من 2% من بيانات التدريب، مما يشير إلى أن المهارات المتعلمة من مجموعة البيانات الأكبر انتقلت بفعالية إلى شكل مادي جديد.

كما تم اختبار قدرة النظام على اتباع التعليمات في ظروف صعبة. في العديد من التجارب، طُلب من الروبوت القيام بفعل يتعارض مع ما قد يتوقعه بناءً على المشهد أو عادة سابقة. على سبيل المثال، إذا كان الروبوت في منتصف حركة ما، فلا يزال بإمكانه التوقف واتباع أمر صريح لتغيير مساره. وفي أكثر من 90% من هذه التجارب، حدد الروبوت بشكل صحيح الشيء المحدد، أو اللون، أو الشكل، أو الموقع المذكور في التعليمات، حتى عندما كانت تلك التفاصيل دقيقة أو السياق مربكاً. وجد الباحثون ارتباطاً قوياً بين تنوع المهارات التي تعلمها الروبوت أثناء التدريب وقدرته على النجاح في المهام الجديدة. فكلما زادت تنوع بيانات التدريب، زادت احتمالية تعامل الروبوت مع موقف جديد. وهذا يشير إلى أن الطريق نحو روبوتات أكثر قدرة لا يكمن فقط في خوارزميات أفضل، بل في الحجم الهائل والتنوع في البيانات التي تستهلكها.

يمثل هذا العمل خطوة هامة نحو روبوتات يمكنها التعلم من نفس البيانات الغنية وغير المنظمة التي يستخدمها البشر لفهم العالم. ومن خلال بناء نظام يتنبأ بالمستقبل ويخطط للأفعال بطريقة موحدة، ومن خلال تعليم الروبوت اختيار التنبؤات الصحيحة من بين احتمالات عديدة، نجح الباحثون في إنشاء نموذج قوي وقابل للتكيف. وتشير النتائج إلى أنه مع وجود تجربة متنوعة كافية، يمكن للروبوت تطوير فهم عمود وتلقائي لكيفية سلوك الأشياء وكيفية التفاعل معها، متجاوزاً البرمجة الجامدة نحو شكل أكثر مرونة من الذكاء. إن نجاح هذا النهج على أجهزة حقيقية، دون الحاجة لإعادة التدريب لكل وظيفة جديدة، يشير إلى مستقبل يمكن فيه نشر الروبوتات في بيئات ديناميكية وغير متوقعة والتعلم للازدهار فيها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →