← أحدث الأبحاث
💻 computer science

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

تقدم الورقة البحثية VLAct، وهو نهج للتدريب المسبق المستمر متمحور حول التمثيل لنماذج الرؤية واللغة والعمل (Vision-Language-Action)، والذي يستفيد من بيانات متعددة التجسيد غير متجانسة لتحقيق قدرة فائقة على النقل والأداء عبر مهام متنوعة وروبوتات غير مرئية، حتى في ظل ميزانيات حوسبة متواضعة وبيانات لاحقة محدودة.

المؤلفون الأصليون: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, J
نُشر 2026-08-31
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات في التعلم من التجربة بالطريقة التي يفعلها البشر. فبينما يمكن لطفل أن يشاهد والده وهو يصب كوبًا من الماء ويفهم الحركة، يتطلب الروبوت عادةً آلاف التعليمات المحددة والمبرمجة يدويًا لأداء المهمة نفسها. لسنوات، حاول العلماء حل هذه المشكلة عبر تغذية الروبوتات بكميات هائلة من البيانات، آملين أن يؤدي الحجم الهائل إلى تعليمها كيفية الحركة. يعتمد هذا النهج على نماذج "الرؤية واللغة والفعل" (Vision-Language-Action models)، وهي أنظمة حاسوبية يمكنها رؤية صورة، وفهم جملة، واتخاذ قرار بشأن حركة بدنية. كان الاعتقاد السائد هو أنه إذا قمت ببساطة بجمع ما يكفي من حركات الروبوت، فإن النظام سيصبح ذكيًا بما يكفي للتعامل مع أي موقف. ومع ذلك، فإن جمع بيانات الروبوت أمر صعب ومكلف للغاية؛ فخلافًا للصور أو النصوص الموجودة على الإنترنت، يجب تسجيل حركات الروبوت في العالم المادي الحقيقي، وغالبًا ما يتم ذلك عن طريق توجيه البشر للآلات. وهذا النقص يعني أن أكبر مجموعات بيانات الروبوت هي ضئيلة ومتفرقة مقارنة باتساع العالم المادي.

اقترح فريق من الباحثين مسارًا مختلفًا للمضي قدمًا، مما يوحي بأن جودة ما يتعلمه الروبوت أكثر أهمية من كمية البيانات التي يراها. ويجادلون بأنه بدلًا من مجرد حفظ حركات محددة، يحتاج دماغ الروبوت إلى تعلم فهم عميق ومرن لكيفية ارتباط الأشياء والأفعال ببعضها البعض. ومن خلال التركيز على هذا "التمثيل" (representation) — وهو الخريطة الداخلية التي يبنيها الروبوت عن العالم — نجحوا في ابتكار طريقة تدريب جديدة تسمح للروبوتات بالتعميم بشكل أفضل بكثير. ويظهر عملهم أنه من خلال طريقة أذكى لتعليم الدماغ الجوهري للروبوت، يمكن للنظام أن يتعلم أداء مهام معقدة على روبوتات لم يسبق له رؤيتها، باستخدام جزء بسيط فقط من البيانات التي كان يُعتقد سابقًا أنها ضرورية.

بدأ الباحثون، الذين يعملون تحت اسم VLAct، بسؤال جوهري: لماذا تفشل الروبوتات في التعميم؟ عندما يتم تدريب الروبوت على مجموعة محددة من الحركات، فإنه غالبًا ما يصبح متخصصًا للغاية، حيث يتعلم محاكاة الأنماط الدقيقة التي رآها بدلاً من فهم الفيزياء الكامنة وراء المهمة. وللتحقيق في ذلك، نظر الفريق في كيفية تأثير الطرق المختلفة لتعليم الروبوت على فهمه الداخلي. ووجدوا أنه إذا تم تدريب الروبوت على التنبؤ بالأفعال باستخدام طريقة واحدة محددة فقط، فإنه يصبح "محبوسًا" في تلك الطريقة. الأمر يشبه طالبًا يتعلم حل المسائل الرياضية باستخدام صيغة واحدة محددة فقط؛ فإذا غير الاختبار تنسيق السؤال، سيفشل الطالب لأنه لم يتعلم المفهوم نفسه أبدًا. واكتشف الباحثون أن هذا "الحبس" يحدث عندما يُجبر دماغ الروبوت على ملاءمة معرفته في هيكل واحد صلب أثناء التدريب.

ولإصلاح ذلك، طور الفريق "وصفة تدريب" جديدة تحافظ على مرونة دماغ الروبوت. بدأوا بنموذج لغة ورؤية قوي، وهو نوع من الذكاء الاصطناعي المدرب بالفعل على كميات هائلة من صور ونصوص الإنترنت، مما يمنحه فهمًا واسعًا للعالم. وبدلاً من ترك تدريب الروبوت يمحو هذه المعرفة الواسعة، قاموا بحماية الطبقات الدنيا من الدماغ التي تتعامل مع التعرف البصري الأساسي. ثم قدموا تقنية تدريب فريدة حيث يُطلب من الروبوت التنبؤ بنفس الحركات البدنية باستخدام ثلاث طرق رياضية مختلفة في آن واحد. ومن خلال إجبار الروبوت على تلبية الطرق الثلاثة معًا، منع الباحثون الروبوت من التخصص في طريقة واحدة فقط. ضمن هذا النهج أن يتعلم الروبوت فهمًا عالميًا للفعل، بدلاً من مهارة ضيقة مرتبطة بطريقة واحدة لحساب الحركة.

علاوة على ذلك، عالج الفريق مشكلة اختلاف أجسام الروبوتات. فالروبوت الذي يمتلك ذراعين يتحرك بشكل مختلف عن الروبوت الذي يمتلك ذراعًا واحدة، والروبوت الذي يمتلك قابضًا (gripper) يتحرك بشكل مختلف عن ذاك الذي يمتلك يدًا. كانت الطرق السابقة تعامل هذه الاختلافات كمشكلات منفصلة، حيث تدرب دماغ فريد لكل نوع من الروبوتات. وبدلاً من ذلك، ابتكر فريق VLAct لغة مشتركة للحركة. لقد علموا الروبوت أن فتح القابض في آلة واحدة هو نفس مفهوم فتح القابض في آلة أخرى، حتى لو اختلفت الميكانيكا الفيزيائية. حققوا ذلك من خلال مواءمة أجزاء الفعل المتشابهة فيزيائيًا، مثل فتح وإغلاق اليد، مع ترك الأجزاء الفريدة لكل جسم روبوت منفصلة. سمح هذا للروبوت بنقل ما تعلمه عن نوع واحد من الآلات إلى نوع مختلف تمامًا من الآلات لم يسبق له مواجهته.

كانت نتائج هذا النهج مذهلة. فعند اختبارهم على مجموعة واسعة من المهام، تفوق النظام الجديد باستمرار على النماذج الحالية، بما في ذلك تلك المدربة على مجموعات بيانات أكبر بكثير. وفي اختبار محاكاة يسمى LIBERO-Plus، والذي يختبر مدى قدرة الروبوت على التعامل مع التغيرات في الإضاءة، وزوايا الكاميرا، ووضع الأشياء، حقق النظام الجديد معدل نجاح بلغ 82.6 بالمائة. وكان هذا أعلى بكثير من الأنظمة الرائدة الأخرى، مما أثبت أن الروبوت قد تعلم فهمًا قويًا للمهمة بدلاً من مجرد حفظ سيناريو محدد. وفي اختبار آخر يسمى RoboTwin 2.0، والذي يتضمن ذراعين آليتين تعملان معًا، وصل النظام إلى معدل نجاح 92.5 بالمائة، متفوقًا على الأنظمة الصناعية الضخمة التي تعتمد على بيانات مملوكة لشركات وقدرات حوسبة هائلة.

ولكن الدليل الأكثر إقناعًا على قوة هذه الطريقة جاء من اختبار تضمن روبوتًا بشريًا (humanoid) جديدًا تمامًا على بيانات التدريب. فقد قام الباحثون بتدريب نظامهم على بيانات من أذرع روبوتية قياسية، ثم طلبوا منه التحكم في روبوت بشري يمتلك أرجلًا وجذعًا، وهي آلة لم يرها من قبل. وباستخدام 20 بالمائة فقط من البيانات المطلوبة عادةً لتدريب روبوت لهذا الجسم المحدد، أدى النظام أداءً أفضل من نموذج أساسي تم تدريبه على 100 بالمائ % من البيانات. وهذا يشير إلى أن الروبوت قد تعلم مفهومًا أساسيًا لـ "كيفية الحركة" يمكن تطبيقه على أي جسم، بدلاً من مجرد حفظ الحركات المحددة للأذرع التي تدرب عليها.

اختبر الباحثون أيضًا نظامهم في العالم الحقيقي، باستخدام أذرع روبوتية فيزيائية لأداء مهام مثل تكديس الكتل، وتنظيف الطاولات، وطي الملابس. وفي هذه التجارب الواقعية، استمر النظام في التفوق على النموذج الأساسي، مظهرًا استقرارًا ودقة أكبر. لقد نجح في التعامل مع أشياء جديدة لم يرها من قبل، مثل التقاط حبة فلفل بدلاً من جزرة، وتولى مهام معقدة متعددة الخطوات مثل غرف الفاصوليا وصبها في وعاء دون تخطي أي خطوات. كما برع النظام في تنسيق ذراعين للعمل معًا، مثل الإمساك بمقبس كهربائي أثناء سحب القابس، مما أظهر مستوى من التزامن كانت النماذج السابقة تجد صعوبة في تحقيقه.

إن ما يجعل هذا العمل مهمًا بشكل خاص هو أنه تم تحقيقه باستخدام بيانات مفتوحة المصدر وقدر ضئيل من قدرة الحوسبة، وتحديدًا إعداد يحتوي على 16 وحدة معالجة رسومات. وهذا يتناقض مع العديد من الأنظمة الأعلى أداءً في هذا المجال، والتي تعتمد على مجموعات بيانات مملوكة لشركات وموارد حوسبة ضخمة ذات نطاق صناعي. لقد أظهر الباحثون أنه من خلال التركيز على كيفية تمثيل الروبوت للعالم داخليًا، بدلاً من مجرد زيادة حجم البيانات، من الممكن بناء روبوتات أكثر قدرة وتكيفًا. وتشير نتائجهم إلى أن مستقبل تعلم الروبوتات لا يكمن في جمع تدفقات لا نهاية لها من البيانات، بل في تصميم طرق تدريب تساعد الروبوت على بناء فهم أعمق وأكثر مرونة للعالم المادي.

يخلص البحث إلى أن الطريقة التي يُعلّم بها الروبوت لا تقل أهمية عن الشيء الذي يُعلّم به. فمن خلال الحفاظ على المعرفة الواسعة لدماغ مدرب مسبقًا وتشجيع الروبوت على تعلم الأفعال بطريقة غير مرتبطة بطريقة واحدة أو نوع جسم واحد، يمكن للباحثين إنشاء أنظمة أكثر قدرة على التعامل مع الطبيعة غير المتوقعة للعالم الحقيقي. يقدم هذا النهج مسارًا واعدًا نحو روبوتات عامة الأغراض يمكنها تعلم مهام جديدة بسرعة والتكيف مع بيئات جديدة دون الحاجة إلى كميات هائلة من البيانات الجديدة. وقد تم إتاحة هذا العمل للجمهور، مما يسم يسمح لعلماء آخرين بالبناء على هذه النتائج واستكشاف كيفية تعليم الآلات التحرك بنفس المرونة والفهم الذي تمتلكه الكائنات الحية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →