Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
تقترح الورقة البحثية Tok، وهو مُرمز أفعال (action tokenizer) جديد متعدد الرؤوس ومتعدد الكتب الرمزية (multi-head multi-codebook)، يعمل على تقليل خطأ إعادة البناء بشكل كبير وتعزيز أداء نماذج الرؤية واللغة والأفعال (Vision-Language-Action models) من خلال تفكيك الميزات الكامنة إلى رؤوس متخصصة ذات كتب رمزية مستقلة لالتقاط ديناميكيات الأفعال دقيقة التفاصيل بشكل أفضل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كافحت الروبوتات للتحرك بمرونة وسلاسة اليد البشرية. وبينما يمكن للذكاء الاصطناعي الحديث الآن كتابة الشعر، وتشخيص الأمراض، وتوليد صور مذهلة، فإن منح الآلة القدرة على التحكم المادي في العالم يظل تحديًا مستعصيًا. يكمن جوهر المشكلة في كيفية فهم الكمبيوتر للحركة؛ فخلافًا للنصوص، التي تتكون من حروف متميزة، أو الصور، التي تتكون من بكسلات، فإن الأفعال الفيزيائية لذراع الروبوت هي تدفقات مستمرة من البيانات. لا تنتقل ذراع الروبوت ببساطة من وضعية إلى أخرى، بل تتدفق عبر عدد لا نهائي من المواضع الصغيرة فيما بينهما. ولتعليم الروبوت باستخدام نماذج اللغة القوية التي تقود الذكاء الاصطناعي اليوم، يجب على المهندسين أولاً ترجمة هذه الحركة السلسة والمستمرة إلى سلسلة من الخطوات المنفصلة، تمامًا مثل تحويل نهر متدفق إلى سلسلة من الخرز الفردي. تُعرف عملية الترجمة هذه باسم "الترميز" (tokenization). فإذا كانت الترجمة خشنة للغاية، يفقد الروبوت التفاصيل الدقيقة لحركته، مما يؤدي إلى أفعال متقطعة وغير دقيقة تفشل في المهام الدقيقة. وإذا كانت الترجمة معقدة للغاية، فلن يتمكن الكمبيوتر من معالجتها بالسرعة الكافية للاستجابة في الوقت الفعلي.
لسنوات، حاول الباحثون حل مشكلة الترجمة هذه، لكن الأساليب الموجودة غالبًا ما تحاول وضع "وتد مربع في ثقب مستدير". فبعض النهج تعامل مع كل حركة كقائمة بسيطة من الفئات الثابتة، مما يتجاهل التوقيت والعلاقات الدقيقة بين الخطوات. وتحاول أساليب أخرى ضغط البيانات عن طريق تجميع الحركات معًا، لكنها غالبًا ما تفقد التفاصيل المحددة اللازمة للتحكم الدقيق، مثل الزاوية الدقيقة للمعصم أو الضغطة اللطيفة للمقبض. ويخلق فقدان التفاصيل هذا عنق زجاجة، مما يمنع الروبوتات من تعلم مهارات معقدة مثل تكديس الأشياء الهشة أو تجميع الأجزاء المعقدة. والنتيجة هي روبوت يمكنه أداء مهام واسعة وبسيطة، ولكنه يتعثر عندما يواجه المتطلبات الدقيقة للعالم الحقيقي.
اقترح فريق من الباحثين الآن طريقة جديدة للتعامل مع هذه الترجمة، مقدمين منهجًا يحافظ على غنى الحركة مع إبقاء البيانات مدمجة بما يكفي ليعالجها الذكاء الاصطناعي الحديث. أطلقوا على نظامهم اسم M2Tok، وهو أداة مصممة لتفكيك التدفق المستمر لأفعال الروبوت إلى تنسيق يمكن لنماذج اللغة فهمه دون فقدان الديناميكيات دقيقة التفاصيل المطلوبة للنجاح. وبدلاً من معاملة جسم الروبوت بأكمله ككتلة واحدة ضخمة من البيانات، يقوم نهجهم بتقسيم الحركة إلى قنوات منفصلة ومتخصصة. تخيل ذراع روبوت تحتاج إلى تحريك الكتف، والمرفق، والمعصم، والمقبض جميعًا في وقت واحد. كانت الأساليب القديمة تحاول ضغط كل هذه الحركات المختلفة في رمز واحد، مما يجبر النظام غالبًا على الاختيار بين الدقة للذراع والدقة للمقبض. ومع ذلك، فإن الطريقة الجديدة تفصل هذه الحركات إلى مجموعات متميزة، مما يسمح للذكاء الاصطناعي بالتركيز على الفروق الدقيقة لكل جزء بشكل مستقل.
حقق الباحثون ذلك من خلال تقسيم بيانات حركة الروبوت إلى عدة "رؤوس"، حيث يكون كل رأس مسؤولًا عن جانب مختلف من الحركة. قد يتتبع أحد الرؤوس موضع الذراع، بينما يتتبع آخر فتح وإغلاق المقبض. ومن الأهمية بمكان أن يستخدم كل من هذه الرؤوس قاموسًا مستقلًا لرموز الحركة الخاصة به. ومن خلال استخدام قواميس متعددة تعمل بالتوازي، يخلق النظام عددًا هائلاً من التشكيلات الممكنة، وهو أكثر بكما مما يمكن أن يقدمه قاموس واحد. تتيح هذه القوة التوافقية للنظام تمثيل مجموعة أوسع بكثير من الحركات بدقة عالية. الأمر يشبه كيف يمكن للموسيقي إنشاء عدد لا نهائي من الألحان من خلال الجمع بين مجموعة محدودة من النوتات عبر آلات موسيقية مختلفة؛ حيث يجمع النظام الجديد مجموعات محدودة من رموز الحركة عبر "آلات" جسم الروبوت المختلفة لإعادة إنشاء أفعال معقدة بدقة ملحوظة.
لاختبار هذه الفكرة، درب الباحثون نظامهم على مجموعة كبيرة من مهام الروبوت المحاكية، والتي تراوحت من طرق كتلة إلى التقاط زجاجات متنوعة ووضع الحاويات على الأطباق. وقارنوا طريقتهم الجديدة بعدة تقنيات موجودة تم استخدامها في هذا المجال. وأظهرت النتائج ميزة واضحة للنهج الجديد. ففي سلسلة من اثني عشر مهمة محاكاة، نجح الروبوت الذي يستخدم الطريقة الجديدة في 51 بالمائة من محاولاته، متفوقًا بشكل كبير على أفضل طريقة تالية، والتي نجحت في 45 بالمائة فقط من الحالات. وكان التحسن أكثر دراماتيكية في المهام الصعبة التي تتطلب دقة عالية. على سبيل المثال، في مهمة تتضمن نقل علبة إلى قدر، نجحت الطريقة الجديدة تقريبًا بضعف معدل نجاح أفضل نهج سابق. وفي مهمة أخرى تتضمن وضع صندوق برجر وبطاطس على صينية، حققت الطريقة الجديدة نسبة نجاح 64 بالمائة، بينما حقق أفضل نهج سابق 52 بالمائة فقط.
اختبر الباحثون أيضًا النظام في مجموعة مختلفة من البيئات المحاكية لمعرفة ما إذا كانت المهارات يمكن أن تنتقل إلى مواقف جديدة. وهنا، أظهرت الطريقة الجديدة مرة أخرى أداءً متفوقًا، محققة نسبة نجاح 28 بالمائة مقارنة بـ 21 بالمائة للبديل الرائد. وكان الفرق الأكثر بروزًا في مهمة تتطلب من الروبوت التقاط باذنجانة ووضعها في سلة. الباذنجان جسم غير منتظم الشكل ويصعب الإمساك به، وفشلت الأساليب السابقة في حل هذه المهمة تمامًا. ومع ذلك، نجحت الطريقة الجديدة بنسبة 33 بالمائة من الوقت، مما يشير إلى أن قدرتها على التقاط التفاصيل الدقيقة سمحت لها بالتعامل مع الهندسة المعقدة للجسم حيث فشلت الطرق الأخرى.
للتأكد من أن هذه النتائج لم تكن مجرد نتاج للمحاكاة، أخذ الفريق نماذجهم المدربة واختبروها على روبوتات حقيقية. استخدموا منصة متنقلة مجهزة بأربعة أذرع روبوتية وكاميرا، وطلبوا من الروبوتات أداء ثلاث مهام مختلفة: قرع جرس، ووضع حاوية على طبق، والتقاط زجاجات مختلفة. كانت هذه اختبارات "صفرية التدريب" (zero-shot)، مما يعني أن الروبوتات لم ترَ هذه الأجسام أو البيئات الحقيقية المحددة من قبل؛ بل كان عليها الاعتماد كليًا على ما تعلمته في المحاكاة. تفوقت الطريقة الجديدة مرة أخرى على غيرها، محققة متوسط معدل نجاح 33 بالمائة عبر المهام الثلاث، مقارنة بحد أقصى قدره 28 بالمائة لأفضل بديل. وأظهرت الأدلة المرئية من هذه الاختبارات نجاح الروبوتات في تحديد مواضع الأجسام وتنفيذ عمليات إمساك دقيقة، مما يؤكد أن الترجمة عالية الجودة لبيانات الحركة صمدت عندما غادرت الروبوتات الكمبيوتر ودخلت العالم المادي.
بعيدًا عن الدقة، نظر الباحثون أيضًا في مدى سرعة عمل النظام. فلكي يكون الروبوت مفيدًا، يجب أن يتخذ القرارات بسرعة كافية للاستجابة لبيئته. سمحت الطريقة الجديدة للروبوت بالعمل بتردد يزيد عن 8 هرتز، مما يعني أنه يمكنه اتخاذ أكثر من ثمانية قرارات كل ثانية. وهذا يمثل تحسنًا كبيرًا عن الأساليب القديمة التي كانت تعمل عند 2 هرتز فقط. علاوة على ذلك، عندما قام الباحثون بتحسين النظام من أجل السرعة باستخدام محرك معالجة متخصص، استطاع الروبوت الوصول إلى تردد 56 هرتز، وهو ما يتجاوز بكثير السرعة المطلوبة لمعظم مهام التحكم في الوقت الفعلي. هذا الجمع بين الدقة العالية والسرعة العالية يشير إلى أن الطريقة الجديدة يمكن أن تكون حلاً عمليًا لنشر الروبوتات المتقدمة في البيئات الديناميكية.
يعتمد نجاح هذا العمل على تحول جوهري في كيفية معالجة بيانات الحركة. فمن خلال رفض فكرة أن كل حركة يجب أن تُضغط في رمز واحد موحد، سمح الباحثون للنظام باحترام الطبيعة الفريدة لأجزاء مختلفة من جسم الروبوت. إن فصل الحركة إلى قنوات مستقلة، إلى جانب استخدام قواميس متخصصة متعددة، خلق نظامًا يمكنه التقاط التفاصيل الدقيقة وعالية التردد للحركة التي فاتتها الأساليب السابقة. لم يتطلب هذا النهج تغيير البنية الأساسية لنماذج اللغة التي تقود الروبوتات؛ بل وفر طريقة أفضل لتغذية البيانات إليها. والنتيجة هي روبوت يمكنه فهم وتنفيذ مهام فيزيائية معقدة بمستوى من البراعة كان بعيد المنال سابقًا، مما يسد الفجوة بين الذكاء الرقمي لنماذج اللغة والواقع المادي للعالم الذي يُفترض بها التنقل فيه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.