← أحدث الأبحاث
💻 computer science

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

يُعد FlashVLA إطار عمل موحداً لفك تشفير الأفعال المتدفقة، يتيح استنتاج نماذج VLA سريعاً وغير متزامن عبر الحفاظ على مخزن مؤقت للأفعال متعدد القطع مع انتباه سببي لكل قطعة، محققاً تردد تحكم يتجاوز 30 هرتز مع ضمان تنفيذ روبوتي سلس ومتسق زمنياً.

المؤلفون الأصليون: Zekai Li, Jiaming Tang, Zhijian Liu

نُشر 2026-08-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zekai Li, Jiaming Tang, Zhijian Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات التي يمكنها الرؤية، والفهم، والتحرك ببراعة تشبه البشر هي "الكأس المقدسة" للأتمتة. لسنوات، بنى الباحثون أنظمة يمكنها تحديد كوب على طاولة أو اتباع أمر لفظي مثل "ارفع هذا". ومع ذلك، ظل تحويل ذلك الفهم إلى حركة فيزيائية سلسة وفي الوقت الفعلي عقبة مستعصية. تكمن الصعوبة الجوهرية في التوقيت: يجب على الروبوت أن ينظر باستمرار إلى العالم، ويعالج تلك الصورة، ويقرر ما سيفعله بعد ذلك، ثم يحرك ذراعه، كل ذلك في جزء من الثانية. إذا استغرقت عملية التفكير وقتاً طويلاً، فإن الروبوت يتأخر، ويعمل بناءً على معلومات قديمة ويفقد هدفه. هذا التأخير حاد بشكل خاص في الجيل الأحدث من أدمغة الروبوتات، المعروفة بنماذج "الرؤية واللغة والعمل" (Vision-Language-Action models). هذه الأنظمة قوية لأنها تجمع بين القدرة على الرؤية والقراءة مع القدرة على تخطيط الحركات، لكنها بطيئة أيضاً. فهي غالباً ما تعمل عن طريق تقسيم الحركة إلى أجزاء صغيرة وتكرار صقل كل جزء من خلال سلسلة من الحسابات المتكررة والمستهلكة للوقت قبل إرسال الأمر إلى المحرك. والنتيجة هي روبوت يتردد، أو يتلعثم، أو يتحرك بتأخر يجعل المهام الدقيقة مستحيلة.

ولحل هذه المشكلة، قدم فريق من الباحثين من جامعة كاليفورنيا في سان دييغو ومعهد ماساتشوستس للتكنولوجيا إطار عمل جديداً يسمى FlashVLA، مصمماً للسماح لهذه الأدمغة الروبوتية بالتفكير والتحرك في آن واحد بدلاً من العمل بشكل متسلسل. تخيل خط تجميع في مصنع حيث ينتظر العامل انتهاء فحص المنتج بالكامل قبل البدء في المنتج التالي؛ هنا يتوقف الخط باستمرار. يقوم FlashVLA بتغيير سير العمل بحيث يكون العامل دائماً بصدد التعامل مع مرحلة مختلفة من المنتج في نفس الوقت، مما يضمن تدفقاً ثابتاً ومستمراً. ومن الناحية التقنية، استبدل الباحثون الطريقة القديمة المتمثلة في فك تشفير حركة كاملة واحدة في كل مرة بمنهج "البث" (streaming). فبدلاً من انتظار اكتمال خطة الحركة بالكامل لتصبح مثالية قبل التنفيذ، يحافظ النظام على مخزن مؤقت (buffer) لعدة خطط حركة في مراحل مختلفة من الاكتمال. بعض الخطط شبه مكتملة وجاهزة للتنفيذ، بينما لا تزال خطط أخرى في بدايتها ولا تزال قيد الصقل. يقوم النظام بتحديث كل هذه الخطط دفعة واحدة، في خطوة واحدة، ويرسل فوراً الخطة الأكثر اكتمالاً إلى محركات الروبوت. وهذا يسمح للروبوت بالاستمرار في الحركة بينما لا يزال الكمبيوتر يحدد الخطوات القليلة التالية، مما يخفي فعلياً الوقت الذي تستغرقه عملية التفكير.

إن تأثير هذا التغيير دراماتيكي. ففي تجاربهم، وجد الباحثون أن طريقة البث هذه قللت الوقت المطلوب لتوليد إجراء واحد بمقدار عشرين ضعفاً مقارنة بالنهج القياسي. وعلى بطاقة رسوميات واحدة، حقق النظام تردد تحكم لا يقل عن ثلاثين مرة في الثانية، وهي سرعة تبدو فورية للمراقب البشري. والأهم من ذلك، أن هذه السرعة لم تأتِ على حساب الدقة. ولأن النظام يعالج أجزاء الحركة هذه معاً، فإن الخطوات المستقبلية تتعلم طبيعياً من الخطوات التي أوشكت على الحدوث الآن. وهذا يخلق حركة سلسة ومستمرة تتجنب الحركات المتقطعة وغير المتناسقة التي غالباً ما تعاني منها الروبوتات التي تحاول العمل بناءً على معلومات قديمة. وفي البيئات المحاكية والاختبارات الواقعية باستخدام الأذرع الروبوتية، طابق النظام الجديد أو تجاوز معدل نجاح النماذج التقليدية الأبطأ، مع العمل بسرعة أكبر بكثير.

اكتشف الباحثون أيضاً أن هذه الطريقة جعلت الروبوتات أفضل بشكل مفاجئ في المهام الطويلة والمعقدة. فعندما يتعين على الروبوت تنفيذ سلسلة من الإجراءات التي تستغرق وقتاً طويلاً لإكمالها، فإن قدرة النظام الجديد على التطلع للأمام وتذكر الماضي القريب ساعدته على البقاء على المسار الصحيح. وفي مجموعة من التجارب المتعلقة بالمهام طويلة الأمد، قفز معدل النجاح بأكثر من ستة وثلاثين بالمائة مقارنة بأفضل طريقة سابقة. وهذا يشير إلى أن الطريقة التي يربط بها النظام أفعاله الحالية بخططه المستقبلية تخلق نوعاً من الذاكرة قصيرة المدى تساعد الروبوت على التنقل في التسلسلات المعقدة دون أن يفقد مساره. اختبر الفريق هذه الأفكار على إعدادات روبوتية متنوعة، بما في ذلك أنظمة الذراع الواحدة والذراعين، ووجدوا أن التحسينات في السرعة والسلاسة ظلت ثابتة عبر مختلف أنواع الأجهزة وأنواع المهام.

ما يجعل هذا العمل مهماً بشكل خاص هو أنه يحل مشكلتين في آن واحد: بطء الحساب، وعدم التطابق بين ما يراه الروبوت ومكانه الفعلي. كانت المحاولات السابقة لمعاللة البطء تؤدي غالباً إلى جعل الروبوت يعمل بناءً على بيانات قديمة، بينما كانت المحاولات لمعالجة عدم تطابق البيانات تتطلب حسابات إضافية معقدة تبطئ الروبوت مرة أخرى. يزيل FlashVLA هذه المقايضة من خلال هيكلة عملية التفكير نفسها لتكون مستمرة. وقد أثبت الباحثون أنه من خلال تغيير كيفية معالجة الروبوت لخطط حركته — عبر الاحتفاظ بمخزن مؤقت متجدد للخطط في مراحل مختلفة من الجاهزية — يمكنهم تحقيق مستوى من الانسيابية كان بعيد المنال سابقاً. والنتيجة هي روبوت يمكنه الاستجابة بسرعة، والتحرك بسلاسة، والتعامل مع مهام المناولة المعقدة بموثوقية تقرب حلم الأتمتة المرنة في العالم الحقيقي خطوة أخرى من الواقع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →