← أحدث الأبحاث
💻 computer science

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

يُعد DriftingVLA نموذجاً أصلياً للرؤية واللغة والعمل في خطوة واحدة، يستخدم هدف انزياح التوزيع مع الانزياح الزمني لكل بُعد لتوليد مجموعات كاملة من الإجراءات في تمريرة أمامية واحدة، محققاً أداءً هو الأفضل في فئته على المهام المرجعية مع توفير تسريع قدره 3.36 ضعفاً مقارنة بالطرق التقليدية القائمة على التدفق متعدد الخطوات.

المؤلفون الأصليون: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

نُشر 2026-09-01
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كان حلم الذكاء الاصطناعي هو ابتكار روبوتات يمكنها الرؤية، وفهم اللغة، والتحرك بسلاسة تشبه حركة البشر. لسنوات، بنى الباحثون أنظمة تجمع بين الفهم البصري واللغوي القوي مع القدرة على التحكم في أذرع الروبوت. هذه الأنظمة، المعروفة بنماذج الرؤية واللغة والفعل (vision-language-action models)، تعمل كدماغ للروبوت، حيث تستقبل ما تراه الكاميرا وما ينطقه الإنسان، ثم تقرر كيفية تحريك مفاصل الروبوت لإتمام مهمة ما. ومع ذلك، كان هناك عنق زجاجة كبير حال دون وصول هذه الآلات إلى الاستجابة الحقيقية في الوقت الفعلي. لتوليد تسلسل سلس من الحركات، تعتمد هذه النماذج تقليديًا على عملية معقدة متعددة الخطوات. تخيل أنك تحاول رسم دائرة مثالية من خلال إجراء تصحيحات صغيرة ومترددة عند كل نقطة على طول الخط؛ يتعين على الروبوت حساب مسار، ثم اتخاذ خطوة، ثم التحقق من عمله، ثم اتخاذ خطوة أخرى، وتكرار هذه الدورة مرات عديدة لكل حركة يقوم بها. وبينما تنتج هذه الطريقة نتائج عالية الجودة، إلا أنها بطيئة، مما يؤدي إلى حدوث تأخير يجعل الروبوت يبدو ثقيلاً وغير مستجيب في عالم ديناميكي.

لقد قدم فريق من الباحثين الآن نهجًا جديدًا يغير بشكل جذوري كيفية تخطيط هذه الربوتات لحركاتها، مما يسمح لها بتوليد تسلسل كامل من الأفعال في لحظة واحدة. عملهم، الذي يرتكز على نظام يطلقون عليه اسم DriftingVLA، يستبدل عملية التصحيح التكرارية البطيئة بطريقة تتعلم التنبؤ بالحركة المستقبلية بأكملة دفعة واحدة. وبدلاً من حساب المسار خطوة بخطوة أثناء المهمة الفعلية، يتعلم النظام وجود صلة مباشرة بين نقطة بداية عشوائية والحركة النهائية المطلوبة خلال مرحلة التدريب. هذا التحول يسمح للروبوت بتجاوز الحسابات المتكررة تمامًا عند تشغيله، والانتقال مباشرة إلى الإجراء الصحيح. وفي الاختبارات التي تضمنت مهام معالجة معقدة، لم يكتفِ هذا النهج الجديد بمضاهاة دقة الأنظمة القديمة البطيئة فحًاسب، بل جعل الروبوت أسرع بأكثر من ثلاث مرات، حيث قلل الوقت الذي يستغرقه لاتخاذ قرار بشأن الحركة من أكثر من مائتي مللي ثانية إلى أقل من سبعين مللي ثانية.

يكمن جوهر هذا الاختراق في كيفية تعليم الباحثين للروبوت فهم العلاقة بين أجزائه المتحركة المختلفة. فذراع الروبوت لا يتحرك في خط واحد فحسب، بل لديه مفاصل ودرجات حرية متعددة يجب أن تعمل معًا، مثل التحرك للأمام، والدوران، وفتح القابض. غالبًا ما كانت المحاولات السابقة لتسريع هذه الأنظمة تعامل الحركة بأكملها ككتلة واحدة كبيرة أو تقسمها إلى لحظات زمنية صغيرة ومنفصلة. ومع ذلك، أدرك النهج الجديد أن كل اتجاه محدد للحركة — مثل الرفع العمودي للقابض أو دوران المعصم — له إيقاعه الخاص ونمطه الإحصائي الفريد. وقد طور الباحثون تقنية تسمى "الانجراف الزمني لكل بُعد" (Per-Dimension Temporal Drifting)، والتي تعامل التاريخ الكامل لكل اتجاه حركة فردي كوحدة منفصلة ليتم تعلمها. وهذا يسمح للنظام بفهم الفروق الدقيقة لكيفية فتح القابض أو كيفية دوران المعصم دون إجبار هذه الحركات المختلفة على الامتثال لقاعدة رياضية واحدة جامدة.

ومن الأهمية بمكان أن هذه الطريقة لا تضحي بقدرة الروبوت على تنسيق أطرافه. فبالرغم من أن النظام يتعلم أنماط كل اتجاه حركة بشكل منفصل، إلا أنه لا يزال يولد خطة العمل بأكملها ككل موحد. ويظل دماغ الروبوت، الذي يفهم اللغة والرؤية، سليمًا ويستمر في توجيه خبير الحركة الذي ينتج الحركات. ومن خلال تدريب النظام على صقل تنبؤاته عبر العديد من سيناريوهات "ماذا لو" المتزامنة، ضمن الباحثون أن القرار الواحد في خطوة واحدة يكون بدقة نتيجة الحساب متعدد الخطوات البطيء. وهذا يعني أن الروبوت لا يزال بإمكانه أداء المهام الدقيقة، مثل صب السائل من حاوية إلى أخرى أو تكديس الكتل مع عمل ذراعين بالتزامن، دون التردد الذي عانت منه النماذج السابقة.

اختبر الباحثون هذا النظام الجديد في كل من البيئات المحاكية والعالم الحقيقي لمعرفة ما إذا كانت السرعة ستأتي على حساب الموثوقية. في سلسلة من المحاكاة الصعبة التي تضمنت مهامًا مثل التقاط الأشياء وإعادة ترتيبها، حقق النظام الجديد معدل نجاح يقترب من 98.3 بالمائة، متفوقًا قليلاً على أفضل النماذج الحالية متعددة الخطوات. وعند الانتقال إلى بيئة واقعية باستخدام أذرع روبوتية فيزيائية، حافظ النظام على تفوقه، حيث نجح في 77.67 بالمائة من التجارب عبر ست مهام مختلفة، بما في ذلك تحديات التنسيق بين الذراع الواحدة والذراعين. وكان هذا الأداء أعلى بشكل ملحوظ من طرق الخطوة الواحدة الأخرى التي حاولت تسريع الأنظمة القديمة عبر مجرد قطع عملية حسابها، مما أدى غالبًا إلى انخفاض كبير في الدقة. لقد أثبتت الطريقة الجديدة أنه من خلال تغيير كيفية تعلم النظام، وليس فقط كيفية حسابه، يمكن تحقيق كل من السرعة والدقة.

بعيدًا عن الأرقام المجردة، سلطت الدراسة الضوء على مكاسب الكفاءة الناتجة عن إزالة حلقة الحساب المتكررة. في العالم الحقيقي، حيث كل جزء من الثانية له أهميته، قلل النظام الجديد الوقت المطلوب لتوليد قطعة من الحركة من 227.61 مللي ثانية إلى 67.67 مللي ثانية. ويمثل هذا تسريعًا بأكثر من ثلاث مرات، مما يقضي فعليًا على التأخير الذي يجعل الروبوتات تبدو منفصلة عن بيئتها. وبينما تطلبت عملية التدريب قوة حوسبة أكبر للتعامل مع سيناريوهات "ماذا لو" المتعددة أثناء مرحلة التعلم، فإن هذه التكلفة هي استثمار لمرة واحدة. فبمجرد تدريب الروبوت، يعمل بكفاءة الخطوة الواحدة الرشيقة التي لا تتطلب موارد إضافية. إن هذا العمل يوضح أن مستقبل الروبوتات المستجيبة قد لا يكمن في بناء أجهزة كمبيوتر أسرع لتشغيل خوارزميات أبطأ، بل في إعادة تصميم الخوارزميات نفسها لتكون مباشرة وفورية بطبيعتها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →