← أحدث الأبحاث
💻 computer science

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

تُعد ChainVLA سياسة رؤية-لغة-فعل مكونة من 1.2 مليار معلمة، تحقق أداءً فائقاً في عمليات المعالجة طويلة المدى من خلال تسلسل استعلامات متتالية عبر حالة تنفيذ موحدة وقابلة للمراجعة تجمع بين الذاكرة العاملة المتكررة لتقدم المهمة وتتبع الحركة لتوليد حركة مستمرة.

المؤلفون الأصليون: Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

نُشر 2026-08-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيف ينظف غرفتك الفوضوية. تعطيه أمرًا بسيطًا: "أعد الألعاب إلى مكانها". الروبوت الذي يفكر في خطوات صغيرة ومنعزلة قد ينظر إلى الأرض، ويلتقط مكعبًا أحمر، ثم يضعه في صندوق. بعد ذلك، يتوقف. ينسى أنه التقط المكعب للتو. ينظر إلى الأرض مرة أخرى، ويرى مكعبًا أزرق، فيلتقطه. ولكن ماذا لو كان من المفترض وضع المكعب الأحمر تحت المكعب الأزرق؟ أو ماذا لو كان على الروبوت أن يتذكر أنه أخلى الجانب الأيسر من الغرفة بالفعل، لذا لا ينبغي له العودة إلى هناك؟ هذا هو تحدي "التلاعب طويل المدى" (long-horizon manipulation). الأمر لا يتعلق فقط بتحريك ذراع، بل يتعلق بالحفاظ على قصة مستمرة في رأسك بينما يداك مشغولتان.

في عالم الروبوتات، يستخدم العلماء ما يسمى بسياسات "الرؤية واللغة والعمل" (Vision-Language-Action - VLA). فكر في هذه السياسات كأنها عقل الروبوت، الذي ينظر إلى الكاميرا (الرؤية)، ويقرأ تعليماتك (اللغة)، ويقرر ماذا يفعل (العمل). عادةً، تعمل هذه العقول في دفعات قصيرة؛ فهي تضع خطة للحركات القليلة القادمة من الثواني، وتنفذ تلك الحركات، ثم تتوقف فورًا لتضع خطة جديدة من الصفر. الأمر يشبه محاولة كتابة رواية عبر كتابة جملة واحدة، ثم مسح ذاكرتك عن الجملة السابقة، ثم محاولة تخمين الجملة التالية بناءً على الصفحة الحالية فقط. المشكلة هي أن الروبوت غالبًا ما يفقد خيط القصة. ينسى ما أنجزه للتو أو يصاب بالارتباك لأن خطته الجديدة تتعارض مع الحركة التي كان يقوم بها بالفعل. تسأل هذه الورقة البحثية: كيف يمكننا صنع روبوت يتذكر قصته ويحافظ في الوقت نفسه على سلاسة حركاته، كل ذلك أثناء مراقبة العالم في الوقت الفعلي؟


الروبوت بذاكرة وزخم

تعرف على ChainVLA. إنه نوع جديد من عقول الروبوتات صممه الباحثون لحل مشكلة "الروبوت النساي". تخيل أنك تركب دراجة في طريق متعرج. لكي تحافظ على توازنك، تحتاج إلى شيئين: تحتاج إلى تذكر أين كنت (هل انعطفت يسارًا للتو؟ هل هناك تلة قادمة؟)، وتحتاج إلى الاستمرار في التبديل بسلاسة حتى لا تترنح وتسقط. تم بناء ChainVLA للقيام بهذا بالضبط لأذرع الروبوت.

تعمل معظم عقول الروبوتات اليوم مثل شخص يلتقط صورة، ويتخذ قرارًا، ثم يضع الصورة جانبًا، ويلتقط صورة جديدة، ويتخذ قرارًا جديدًا. إنهم لا يحملون "شعور" القرار السابق إلى القرار التالي. يغير ChainVLA قواعد اللعبة من خلال ربط هذه القرارات معًا. فهو ينشئ "حالة تنفيذ" خاصة تعمل مثل حقيبة ظهر يرتديها الروبوت. تحتوي هذه الحقيبة على قسمين مهمين جدًا:

  1. قسم "القصة" (سياق التقدم - Progress Context): يحمل ذاكرة لما حققه الروبوت بالفعل. إنه يشبه قائمة مهام ذهنية. إذا نقل الروبوت مكعبًا إلى اليسار، فإن هذا القسم يتذكر: "حسنًا، الجانب الأيسر أصبح نظيفًا". إنه يجمع بين ذاكرة عمل سريعة (ما يحدث الآن) وذاكرة طويلة المدى متباعدة (أحداث هامة حدثت منذ فترة، مثل "لقد نقلت المكعب الأحمر أولاً"). يساعد هذا الروبوت على معرفة أين هو في الصورة الكبيرة للمهمة.

  2. قسم "الزخم" (ذيل الحركة - Motion Tail): هذا هو الجزء المذهل. عندما يقرر الروبوت التحرك، فإنه لا يقول فقط "تحرك للأمام". بل يتنبأ بتسلسل كامل من الحركات للثواني القليلة القادمة. لكنه لا ينفذ في الواقع سوى الحركات القليلة الأولى قبل أن يتوقف ليفكر مرة أخرى. "ذيل الحركة" هو جزء من ذلك التنبؤ الذي لم يتم تنفيذه بعد. يقوم ChainVLA بحفظ هذا المخطط غير المكتمل ويغذي به عقل الروبوت في الخطوة التالية. إنه يشبه العداء الذي، حتى بعد التوقف لربط حذائه، يتذكر تمامًا السرعة التي كان يركض بها وفي أي اتجاه، حتى لا يبدأ من نقطة الصفر.

كيف يعمل في الممارسة العملية

اختبر الباحثون هذه الفكرة في بعض المهام الصعبة. كانت إحدى أصعب المهام تسمى "إعادة المكعب" (Put Back Block). تخيل أن على الروبوت نقل مكعب إلى مكان ما، ثم نقل جسم آخر، ثم إعادة المكعب مرة أخرى إلى ذلك المكان الأصلي. المشكلة؟ بحلول الوقت الذي يكون فيه الروبوت مستعدًا لإعادة المكعب، قد يكون المكان الأصلي مخفيًا عن الكاميرا بواسطة الجسم الجديد. الروبوت العادي سينظر إلى الكاميرا، ولن يرى شيئًا، وسيرتبك. سينسى أين كان المكان.

ومع ذلك، يستخدم ChainVLA قسم "القصة" ليتذكر: "مهلاً، لقد وضعت ذلك المكعب هناك سابقًا، حتى لو لم أتمكن من رؤيته الآن". في الوقت نفسه، يضمن قسم "الزخم" أنه عندما يتحرك لوضع المكعب، فإنه لن يحرك الذراع بشكل مفاجئ في اتجاه غريب يتعارض مع الاتجاه الذي كانت تشير إليه الذراع للتو.

كانت النتائج دراماتيكية للغاية. في اختبار صعب يسمى RMBench، نجح ChainVLA بنسبة 62.8% من المرات. قارن ذلك بروبوتات ذكية أخرى:

  • إذا أخذت "القصة" (سياق التقدم)، تنهار نسبة النجاح إلى 3.0%. ينسى الروبوت المهمة تمامًا.
  • إذا أخذت "الزخم" (ذيل الحركة)، تنخفض نسبة النجاح إلى 11.2%. يتذكر الروبوت المهمة ولكنه يتحرك بخرق شديد لدرجة تجعله يفشل.

يظهر هذا أن كلا الجزأين ضروريان. "القصة" تخبر الروبوت ماذا يفعل، و"الزخم" يساعده على القيام بذلك بسلاسة دون أن يتعثر بقدميه.

لماذا يهم هذا الأمر

تشير الورقة البحثية إلى أن الحفاظ على "الحركة غير المكتملة" حية هو في الواقع أمر بالغ الأهمية لتذكر المهمة. إنه يشبه الرقص قليلاً: إذا توقفت عن الرقص تمامًا بين الخطوات، فقد تنسى الإيقاع. ولكن إذا حافظت على استمرار الإيقاع (ذيل الحركة)، فسيكون عقلك أفضل في تذكر تصميم الرقصات (سياق التقدم).

عندما حاول الباحثون إصلاح خرق الروبوت عن طريق تنعيم الحركات بعد أن قرر الروبوت بالفعل ما سيفعله (وهي حيلة شائعة في الروبوتات الأخرى)، لم ينجح الأمر. ظل الروبوت يفشل. وهذا يثبت أن السر لا يكمن فقط في جعل الحركات تبدو جيدة؛ بل في تغذية فكرة الحركة التالية في عقل الروبوت قبل أن يتخذ قرارًا جديدًا.

باخت تختصار، يقترح ChainVLA أنه لكي تتمكن الروبوتات من التعامل مع الوظائف الطويلة والمعقدة، يجب أن تكون أقل شبهاً بكاميرا تلتقط صوراً ثابتة، وأكثر شبهاً بـ "راوٍ للقصص" لا يفقد مكانه في الكتاب أبداً، بينما يحافظ أيضاً على حركة قدميه على إيقاع الموسيقى. إنها خطوة صغيرة نحو روبوتات يمكنها حقاً مساعدتنا في مهام الحياة الواقعية متعددة الخطوات والفوضوية دون أن ترتبك أو تسقط كل شيء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →