← أحدث الأبحاث
💻 computer science

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

تقترح الورقة البحثية إطار عمل DySta، وهو إطار عمل فعال لنماذج الرؤية واللغة والعمل (Vision-Language-Action) يقوم بفصل الرموز البصرية الثابتة عن الديناميكية لتقليل طول السياق وتمكين إعادة استخدام ذاكرة التخزين المؤقت لمفاتيح والقيم (KV cache)، مما يؤدي إلى تحسين أداء دمج الإطارات المتعددة وسرعة الاستنتاج بشكل كبير في كل من المهام الروبوتية المحاكية والواقعية.

المؤلفون الأصليون: Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying

نُشر 2026-05-26
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية طهي وجبة معقدة، مثل صنع شطيرة أثناء انتظار المحمصة. للقيام بذلك جيدًا، يحتاج الروبوت إلى "رؤية" المطبخ، و"قراءة" الوصفة، و"تذكر" ما فعله للتو.

تقدم هذه الورقة طريقة جديدة تسمى DySta (الديناميكية-الساكنة) لجعل عقول الروبوتات أكثر ذكاءً، وسرعةً، وقدرةً على التذكر. إليك كيف تعمل، مقسمة إلى مفاهيم بسيطة:

المشكلة: "تشتت الانتباه" لدى الروبوت

عقول الروبوتات الحالية (المسماة نماذج الرؤية واللغة والعمل - Vision-Language-Action models) تشبه الطلاب الذين لا يمكنهم النظر إلى السبورة إلا لكسر من الثانية قبل أن يمسحها المعلم.

  1. الكثير لتذكره: إذا حاول الروبوت النظر إلى فيديو لآخر 10 ثوانٍ لفهم ما يحدث، فإن كمية المعلومات ستكون ضخمة جدًا لدرجة أن الكمبيوتر سيصبح بطيئًا للغاية. الأمر يشبه محاولة قراءة موسوعة كاملة لتقرر ما إذا كنت ستلتقط ملعقة أم لا.
  2. لا توجد ذاكرة: نظرًا لأن الكمبيوتر بطيء جدًا، فإن معظم الروبوتات تنظر فقط إلى الصورة الحالية وتخمن الخطوة التالية. إنها تنسى ما إذا كانت قد ضغطت بالفعل على زر أو ما إذا كانت قد وضعت الخبز بالفعل على الطبق. قد تستمر في الضغط على الزر للأبد!

الحل: خدعة "الساكن مقابل الديناميكي"

أدرك المؤلفون أنه في معظم المهام (مثل المطبخ أو المستودع)، معظم الأشياء لا تتغير. الجدران، والطاولة، والموقد تظل كما هي تمامًا. فقط عدد قليل من الأشياء يتحرك، مثل يد الروبوت أو علبة الحساء التي يمسكها.

يقوم DySta بتقسيم رؤية الروبوت إلى سلتين:

  1. السلة "الساكنة" (الخلفية): وهي تحتوي على الأجزاء غير المتغيرة من المشهد (الجدران، الطاولة).
  2. السلة "الديناميكية" (الحركة): وهي تحتوي على الأجزات المتحركة (ذراع الروبوت، الشيء الذي يتم التقاطه).

التشبيه السحري: بطاقة المكتبة
تخيل أنك تقرأ كتابًا في مكتبة.

  • الطريقة القديمة: في كل مرة تقلب فيها صفحة، يتعين عليك إعادة قراءة فهرس المكتبة بالكامل والتحقق من عنوان المكتبة مجددًا، رغم أن المكتبة لم تتحرك. هذا يستغرق وقتًا طويلاً.
  • طريقة DySta: تكتب عنوان المكتبة والفهرس على ملاحظة لاصقة (الرمز الساكن - Static Token) وتلصقها على مكتبك. أنت تقرأ فقط الصفحة الجديدة (الرمز الديناميكي - Dynamic Token).
    • لأنك لا تحتاج إلى إعادة قراءة الفهرس بالكامل في كل مرة، فأنت تقرأ الكتاب أسرع بمرتين.
    • ولأنك احتفظت بالملاحظة اللاصقة، يمكنك تذكر سياق القصة بأكملها دون أن تضيع.

كيف يقرر متى يقوم بالتحديث

يحتاج الروبوت إلى معرفة متى تتغير "السلة الساكنة" فعليًا. ربما أسقط الروبوت مزهرية، أو تغيرت الإضاءة.

  • "بوابة إعادة التخزين المؤقت" (Recache Gate): هذا مفتاح ذكي وصغير يتعلمه الروبوت استخدامه. ينظر إلى المشهد الحالي ويسأل نفسه: "هل الخلفية لا تزال كما هي؟"
    • إذا كانت الإجابة نعم: يعيد استخدام "الملاحظة اللاصقة" القديمة (البيانات المخزنة مؤقتًا).
    • إذا كانت الإجابة لا: يقوم بتحديث الملاحظة بسرعة بالمعلومات الجديدة.
    • هذا القرار يحدث تلقائيًا ويتم تعلمه بواسطة الروبوت، وليس مبرمجًا من قبل البشر.

ما الذي اختبروه

بنى الباحثون اختبارًا جديدًا يسمى LIBERO-Memory. فكر فيه كلعبة ذاكرة للروبوتات:

  • المهمة: يجب على الروبوت تسخين علبة حساء لمدة 1.4 ثانية بالضبط، ثم أخذها، وإعادتها إلى مكانها الأصلي، ثم تسخين علبة ثانية.
  • لماذا هي مهمة صعبة: إذا نسي الروبوت أن علبة الحساء الأولى انتهت، فقد يحاول تسخينها مرة أخرى. وإذا نسي أين وضع العلبة الأولى، فلن يتمكن من وضع العلبة الثانية في مكانها الصحيح.
  • النتيجة:
    • أكثر ذكاءً: حل روبوت DySta مهام الذاكرة هذه بنسبة 23% أفضل من الروبوتات السابقة.
    • أسرع: اتخذ القرارات أسرع بـ 2.2 مرة لأنه لم يضع وقتًا في إعادة قراءة الخلفية الساكنة.

الملخص

DySta يشبه إعطاء الروبوت "قلم تحديد" يضع علامات على أجزاء العالم التي لا تتغير أبدًا. من خلال تجاهل الأجزاء غير المتغيرة بعد النظرة الأولى، يوفر الروبوت كميات هائلة من الوقت والطاقة، مما يسم يسمح له بتذكر تسلسلات طويلة من الأفعال وأداء مهام معقدة دون أن يصاب بالارتباك أو البطء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →