Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
تقترح الورقة البحثية إطار عمل "Latent Reasoning VLA" (LaRA-VLA)، وهو إطار عمل موحد يعمل على استيعاب تسلسل التفكير متعدد الوسائط ضمن تمثيلات كامنة مستمرة لتحقيق تحكم جسدي فعال وفي الوقت الفعلي مع تقليل زمن انتقال الاستدلال بنسبة تصل إلى 90% مقارنة بنهج الاستدلال الصريح.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتاً كيف يصنع شطيرة.
الطريقة القديمة (سلسلة الأفكار الصريحة):
تعمل معظم عقول الروبوتات المتقدمة حالياً مثل طالب يُجبر على كتابة كل فكرة في مذكراته قبل اتخاذ أي إجراء واحد.
- الروبوت يرى: "أنا بحاجة إلى شطيرة."
- الروبوت يفكر (بصوت عالٍ): "حسناً، أولاً أحتاج للعثور على الخبز. أرى رغيفاً على اليسار. الآن أحتاج للإمساك بالسكين. أرى السكين على اليمين. أحتاج لتحريك ذراعي ببطء..."
- الروبوت يتحرك: فقط بعد كتابة هذه الفقرة كاملة، يبدأ بتحريك ذراعه.
المشكلة: هذا بطيء للغاية. بحلول الوقت الذي ينتهي فيه الروبوت من كتابة "تدوينة مذكراته"، تكون الشطيرة قد بردت بالفعل، أو يكون الروبوت قد أضاع فرصته في الإمساك بالخبز. كما أن الكتابة بالكلمات (رموز منفصلة) هي أمر غير مرن لروبوت يحتاج لتحريك ذراعه في منحنيات سلسة ومستمرة. الأمر يشبه محاولة قيادة سيارة لا يُسمح لك فيها إلا بالتحرك في قفزات بطول بوصة واحدة.
الطريقة الجديدة (LaRA-VLA):
تقدم الورقة البحثية LaRA-VLA (الاستدلال الكامن VLA). فكر في هذا كتعليم الروبوت كيف "يفكر في عقله" دون كتابة أي شيء.
بدلاً من إخراج فقرة نصية طويلة، يقوم الروبوت باستيعاب استدلاله داخل "شعور" أو "إحساس" (تمثيل كامن) مدمج ومستمر.
- الروبوت يرى: "أنا بحاجة إلى شطيرة."
- الروبوت يفكر (في صمت): يعالج فوراً موقع الخبز، والسكين، والمسار الذي يجب أن تسلكه ذراعه، كل ذلك في لقطة ذهنية واحدة وسلسة.
- الروبوت يتحرك: يتحرك فوراً.
معسكر التدريب المكون من ثلاث مراحل (التعلم المنهجي)
توضح الورقة البحثية أنه لا يمكنك مجرد قول "فكر بصمت" للروبوت مباشرة. بل يحتاج إلى معسكر تدريبي من ثلاث مراحل:
المرحلة الأولى: مرحلة "أظهر عملك".
يُجبر الروبوت على كتابة أفكاره (نصوص) والتنبؤ بما ستبدو عليه الصورة التالية (مرئيات). يتعلم قواعد اللعبة من خلال التصريح بوضوح: "أنا أحرك الكوب إلى اليسار".المرحلة الثانية: مرحلة "الهمس".
يبدأ المدربون باستبدال جمل الروبوت المكتوبة بـ "همسات" (رموز كامنة). في البداية، يكتب الروبوت نصف الجملة ويهمس بالنصف الآخر. ببطء، يكتب أقل ويهمس أكثر. يتعلم ضغط أفكاره المعقدة في حزمة ذهنية صغيرة وفعالة.المرحلة الثالثة: مرحلة "الماستر الصامت".
لا يعود الروبوت يكتب أو يهمس بأي شيء بصوت عالٍ. لقد استوعب الاستدلال تماماً في داخله. ينظر إلى المشهد، يعالج "الهمسة" في عقله، وينفذ الإجراء فوراً.
لماذا هذا أفضل؟
- السرعة: لأن الروبوت لا يضيع وقته في كتابة تدوينة مذكرات، يمكنه الاستجابة أسرع بنسبة 90%. تزعم الورقة أن هذا خفض وقت التفكير من أكثر من 7 ثوانٍ إلى مجرد 0.13 ثانية (135 مللي ثانية). هذا سريع بما يكفي للتحكم في الوقت الفعلي.
- السلاسة: بما أن الروبوت يفكر في "مشاعر مستمرة" بدلاً من "كلمات منفصلة"، فإن حركاته تكون أكثر سلاسة وتتوافق مع كيفية عمل العالم المادي فعلياً.
- المتانة: اختبرت الورقة البحثية الروبوت مع تغذية كاميرا ضبابية أو مشوشة (مثل النظر من خلال نافذة مغبشة). تعامل "المفكرون الصامتون" (LaRA-VLA) مع الفوضى بشكل أفضل بكثير من "كاتبي المذكرات"، مما يشير إلى أن نماذجهم الذهنية الداخلية أكثر استقراراً.
النتيجة
في الاختبارات، تفوق هذا الأسلوب الجديد على جميع نماذج الروبوتات الرائدة الأخرى تقريباً. كان أفضل في المهام الطويلة والمعقدة (مثل فرز الفاكهة أو تكديس الأوعية) وفعل ذلك بسرعة أكبر بكثير.
باختصار: يعلم LaRA-VLA الروبوتات التوقف عن "التحدث" طريقها عبر المهمة والبدء في "الشعور" بطريقها عبرها، مما ينتج عنه روبوت هو مخطط عبقري وعامل فائق السرعة في آن واحد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.