← أحدث الأبحاث
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

تقدم هذه الورقة البحثية **In-Context VLA**، وهو إطار عمل يعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) عبر استبدال توليد سلسلة الأفكب (chain-of-thought) حرة التنسيق بالتدريب اللاحق في السياق (in-context post-training) على أدلة إدراكية مهيكلة واستخدام الأدوات الوكيلية (agentic tool use)، مما يتيح استهلاكاً لغوياً مُرتبطاً بالواقع من أجل تحكم فائق في المستويات الدنيا وأداءً رائدًا عبر مهام المحاكاة والتلاعب في العالم الحقيقي.

المؤلفون الأصليون: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

نُشر 2026-08-07
📖 2 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً القيام بالأعمال المنزلية، مثل صنع شطيرة أو ترتيب غرفة فوضوية. لفترة طويلة، حاول العلماء تعليم هذه الآلات من خلال عرض فيديوهات لبشر يقومون بالمهمة وإخبار الروبوت: "انسخ تماماً ما تراه". هذا الأسلوب يعمل بشكل جيد في المهام البسيطة، لكنه يشبه محاولة تعلم لغة جديدة عبر حفظ جملة واحدة جامدة فقط. إذا طلبت من الروبوت "التقاط الكوب الأحمر" ولكنك قلت لاحقاً "أمسك ذلك الكوب القرمزي"، فقد يرتبك الروبوت لأنه لم يتعلم أبداً فهم المعنى الكامن وراء الكلمات، بل تعلم فقط مطابقة الأصوات المحددة التي سمعها أثناء التدريب.

ولإصلاح ذلك، جرب الباحثون مؤخراً إعطاء الروبوت خطوة "تفكير"، تشبه الطريقة التي يتحدث بها البشر مع أنفسهم قبل التصرف. كانوا يأملون أن يكتب الروبوت أولاً خطة مثل: "حسناً، الكوب موجود على الطاولة، ويجب أن أحرك يدي إلى اليسار"، ثم يبدأ بالعمل. يُطلق على هذا "سلسلة الأفكار" (Chain-of-Thought). ولكن هنا تكمن المفاجأة: بالنسبة للروبوتات، فإن الإفراط في الكلام قبل التحرك يجعلها أسوأ في أداء مهامها. الأمر يشبه محاولة قيادة سيارة بينما تكتب رواية عن الطريق؛ فبحلول الوقت الذي تنهي فيه جملتك، ستكون قد فوتّ المنعطف. يقع الروبوت في حلقة مفرغة من سرد أفكاره بدلاً من الإمساك بالشيء فعلياً، وغالباً ما يخترع حقائق حول أماكن الأشياء لأنه يخمن بدلاً من النظر والتحقق.

يقدم هذا البحث طريقة جديدة لتعليم الروبوتات تسمى VLA-Talker. فبدلاً من إجبار الروبوت على كتابة أفكاره الخاصة، يعطي الباحثون الروبوت "مساعداً ذكياً" يقوم بعملية النظر والتقرير نيابة عنه. فكر في الأمر كأن الروبوت يرتدي نظارات فائقة القدرة ولديه مساعد طيار متعاون. عندما يحتاج الروبوت لمعرفة مكان الملعقة، فإنه لا يخمن أو يكتب فقرة عن ذلك، بل يسأل مساعده فوراً (الذي يستخدم أدوات خاصة مثل كاميرات العمق وكواشف الأجسام) ليقول له: "الملعقة تبعد 42 بكسل إلى اليمين وأقل قليلاً من يدك". يقرأ الروبوت بعد ذلك هذا التقرير الواضح والحقيقي ويتصرف فوراً.

وجد الباحثون أن هذه الطريقة تُعد تغييراً جذرياً لقواعد اللعبة. فمن خلال السماح للروبوت باستهلاك لغة واضحة ومستندة إلى الواقع من أدواته بدلاً من توليد ثرثرته الخاصة المربكة، يصبح الروبوت أسرع وأكثر دقة. في اختباراتهم، لم يقتصر الأمر على كون هذا النهج يعمل بشكل أفضل فحسب، بل كان أسرع بنحو 4.6 مرة من طرق "التفكير" القديمة لأن الروبوت لم يضع وقته في كتابة مقالات قبل التحرك. لقد اختبروا ذلك في محاكاة حاسوبية معقدة وحتى على روبوت حقيقي بهيئة بشرية، وقد نجح باستمرار في حل مهام عجزت عنها روبوتات أخرى، مما يثبت أنه في بعض الأحيان، أفضل طريقة للتفكير هي الاستماع إلى شخص آخر يعرف الحقائق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →