In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use
تقدم هذه الورقة البحثية **In-Context VLA**، وهو إطار عمل يعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) عبر استبدال توليد سلسلة الأفكب (chain-of-thought) حرة التنسيق بالتدريب اللاحق في السياق (in-context post-training) على أدلة إدراكية مهيكلة واستخدام الأدوات الوكيلية (agentic tool use)، مما يتيح استهلاكاً لغوياً مُرتبطاً بالواقع من أجل تحكم فائق في المستويات الدنيا وأداءً رائدًا عبر مهام المحاكاة والتلاعب في العالم الحقيقي.