Hybrid Training for Vision-Language-Action Models
تقدم هذه الورقة التدريب الهجين (HyT)، وهو إطار عمل لنماذج الرؤية واللغة والعمل التي تستفيد من استدلال تسلسل الأفكار أثناء التدريب لتحسين الأداء مع السماح للنموذج بتخطي توليد الأفكار أثناء الاستنتاج لتقليل زمن الاستجابة وتعزيز القابلية للاستخدام في العالم الحقيقي.