The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling
تكشف هذه الورقة أن توسيع نطاق نماذج الرؤية واللغة والأفعال (Vision-Language-Action) محدود جوهرياً بـ "فجوة الضغط"، حيث يؤدي التجزئة المنفصلة للأفعال إلى إنشاء عنق زجاجة معلوماتي ثابت يمنع مكاسب الأداء الناتجة عن تحسين مشفرات الرؤية، على عكس تمثيلات الأفعال المستمرة التي تسمح لهذه التحسينات بالانتشار بفعالية.