Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning
تتحدى هذه الورقة الحكمة التقليدية التي تفيد بأن الضبط الدقيق المتسلسل الساذج يسبب نسيانًا كارثيًا في نماذج الرؤية واللغة والعمل، مبرهنةً بدلاً من ذلك على أن الجمع بين الضبط الدقيق المتسلسل البسيط والتكيف منخفض الرتبة والتعلم المعزز القائم على السياسة (on-policy) يُمكّن بفعالية من التعلم المستمر القوي والقابل للتوسع مع حد أدنى من النسيان والقدرة العالية على التعميم.