Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking
تقدم هذه الورقة تقنية "التقنيع الاحتمالي للكتل" (PCM)، وهي تعديل فعال حاسوبياً على التعلم التعزيزي القائم على نماذج الرؤية واللغة والأفعال (VLA) باستخدام خوارزمية (GRPO)، والتي تسرع التدريب بشكل كبير وتقلل من استهلاك الذاكرة عبر اختيار نشر التدرجات (backpropagating gradients) فقط خلال كتل المسارات التي تتباين فيها عمليات التشغيل الناجحة والفاشلة، دون الحاجة إلى نماذج مكافأة أو ناقد إضافية.