Skeleton-based Zero-Shot Spatio-Temporal Action Localization via Weakly-Supervised Pretraining
تقترح هذه الورقة إطار عمل جديد لتحديد موقع الأفعال زمانياً ومكانياً بناءً على الهيكل العظمي بنمط "التعلم من الصفر"، والذي يستفيد من التدريب المسبق للرؤية واللغة بضعف الإشراف والتعلم التبايني التمييزي المختلط بالمشهد لتحديد الأفعال غير المرئية بفعالية مع التغلب على تكاليف التوسيم العالية.