AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
يُعد AgentRVOS إطار عمل لا يتطلب تدريباً يحقق أداءً فائقاً في مجال تقسيم كائنات الفيديو بالإشارة، وذلك عبر عكس المسار التقليدي لإنشاء مسارات موثوقة للكائنات أولاً باستخدام SAM3، ثم توظيف نموذج لغوي بصري كبير (MLLM) للاستدلال على هذه المسارات من أجل تحديد الهدف بدقة.