Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
يُعد Zero-WAM نموذجاً سببيّاً للفيديو والحركة يحقق تعميماً عبر المهام في مرحلة الصفر (zero-shot) في مجال المناولة الروبوتية من خلال الاستفادة من فيديوهات بشرية ضمن السياق كأوصاف للمهام، مدعوماً بمجموعة بيانات اصطناعية مكونة من 74.2 ألف زوج من البشر والروبوتات وهدف تنبؤ بالكتل المستقبلية لفرض الاعتماد على المحفزات البصرية.