Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
Zero-WAM एक कॉज़ल वीडियो-एक्शन मॉडल है जो इन-कॉन्टेक्स्ट मानव वीडियो को कार्य विशिष्टताओं (task specifications) के रूप में उपयोग करके रोबोटिक मैनिपुलेशन में ज़ीरो-शॉट क्रॉस-टास्क जनरलाइजेशन प्राप्त करता है, जिसे 74.2K मानव-रोबोट जोड़ों के सिंथेटिक डेटासेट और विजुअल प्रॉम्प्ट्स पर निर्भरता सुनिश्चित करने के लिए एक फ्यूचर चंक प्रेडिक्शन ऑब्जेक्टिव द्वारा समर्थित किया गया है।