Latent Video Prediction Learns Better World Models
यह शोध पत्र एक व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि लेटेंट वीडियो प्रेडिक्शन मॉडल, जैसे कि V-JEPA 2.1, पांच मजबूती अक्षों (robustness axes) पर पारंपरिक पुनर्निर्माण-आधारित और पर्यवेक्षित मॉडलों से बेहतर प्रदर्शन करते हैं, जो उन्हें मजबूत वर्ल्ड मॉडल्स बनाने के लिए श्रेष्ठ उम्मीदवार के रूप में स्थापित करते हैं।