AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction
AcrossVAM1.0 एक हल्का, टेक्स्ट-असिस्टेड वीडियो एक्शन मॉडल है जो भविष्य के फ्रेमों को ऑब्जेक्ट-सेंट्रिक पार्टिकल डायनेमिक्स और डेंस अपीयरेंस में विभाजित करके रोबोट वीडियो प्रेडिक्शन में सुधार करता है, जो यह प्रदर्शित करता है कि स्पष्ट पार्टिकल मॉडलिंग भाषा ग्राउंडिंग और संवेदी गुणवत्ता की वर्तमान सीमाओं के बावजूद प्रक्षेपवक्र त्रुटि (ट्रैजेक्टरी एरर) को कम करती है।