Gen4U: Unifying Video Generation and Understanding via Diffusion
यह शोध पत्र Gen4U को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो वीडियो जनरेशन और समझ को एकीकृत करने के लिए फ्रोजन (frozen), बड़े पैमाने के वीडियो डिफ्यूजन मॉडल्स के स्ट्रक्चर्ड लेटेंट स्पेस का लाभ उठाता है, जिससे बिना फाइन-ट्यूनिंग के और जेनेरेटिव क्षमताओं को सुरक्षित रखते हुए विविध परसेप्शन कार्यों में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।