Video-Rate Streaming Stylization on a Vision-Aware MLLM-Conditioned Edit Diffusion: Asymmetric Batched Inference on a Distilled UNet + MLLM Text Encoder
यह शोध पत्र एक वीडियो-रेट स्ट्रीमिंग स्टाइलिज़ेशन पाइपलाइन प्रस्तुत करता है जो एक डिस्टिल्ड 0.39B U-Net को 2.13B Qwen3-VL एनकोडर के साथ संयोजित करके MLLM-कंडीशन्ड एडिट डिफ्यूजन में टेक्स्ट-एनकोडर बॉटलनेक को दूर करता है, जो उपभोक्ता GPU पर 74.1 fps तक प्राप्त करने के लिए एसिमेट्रिक बैचड इन्फरेंस और फ्यूज्ड ग्राफ ऑप्टिमाइज़ेशन का उपयोग करता है।