Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation
यह शोध पत्र Text2Sign को प्रस्तुत करता है, जो एक लागत प्रभावी, सिंगल-जीपीयू डिफ्यूजन बेसलाइन है जो एक फ्रोजन विजन-लैंग्वेज एनकोडर और फैक्टराइज्ड स्पैटियोटेम्पोरल अटेंशन का लाभ उठाकर लघु, कम-रिज़ॉल्यूशन वाले साइन लैंग्वेज वीडियो उत्पन्न करता है, हालांकि वर्तमान में इसमें सीमित प्रॉम्प्ट संवेदनशीलता प्रदर्शित होती है और यह मुख्य रूप से एक प्रोडक्शन-रेडी सिस्टम के बजाय एक रिसर्च स्टार्टिंग पॉइंट के रूप में कार्य करता है।