Conversational Human Audio-visual Talking Dialogue Generation
यह शोध पत्र CHAT को प्रस्तुत करता है, जो एक नवीन ढांचा है जो बड़े भाषा और टॉकिंग फेस मॉडलों को एकीकृत करके एकल टेक्स्ट प्रॉम्प्ट से विविध, संरेखित द्विपक्षीय ऑडियो-विजुअल संवाद क्लिप उत्पन्न करता है, जिससे यह लागत-प्रभावी वास्तविक दुनिया के डेटा संग्रह के लिए एक स्केलेबल और नैतिक रूप से सुदृढ़ विकल्प प्रदान करता है और डाउनस्ट्रीम कार्यों के लिए बेहतर प्रदर्शन और उपयोगिता प्रदर्शित करता है।