From Tokens to Faces: Investigating Discrete Speech Representations for 3D Facial Animation
यह शोध पत्र 3D फेशियल एनिमेशन के लिए चार प्रकार के डिस्क्रीट स्पीच रिप्रेजेंटेशन्स का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि ध्वन्यात्मक वर्गों (phonetic classes) को एनकोड करने से सटीक भविष्यवाणियाँ प्राप्त होती हैं और एक ऑडियो विजुअल टेक्स्ट-टू-स्पीच (AVTTS) पाइपलाइन को पेश करने में सक्षम बनाता है जो स्पीच और 3D फेशियल मोशन को एक साथ डिकोड करने के लिए साझा डिस्क्रीट रिप्रेजेंटेशन्स का उपयोग करता है।