Echo: A Joint-Embedding Predictive Architecture for Speaker Diarization and Speech Recognition in a Shared Latent Space
यह शोध पत्र इको (Echo) को प्रस्तुत करता है, जो एक 25 मिलियन-पैरामीटर वाला प्रूफ-ऑफ-कांसेप्ट ऑडियो सिस्टम है, जो जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (JEPA) के साथ प्रीट्रेन किए गए एकल ViT एनकोडर का उपयोग करता है ताकि प्रति-कार्य फाइन-ट्यूनिंग के बिना एक साझा लेटेंट स्पेस में स्पीकर डायराइजेशन, स्पीच सेपरेशन और फोनेटिक एनकोडिंग को संयुक्त रूप से निष्पादित किया जा सके, जो एंड-टू-एंड ASR में वर्तमान सीमाओं को उजागर करते हुए मल्टी-टास्क सह-अस्तित्व की व्यवहार्यता को प्रदर्शित करता है।