VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents
यह शोध पत्र VideoFDB को प्रस्तुत करता है, जो वास्तविक दुनिया की द्वैत (dyadic) अंतःक्रियाओं का विश्लेषण करके फुल-डुप्लेक्स ऑडियो-विजुअल संवादात्मक एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान प्रणालियाँ स्पष्ट दृश्य प्रश्नों को संभालने की अपनी क्षमता के बावजूद, स्वाभाविक गैर-मौखिक संचार के लिए स्ट्रीमिंग दृश्य संकेतों को प्रभावी ढंग से एकीकृत करने में विफल रहती हैं।