CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
यह शोध पत्र CASTELLA को पेश करता है, जो ऑडियो मोमेंट रिट्रीवल के लिए एक बड़े पैमाने का, मानव-एनोटेटेड ऑडियो डेटासेट है जो पिछले छोटे पैमाने के या सिंथेटिक बेंचमार्क का महत्वपूर्ण विस्तार करता है और यह प्रदर्शित करता है कि इस वास्तविक दुनिया के डेटा पर फाइन-ट्यून किए गए मॉडल उन मॉडलों की तुलना में काफी बेहतर प्रदर्शन करते हैं जो केवल सिंथेटिक डेटा पर प्रशिक्षित किए गए हैं।