Pisets: A Robust Speech Recognition System for Lectures and Interviews
यह शोध पत्र "Pisets" को प्रस्तुत करता है, जो व्याख्यानों और साक्षात्कारों के लिए डिज़ाइन किया गया एक सुदृढ़ रूसी स्पीच-टू-टेक्स्ट सिस्टम है, जो करिकुलम लर्निंग और उन्नत अनिश्चितता मॉडलिंग के साथ Wav2Vec2, ऑडियो स्पेक्ट्रोग्राम ट्रांसफॉर्मर और व्हिस्पर (Whisper) को संयोजित करने वाले तीन-घटक आर्किटेक्चर का उपयोग करके मानक व्हिस्पर मॉडलों की तुलना में ट्रांसक्रिप्शन सटीकता को बढ़ाता है और मतिभ्रम (hallucinations) को कम करता है।