UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception
يعزز UniAudio-Token أجهزة ترميز الكلام الدلالية بقدرات إدراك صوتي عامة من خلال تقديم بدائيات دلالية-صوتية للإشراف الهيكلي وآلية بوابات التوازن الدلالي-الصوتي لاستعادة التفاصيل الصوتية، مما يحقق واجهة صوتية موحدة تتفوق على النماذج المرجعية الحالية ذات الرمز الواحد في كل من مهام الفهم والتوليد.