PoDAR: Power-Disentangled Audio Representation for Generative Modeling
यह शोधपत्र PoDAR को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रैंडमाइज्ड पावर ऑग्मेंटेशन और लेटेंट कंसिस्टेंसी के माध्यम से सिग्नल पावर को सिमेंटिक कंटेंट से अलग करता है, जिससे जनरेटिव मॉडल के अभिसरण (कन्वर्जेंस) में काफी तेजी आती है और ऑडियो की गुणवत्ता एवं स्पीकर समानता में सुधार होता है।