Automatic Prosodic Audio Description Modeling
Dieses Paper schlägt ein einheitliches Framework vor, das die semantische Narrativgenerierung mit der prosodischen Audio-Deskriptionsmodellierung integriert und zeigt, dass referenzbasierte Synthese effektiv emotionale Nuancen wie die Grundfrequenz und die Sprechrate erfasst, um die Barrierefreiheit für sehbehinderte Nutzer zu verbessern, wenngleich eine perzeptuelle Validierung noch erforderlich ist.