Automatic Prosodic Audio Description Modeling
Questo articolo propone un framework unificato che integra la generazione di narrazioni semantiche con la modellazione prosodica della descrizione audio, dimostrando che la sintesi basata su riferimento cattura efficacemente le sfumature emotive, come la frequenza fondamentale e la velocità del parlato, per migliorare l'accessibilità per gli utenti ipovedenti o non vedenti, sebbene sia ancora richiesta una validazione percettiva.