Automatic Prosodic Audio Description Modeling
This paper proposes a unified framework that integrates semantic narrative generation with prosodic audio description modeling, demonstrating that reference-based synthesis effectively captures emotional nuances like fundamental frequency and speech rate to enhance accessibility for visually impaired users, though perceptual validation is still required.