Automatic Prosodic Audio Description Modeling
Este artículo propone un marco unificado que integra la generación de narrativas semánticas con el modelado de descripción de audio prosódico, demostrando que la síntesis basada en referencias captura eficazmente los matices emocionales, como la frecuencia fundamental y la velocidad del habla, para mejorar la accesibilidad para los usuarios con discapacidad visual, aunque todavía se requiere validación perceptual.