← 最新论文
📄 health informatics

Collecting health narratives at scale: A multi-study evaluation of speech-to-text in health surveys

这项多项研究评估表明,虽然语音转文本技术能够显著丰富大规模患者健康叙事的长度与内容,但其应用程度在不同人群中差异巨大,并高度依赖于隐私、界面设计以及个人偏好等背景因素。

原作者: Baumer, A. M., Naoumis, P., Fabian, J., Strukova, S., Wolf, M., Ballouz, T., Farnham, A., Hofmann, V. X. C., Spitale, G., Dellwo, V., Glaessel, A., Puhan, M. A., von Wyl, V.

发布于 2026-09-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Baumer, A. M., Naoumis, P., Fabian, J., Strukova, S., Wolf, M., Ballouz, T., Farnham, A., Hofmann, V. X. C., Spitale, G., Dellwo, V., Glaessel, A., Puhan, M. A., von Wyl, V.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人类往往带着关于自身健康的叙述,而这些叙述是数字和清单无法捕捉的。虽然医生和研究人员依赖标准化的问题来追踪症状和病情,但这些僵化的格式可能会忽略一个人真实生活体验的纹理。患者如何描述他们的疼痛、他们分享的关于日常挣扎的意外细节,以及他们将症状与生活联系起来的独特方式,都存在于开放式的叙述之中。然而,从大规模人群中收集这些叙述在历史上一直是一个缓慢且昂贵的过程,通常需要研究人员与每个人进行一对一的访谈。这种局限性导致了我们对人群健康理解上的空白,因为最详细的描述往往因为难以大规模收集而未能被采集。

一组研究人员试图探索现代技术是否能通过在在线调查中使用语音转文本工具来弥补这一差距。他们想知道人们是否愿意对着麦克风说出答案,而不是通过打字,以及这样做是否真的会产生更丰富、更详尽的故事。为了测试这一点,他们邀请了来自四个完全不同群体的参与者:患有长新冠(post-COVID-19 condition)的人群、健康成年人、从事性工作的人员以及老年人。在每项调查中,研究人员都给了参与者一个选择:他们可以通过键盘输入来回答开放式问题,或者可以使用语音转文本功能大声说出答案,由计算机将其转录为文字。

结果显示,说话以可衡量的形式改变了回答的性质。当人们选择说话时,他们的回答明显变长了。在两项研究中,语音回答比打字回答多出了数百个字符,其中一组平均每个回答增加了近九百个字符。语音回答还包含了更多的独特内容词——即承载故事核心意义的具体名词和动词——这表明说话让人们能够分享更多独特的想法。然而,语音回答并非完美无瑕;它们包含比例更高的填充词,并且与打字回答相比,词汇类型的多样性略低。这表明,虽然语音解锁了更多的容量和具体的细节,但也引入了对话中那种自然、未经编辑的流动感。

然而,该技术的采用率在不同群体之间并不统一。人们选择说话而非打字的比例差异巨大,从某些群体的不足百分之一到其他群体的百分之八十不等。这种巨大的差距表明,说话的决定是极其个人化的,并深受特定情境的影响。使用该工具的参与者通常称赞其便利性和自发性,指出直接说话比打字感觉更容易。然而,许多人由于对隐私的担忧、在公共场合说话的尴尬,或者仅仅是出于对打字所带来的掌控感的偏好,而犹豫不决。

研究结论认为,语音转文本是为大规模人群收集更丰富的健康叙述的一种可行工具,但它并非一种通用的解决方案。该技术在实施时,需要根据所研究的具体群体和参与者回答时的环境进行精心定制,才能发挥最佳效果。对于某些人来说,说话开启了一扇分享更多故事的大门;而对于另一些人来说,环境和舒适度的障碍仍然过高。未来的路径在于理解这些差异,并设计出尊重人们分享健康体验时独特需求与偏好的调查问卷。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →