Cardiovascular Disease Risk Prediction via Social Media
这项研究表明,利用自定义的心血管疾病(CVD)关键词词典、VADER情感分析以及机器学习模型(特别是SVM和CNN-LSTM)对Twitter数据进行分析,能够有效预测州级水平的心血管疾病风险,其表现优于基于美国疾病控制与预防中心(CDC)数据的传统人口统计学方法。
想象一下,你正试图猜测谁将来可能会出现心脏问题。传统上,医生和研究人员一直观察一个人的“身份证”数据:他们的年龄、性别、种族以及居住地。这就像是仅通过查看日历来预测天气;它能给你一个大致的概念,但却忽略了此时此刻正在聚集的乌云。
这篇论文提出了一种不同且更具趣味性的方法:倾听人们在 Twitter 上实际在说什么。研究人员将社交媒体视为一个巨大的、嘈ole的房间,人们正在那里闲聊自己的生活。他们想看看人们使用的“情绪”和“词汇”是否能比仅仅检查人口统计学“身份证”更好地充当心脏病的“预警系统”。
侦探工作:构建一本特殊的词典
首先,团队必须弄清楚该听什么。他们不仅仅寻找像“血管造影”或“高血压”这样的医学术语。他们构建了一本定制的“侦探词典”,将严肃的医学术语与人们在谈论压力、吸烟或胸痛时实际使用的日常俚语和生活化短语结合在一起。他们扫描了美国 18 个不同州(包括阿巴拉契亚地区)三年的推文,收集了近 27 万条信息。
情绪戒指:VADER 与标签
一旦获得了推文,他们需要弄清楚其中的“氛围”。他们使用了一个名为 VADER 的工具,它就像一个针对文本的超快速“情绪戒指”。它读取词汇并判断情感是积极的、消极的还是中性的。
这里是巧妙之处:他们设定了一个特定的规则。如果用户的推文显示出与这些心脏风险关键词相关的特定程度的负面情绪,计算机就会将其标记为“1”(潜在风险)。如果氛围不同,则标记为“0”(无风险)。可以将其想象成老师在批改试卷,其中处于风险中的“正确答案”是一种特定的、带有抱怨或忧虑色彩的词汇模式。
竞赛:传统方法 vs. 新技术
现在到了大对决。研究人员训练了两组不同的计算机大脑来预测谁处于风险之中:
- A 组(Twitter 团队): 他们向计算机输入带有情绪标签的推文。
- B 组(身份证团队): 他们向计算机输入一个标准的政府数据集(来自 CDC),其中仅包含性别、种族和位置等人口统计信息。
他们使用了几种不同的“选手”(算法)对两组进行测试,包括一些传统的数学方法和一种名为 CNN-LSTM 的高级新型混合大脑(它就像一个既能识别图像模式又能记住长篇对话的机器人)。
计分板
结果非常清晰,Twitter 团队以压倒性优势获胜。
- 身份证团队(CDC 数据): 当他们尝试仅使用人口统计信息来预测心脏病风险时,表现最好的选手(逻辑回归)仅答对了约 58.03%。高级的 CNN-LSTM 模型表现甚至更差,仅达到 57.64%。这就像是仅通过观察跑步者的鞋码来猜测比赛的获胜者。
- Twitter 团队: 当他们使用来自推文的情绪数据时,结果大幅飙升。SVM 模型(一种支持向量机)达到了 88.75% 的测试准确率。逻辑回归模型紧随其后,达到了 87.82%。即使是得分 77.51% 的混合模型 CNN-LSTM,也彻底碾压了人口统计数据的结果。
这意味着什么(以及并不意味着什么)
论文表明,倾听社交媒体上的“情绪闲聊”,比仅仅查看一个人的地址或性别,是观察心脏病风险的一个更强大的“水晶球”。作者认为,人们在网上输入的文字以一种静态数据无法做到的方式,揭示了他们的心理和行为风险。
然而,论文谨慎地没有将其称为万能灵药。他们指出,这是一项使用 2019 年至 2021 年数据的特定研究,虽然结果令人鼓舞,但它们只是一个表明这种方法比旧方法更有效的“建议”,而非最终的、不可改变的宇宙法则。他们还指出,为了让标签生效,他们必须谨慎设置“情绪戒指”的参数(使用 -0.30 的特定阈值),并且需要更多的测试来确保这种方法在任何地方都有效。
简而言之,论文提出,如果你想知道谁可能正在遭受心脏风险的困扰,通过阅读他们的推文可能比阅读他们的身份证能得到更好的答案。数据支持了这一点:推文的准确率为 88.75%,而人口统计数据仅为 58.03%。这是一种看待公共卫生领域的新方式,将互联网上的嘈杂闲聊转化为医生有用的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。