Quantifying the human visual exposome with vision language models
本文介绍了一个可扩展的框架,该框架将生态瞬时评估与视觉语言模型相结合,以量化人类视觉暴露组,证明对第一人称图像进行的客观分析能够有效预测情绪和慢性压力等心理健康结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和创造性类比对该论文的解读。
核心理念:透过你的双眼看世界
想象一下,你想了解人们为何感到快乐或压力。科学家们早已知道,你的周围环境至关重要。多年来,他们一直试图通过查看地图(如社区卫星照片)或询问人们(例如问:“你的街道有多绿?”)来衡量这一点。
但本文作者认为,地图太过模糊,而自我报告又过于主观。一张地图无法告诉你,你究竟是站在安静的公园里,还是嘈杂拥挤的地铁站中。一个人可能认为他的街道很绿,但这也许只是因为他正盯着一个盆栽植物看。
为了解决这个问题,研究人员发明了一种测量**“视觉暴露组”的新方法。将暴露组想象为你一生中接触到的所有事物的总“汤”。而视觉暴露组,则特指你每天看到**的所有事物的“汤”。
工具:"AI 相机之眼”
为了测量这锅“汤”,团队没有使用卫星或调查。相反,他们使用了视觉 - 语言模型(VLMs)。
- 类比:想象你有一位超级聪明、不知疲倦的助手,他既是摄影专家,也是心理学专家。你给这位助手一张照片,他不仅仅会说“这是一张照片”。他会立即描述场景:“有很多绿草,阳光灿烂,周围没有人,看起来像个公园。”
- 创新之处:过去,科学家们不得不雇佣人类专家去查看成千上万张照片并写下这些描述。这既缓慢、昂贵,又无法扩展到数百万张图片。而这个新的 AI 工具可以瞬间、客观地、在大规模范围内完成这项工作。
他们如何测试
研究人员对 106 名志愿者进行了为期 7 天的研究。
- 设置:每天,志愿者的手机会在随机时刻震动 7 次。
- 任务:当手机震动时,参与者必须拍摄他们当时正在看的景象。他们还需要回答几个关于自己感受(快乐、愤怒、压力)以及他们认为周围环境有多绿的问题。
- 结果:他们最终获得了2,674 张照片以及对应的 mood 报告。
他们的发现
团队将所有这些照片输入他们的"AI 相机之眼”,以获取“绿色度”、“自然”和“光线”等方面的评分。
- 匹配度:AI 对照片的描述与人类所说的所见相符。如果 AI 看到了很多绿色,人类通常会说:“是的,很绿。”
- 情绪关联:AI 的评分与人类的情绪完美匹配。
- 当 AI 看到更多的绿色和自然时,人们报告感到更快乐且压力更小。
- 当 AI 看到更少的绿色时,人们报告感到压力更大。
- 结论:这证明了 AI 是一个可靠的工具。它可以客观地衡量视觉世界,并预测这个世界如何影响人们的感受,正如既定科学所表明的那样。
寻找隐藏线索的“寻宝游戏”
一旦他们证明了 AI 在“绿色度”方面有效,他们就想看看它是否能发现其他影响我们情绪的事物。
- 挖掘行动:他们使用另一种 AI 阅读了700 万篇科学论文。这就像派出一位机器人图书管理员,去阅读一座巨大图书馆里的每一本书,找出每一句提到特定环境特征(如“人群”、“交通”、“动物”或“建筑”)并与压力或快乐相关联的句子。
- 清单:这个过程生成了一份清单,包含近1,000 种不同的视觉特征,科学表明这些特征可能会影响我们的心理健康。
- 测试:他们要求"AI 相机之眼”在 2,674 张照片中寻找这 1,000 种特征。
- 发现:大约**33%**的时间里,AI 发现了一个与预期情绪相匹配的特征。例如,如果 AI 看到了“人群”,这与压力相关;如果它看到了“动物”,则与快乐相关。
核心结论
这篇论文并不声称能治愈精神疾病或告诉医生如何治疗患者。相反,它声称构建了一个用于人类视觉世界的新型、可扩展的显微镜。
在此之前,我们对人们日常生活中实际看到的具体细节是“盲目”的。现在,我们有一种方法可以客观地衡量日常生活的“视觉汤”,并观察它如何塑造我们的感受,利用 AI 来完成人类以前根本无法承担的重任。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。