← 最新论文
🧬 biology

Validation design changes wearable stress-state classification performance in hospital nurses

本研究表明,尽管基于可穿戴设备的护士压力分类器可能表现出较高的内部准确率,但当在未见个体上进行评估时,其性能会显著下降,这凸显了在投入实际运行前进行参与者层级验证以确保可迁移性的至关重要性。

原作者: Fuat Kahraman, Gözde Özsezer, Gülengül Mermer

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Fuat Kahraman, Gözde Özsezer, Gülengül Mermer

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下这样一个世界:一个简单的腕带就能在护士因压力过大而无法安全工作时提醒她们,这可能有助于预防职业倦怠和医疗错误。这个想法依赖于能够追踪人体细微信号(如皮肤导电性的变化、心率和皮肤温度)的穿戴式传感器。这些设备捕捉连续的数据流,并将其分解为微小的、一分钟一段的数据块,以寻找指示压力的模式。人们希望通过教计算机识别这些模式,我们可以创造出一种帮助医护人员的工具。然而,一个关键问题仍然存在:一个学会识别某个人压力数据的计算机,在遇到一个完全陌生的人时,是否真的有效?

由研究人员 Fuat Kahraman、Gözde Özsezer 和 Gülengül Mermer 进行的一项近期研究调查了这一确切问题,该研究使用了十五名女性医院护士在疫情期间佩戴这些传感器的相关数据。研究人员想要观察,计算机模型中经常出现的令人印象深刻的结果是真实的,还是仅仅因为模型记住了受训者的特定习惯。他们使用了一个包含超过一千一百万秒记录数据的公开数据集,并测试了不同的计算机算法对护士压力水平(分为低、中、高)进行分类的效果。该研究重点关注了两种不同的测试方法:一种是计算机在训练期间看到了某位护士的部分数据,随后又在同一位护士的其他数据上进行测试;另一种是计算机在测试时面对的是一位从未见过的护士。

结果揭示了这两种测试方法之间惊人的差距。当允许计算机从一名护士的学习中获取知识,然后再对该名护士随后的时刻进行测试时,它的表现近乎完美,得分高达 0.990。这表明模型非常擅长这项任务。然而,当研究人员改变测试方式,看模型是否能处理一位从未遇到的新护士时,性能大幅下降。对于表现最好的模型,准确率从 0.948 降至一个低得多的平均值 0.661。事实上,针对单个新护士的准确率波动巨大,范围从低至 0.32 到高至 0.90。这意味着,虽然计算机可以轻松识别它所研究过的人的压力模式,但它在将这些知识应用于陌生人时却显得非常吃力。研究发现,模型在做出判断时严重依赖皮肤电导率和皮肤温度,但即便拥有这些强烈的信号,它也无法将其学习到的知识推广到新的个体身上。

研究人员还仔细检查了压力标签是如何生成的。这些数据并非来自医生的诊断;相反,是由一种算法建议压力高的时刻,然后由护士们在下班后对这些建议进行复核。这一过程意味着,标签可能会受到正在计算机试图学习的传感器数据本身的影响,从而使得模型更容易通过猜测得出正确答案,而不是真正理解潜在的生理机制。由于这项研究局限于来自单一医院的一小组护士以及特定的时期,且计算机模型并未在新的医院或新的人群中进行测试,作者警告说,这些工具尚未准备好投入实际应用。他们强调,内部测试中的高准确率数字可能具有误导性,并且在这样的系统被用来支持医院工作人员之前,必须证明它能在从未见过的人身上可靠地运行,并提供明确证据证明它是有益而非有害的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →