← 最新论文
💬 NLP

From Word Sequences to Behavioral Sequences: Adapting Modeling and Evaluation Paradigms for Longitudinal NLP

本文提出了一种用于自然语言处理(NLP)的纵向建模与评估范式,该范式将文档视为按时间排序的行为序列而非独立样本,并通过一项关于创伤后应激障碍(PTSD)日记的研究证明,这种方法能够产生传统文档级方法经常遗漏或误判的具有生态效度的见解。

原作者: Adithya V Ganesan, Vasudha Varadarajan, Oscar NE Kjell, Whitney R Ringwald, Scott Feltman, Benjamin J Luft, Roman Kotov, Ryan L Boyd, H Andrew Schwartz

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Adithya V Ganesan, Vasudha Varadarajan, Oscar NE Kjell, Whitney R Ringwald, Scott Feltman, Benjamin J Luft, Roman Kotov, Ryan L Boyd, H Andrew Schwartz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在学习如何预测天气。

旧方法(传统自然语言处理 NLP)
大多数分析语言(NLP)的计算机程序将每一句话或每一篇日记视为一个独立的、孤立的天气报告。它们可能会从 1,000 个不同的日子里抓取 1,000 份随机报告,把它们打乱,然后说:“好了,这是我们的训练数据,这是我们的测试数据。”

论文指出,这就像是通过观察一朵云的单个快照来学习天气,然后在完全不同的风暴中测试自己,却从未意识到它们其实来自同一个风暴系统。它假设每段文本都是独立的,就像抛硬币一样。

新方法(纵向自然语言处理 Longitudinal NLP)
作者们说:“等等。这些文字是由写的,而人是会随时间变化的。一个人周一的写作风格与他周二的写作风格是相互关联的,而且每个人的写作风格都是独特的,而不只是随机的噪声。”

他们提议不要将语言视为一堆随机的单词,而是将其视为一个人生活的电影,其中每一帧(日记条目)都取决于前一帧。

以下是使用简单类比对他们研究结果的拆解:

1. “漏桶”问题(评估划分)

在旧方法中,如果你用一个人 70% 的日记条目进行训练,并用剩下的 30% 进行测试,计算机就是在作弊。这就像是给学生一份练习题,其中包含了正式考试的答案,因为他们正在学习同一个人的笔记。

  • 论文的解决方法: 他们提出了两种新的测试方式:
    • “陌生人”测试(横截面测试): 在 A、B、C 三个人身上进行训练。在 D(计算机从未见过的第四个人)身上进行测试。它能仅通过阅读 D 的文字就猜出 D 的感受吗?
    • “未来”测试(前瞻性测试): 用 A 的第一个月进行训练。测试 A 的下个月。它能预测接下来会发生什么吗?

令人震惊的结果: 当他们使用旧的“随机打乱”方法时,计算机看起来像个天才。但当他们使用“陌生人”和“未来”测试时,计算机往往表现得一败涂地。在某些情况下,旧方法让计算机看起来比简单的猜测还要聪明,而新方法则显示它实际上比简单的猜测还要差。旧方法在撒谎,它伪造了计算机到底有多聪明。

2. “平均值 vs. 流动”问题(指标)

论文指出,标准的评分(如“平均准确率”)就像是通过只看每一帧画面的平均亮度来评价一部电影。你会错过其中的故事。

  • 个体间得分(Between-Person Score): 计算机是否学会了 A 个人 通常很暴躁,而 B 个人 通常很开心?(这很容易;它只是在记忆“谁是谁”)。
  • 个体内得分(Within-Person Score): 计算机是否学会了 A 个人 在周二比周一变得更暴躁了?(这很难;它需要理解时间的流动)。

令人震惊的结果: 计算机非常擅长记忆谁很暴躁(个体间得分),但对于预测他们何时会变得暴躁(个体内得分)却表现得很糟糕。旧的“平均分”掩盖了这种失败,使它看起来好像计算机理解了全貌,而实际上它只理解了静态的部分。

3. “记忆”问题(建模)

如果你想预测天气,仅仅看“现在”的天空是不够的;你需要知道过去一小时内是否一直在下雨。

  • 旧方法: 计算机孤立地观察单条日记,就像看一张照片。
  • 新方法: 计算机将过去 30 天的条目作为一个序列来看待,就像看一段视频。

令人震惊的结果: 当允许计算机“观看视频”(查看历史记录)时,它对未来的预测能力大大提升,尤其是对于那些它从未见过的新人。然而,它所需的“记忆”类型取决于测试:

  • 为了预测一个新的人,它需要一个关于其过去的“摘要”(一种粗略的、正则化的视角)。
  • 为了预测同一个人未来的情况,它需要看到详细的交互作用和随时间的变化(一种复杂的、交互式的视角)。

核心启示

论文得出结论:我们需要停止将语言仅仅视为单词的序列,而要开始将其视为人类行为的序列

如果你想构建能在现实世界中工作的 AI(即能够遇到新的人并预测未来事件),你不能只是随机打乱数据。你必须:

  1. 在新的个体和未来的时间点上进行测试,而不是仅仅在随机打乱的碎片上进行测试。
  2. 报告两个分数: 一个是“这是谁?”,另一个是“他们现在正经历着什么?”
  3. 赋予计算机记忆,这样它才能看到整个故事,而不仅仅是捕捉瞬间。

通过这样做,我们不再仅仅构建那些擅长应付考试的模型,而是开始构建真正理解人类行为的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →