Event-Time Confounding Under Bursty Human Dynamics
本文表明,将数字行为与用户发起的事件进行对齐会产生一种“片段选择偏差”(episode-selection bias),即事件发生后的活动激增反映的是正在进行的任务的自然延续,而非因果效应,这是一种标准用户固定效应无法解决的混淆因素,但可以通过所提出的诊断协议和“burstcheck”审计工具进行检测和修正。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,每当我们点击、搜索或提出问题时,都会留下前进的面包屑。多年来,研究人员和公司一直试图解读这些痕迹,以理解因果关系。他们想知道,特定的行为(例如向人工智能寻求帮助)是否真的改变了一个人接下来的行为。寻找答案的标准方法是选取一个时间点——比如用户向聊天机器人输入问题的那一秒——然后测量随后几分钟内的活动量。如果用户在那个时刻之后搜索了更多产品或阅读了更多文章,其假设便是聊天机器人引发了这一激增。这是一种逻辑上成立的思考方式,但它依赖于一个隐藏的假设:即用户选择行动的那一刻是一个中性的起点,就像赛跑中的发令枪一样。
然而,人类的行为并不像一场只有单一发令枪的比赛。相反,我们的注意力是以波浪的形式出现的。我们经常沉浸在一个主题中,在二十或三十分钟内,在不同的网站、搜索引擎和工具之间跳跃,以解决问题或满足好奇心。这些活动的爆发既强烈又专注,随后则是长期的沉寂。问题在于,当研究人员在这些繁忙的波浪之中选取一个时刻进行研究时,就会产生偏差。如果一个人在已经处于深度研究阶段时提出了一个问题,那么随之而来的活动并不一定是对此问题的反应。它仅仅是他们正在驾驭的波浪的延续。这个问题并没有开启波浪,它只是研究人员低头看表时的那个瞬间。在这种环境下,区分“原因”与“巧合”是非常困难的,因为选择那个时刻的人正是驱动活动本身的人。
这正是来自 Scrunch AI 的 Michael Iannelli 和 Alan Ai 的一项新研究所探讨的核心谜题。他们调查了衡量数字行为的标准方法究竟是在测量事件本身,还是仅仅在测量该事件恰好落入的繁忙时期。为了解决这个问题,他们没有仅仅依赖理论,而是利用来自数千名用户的真实数据构建了一个测试,这些用户同意分享他们的浏览历史、搜索查询以及与 AI 助手的交互记录。研究人员想要看看,他们是否能“欺骗”自己的测量工具,从而在并不存在“因果”的地方发现一个“因果”。
团队设计了一个巧妙的实验,使用了他们称之为“已知零值”(known-null)的时间戳。他们使用了完全相同的用户和完全相同的活动模式,但挑选了用户正处于忙碌状态却并未询问 AI 问题的时刻。他们将这些随机时刻视为“事件”。由于这些时刻只是时间轴上的随机点,没有任何实际的干预,因此它们不可能导致任何行为变化。如果标准的测量工具运行正常,它们应该在这些虚假时刻之后观察到零效应。然而,结果却显示,这些工具报告了大规模的活动激增。当研究人员查看数据时,他们发现这些随机的虚假时刻产生的搜索活动增加量,几乎与真实 AI 响应后的增加量一样大。具体而言,虚假时刻产生了约 3.4 倍的常规搜索活动,而真实的 AI 时刻则产生了约 4.3 倍。
这一结果令人震惊,因为它表明 AI 的“效应”在很大程度上是由时机造成的错觉。研究人员发现,活动量并不是在 AI 响应的那一刻突然跳升的。相反,活动量在响应发生前的约八分钟就已经开始攀升,达到顶峰,然后缓慢下降。AI 的响应仅仅是任务已进入全速运转状态时的一个时间标记。用户之所以在搜索和浏览,是因为他们正处于一个“任务片段”(task episode)之中,即一段高参与度的时期。AI 的响应是该片段的一个标记,而不是启动它的火花。
为了证明这是一个普遍问题而非仅限于 AI 的特例,研究人员观察了其他类型的数字事件。他们检查了用户点击购物链接、访问新闻网站或打开编程文档的时刻。在每种情况下,同样的模式都出现了:在用户点击链接之前,他们在网络其他部分的活动(如一般浏览和搜索)已经处于高位。事件始终位于一个更大的、上升的活动波浪之中。研究人员甚至模拟了一个事件完全没有能力改变行为的世界。在这些计算机模拟中,他们创建了一个场景:用户的活动自然地激增然后消退,并将一个“处理”事件随机放置在这次激增之中。尽管该事件什么也没做,标准的分析方法仍然报告了一个巨大的正向效应。这些方法之所以失败,是因为它们在统计用户注意力的自然起伏,并将其误认为是对事件的反应。
研究还测试了常见的统计技巧是否能解决这个问题。研究人员通常尝试通过将用户与自己在不同时间的表现进行对比,或匹配用户的近期历史来控制这种偏差。作者发现,这些方法并不奏效。因为“忙碌状态”是隐藏且随分钟快速变化的,通过观察一小时前的历史数据来预测当前的状况,就像试图通过昨天的天气来预测一场风暴。这种高参与度的隐藏状态无法被这些旧的数据点所捕捉。研究人员表明,即使他们尝试将用户匹配到具有相似活动水平的时刻,偏差依然存在。要真正将事件与片段区分开来,唯一的办法是比较整个时段——即将一次包含 AI 的完整研究过程与一次不含 AI 的完整研究过程进行对比——而不是仅仅观察点击后的几分钟。
这项发现对于我们理解数字生活具有重要意义。它表明,许多声称特定工具或广告驱动了活动激增的报告可能误读了数据。这种激增原本就会发生。研究人员并不是说 AI 或广告没有效果;他们只是认为衡量它们的标准方法存在缺陷。如果一个人已经在购物行程中了,AI 助手可能会帮他找到产品,但助手并没有创造这场购物行程。研究结论指出,为了得到正确的答案,我们必须停止将单次点击视为故事的开始,而要开始观察整个章节。我们需要比较用户一天中类似的章节(有或没有特定事件发生),以观察故事本身是否发生了变化。在此之前,我们在数字日志中看到的“效应”,很可能只是一个正在破碎的波浪所留下的回声。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。