Two-Sided Nearest Neighbors: An adaptive and minimax optimal procedure for matrix completion
本文提出了一种针对具有低平滑度和高缺失率的潜在非线性因子模型的矩阵补全的双侧最近邻算法,证明了该算法能够实现适应底层函数平滑度并匹配预知性能(oracle performance)的极小极大最优误差率,即使在存在确定性缺失项的情况下也是如此。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,我们不断被庞大的信息网格所包围,从流媒体服务推荐的电影,到健康应用追踪的每日步数。这些网格很少是完整的;用户会跳过评分,传感器可能无法记录数据,人们也并不总是出现在每一次预定的检查中。科学家面临的挑战是如何在不凭空捏造虚假信息的情况下,准确地填补这些缺失的部分。这个问题被称为“矩阵补全”(matrix completion),它依赖于这样一个理念:隐藏的模式将我们所见的数据与未见的数据联系在一起。如果一个人喜欢动作片,也往往会喜欢科幻片,系统就可以利用这种联系来预测他对一部尚未看过的电影可能持有的看法。然而,现实世界的数据是杂乱无章的。缺失的信息往往不是随机发生的;用户可能仅仅是因为太不喜欢某部电影而不屑于评分,或者传感器可能仅在特定条件下才会失效。此外,用户与项目之间的关系通常是复杂且非线性的,这意味着简单的直线规则无法捕捉到全貌。
康奈尔大学和宾夕法尼亚大学的一个研究小组开发了一种新方法来解决这个困难的谜题,特别是在数据以偏差方式缺失且底层模式复杂的情况下。他们专注于一种称为“最近邻”(nearest neighbors)的技术,该技术通过在数据网格中寻找相似的行和列来进行预测。虽然这种方法此前已有研究,但以往的理论通常假设数据是随机缺失的,或者数据点之间的关系是平滑且简单的。研究人员提出了疑问:当数据的缺失是由其本身包含的数值所导致,且用户与项目之间的连接是锯齿状且不规则而非平滑时,这种方法是否仍能奏效。
为了回答这个问题,该团队分析了一种“双向最近邻算法”。想象一个网格,其中行代表不同的人,列代表特定的时刻或特定的事件。该算法寻找在行为上与目标人物相似的人,同时也寻找在特定时刻与目标时刻相似的时刻。通过对这些相似的人和相似时刻的已知结果进行平均,该方法可以估算缺失的值。研究人员从数学上证明了这种方法能够适应数据的复杂性。如果隐藏的模式非常粗糙且不规则,该方法会调整其搜索过程以找到合适的相似度;如果模式较为平滑,它则会相应地精细化搜索。至关重要的是,他们证明了即使该算法本身并不了解驱动数据的那些隐藏因素,其表现也能达到一个已经拥有这些隐藏因素的完美、全知系统的水平。
研究还表明,即使在很大一部分数据以确定性的方式缺失时,该方法依然保持稳健。例如,在一种场景下,由于特定规则(例如用户在无法使用手机时不会收到通知)导致百分之二十的数据被保证缺失,该算法仍然能够成功。即便缺失并非随机,而是与系统的底层结构相关联,它也不会失效。研究人员通过广泛的计算机模拟验证了这些理论发现,并将该方法与其他各种技术进行了对比。在这些测试中,他们的双向方法始终优于标准方法,在更多数据可用时,其误差率呈现出稳定的下降趋势,而其他方法则表现挣扎甚至失败。
为了展示这在现实世界中如何运作,团队将该方法应用于一项名为“HeartSteps”的移动健康研究数据。这项研究涉及37名参与者,他们通过手机接收通知以鼓励步行。目标是估算如果发送了特定类型的通知,一个人会走多少步,即使该通知实际上并未发出。由于参与者并非在每个时刻都可用,且通知发送具有一定的概率,因此数据是不完整且存在偏差的。研究人员将用户视为行,将决策时间视为列,创建了一个带有缺失条目的网格。当他们将该方法与其他方法进行比较时,这种双向最近邻方法产生了最准确的估算,具有最小的误差和最一致的结果。它成功地穿透了缺失的数据,揭示了干预措施可能产生的结果。
这项工作的意义在于其处理人类行为和传感器数据这类杂乱现实的能力。通过证明一种相对简单的自适应搜索策略可以匹配具有完全知识的理想系统的性能,研究人员为包括推荐引擎和医学试验在内的诸多领域提供了一个强大的工具。他们表明,即使在数据并非随机缺失且关系复杂的情况下,我们也不需要知道隐藏的原因也能做出准确的预测。我们只需要观察两个方向的“邻居”——跨越人群的方向以及跨越时间的方向——并让模式自然显现。这一发现表明,在一个信息不完整的世界里,正确类型的平均化处理可以揭示真相,而无需先解开整个谜团。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。