想象一下,你正在聘请一位私人图书管理员来为你推荐书籍。你希望这位图书管理员既可靠(记得你去年喜欢什么),又灵活(能迅速了解新趋势或你口味的变化)。
这篇在 UMAP '26 会议上发表的论文,介绍了一种测试推荐系统(如 Netflix、Amazon 或 Goodreads 上的系统)如何平衡这两种特性的新方法。作者将这些特性称为稳定性(Stability)和可塑性(Plasticity)。
以下是他们观点的分解,使用了简单的类比:
1. 问题:“快照”陷阱
目前,当公司测试其推荐算法时,他们会截取数据的“快照”。他们使用旧数据训练模型,然后检查模型预测接下来几次互动的表现。
- 类比:这就像让司机在阳光明媚、空无一人的道路上开 10 分钟来测试他。你知道他会开车,但你不知道他如何应对突如其来的暴雨、爆胎,或者下周新的交通模式。
- 问题:现实生活是变化的。用户的口味会转变,新书会出版,旧爱会褪色。目前的测试无法告诉我们,当模型学习新事物时,是否会“忘记”旧爱,或者是否会“困”在过去而无法学习新趋势。
2. 解决方案:“时间旅行”测试
作者提出了一种模拟变化的新测试方法。他们不仅仅查看快照,而是观察模型的演变。
测试如何运作:
- 设置:他们取出一组书评数据集,将其分为两个时间段:第 1 年(过去)和第 2 年(未来)。
- 转折:在“第 2 年”中,他们秘密更改了 50% 书籍的名称。对计算机而言,这些现在变成了全新的、未知的书籍。这迫使模型进行适应。
- 竞赛:他们训练了两个版本的图书管理员:
- 图书管理员 A(守旧派):仅在第 1 年数据上训练。
- 图书管理员 B(新聘人员):在第 1 年和第 2 年(包含新书名)的数据上训练。
- 评分表:
- 可塑性(适应性):与图书管理员 A 相比,图书管理员 B 在推荐新书籍方面表现好多少?如果 B 表现好得多,该系统就是可塑的(灵活的)。
- 稳定性(记忆力):与图书管理员 A 相比,图书管理员 B 推荐旧书籍(来自第 1 年)的能力下降了多少?如果 B 仍然很好地记住了旧书,该系统就是稳定的。
3. “稳定性 - 可塑性困境”
该论文强调了一个经典的权衡,就像跷跷板:
- 高可塑性:系统能快速学习新事物,但可能会忘记旧事物(就像一个为了新考试而刻苦学习的学生,却忘记了上周的课程)。
- 高稳定性:系统完美地记住了一切,但难以适应新趋势(就像一个只推荐 1990 年以前书籍的图书管理员,因为他们拒绝学习新流派)。
4. 他们的发现(实验)
研究人员使用 Goodreads 的数据测试了三种不同类型的“图书管理员”(算法):
- 基于用户的 KNN(UKNN):一种寻找口味相似人群的方法。
- BPRMF:一种利用数学寻找评分中隐藏模式的方法。
- NeuMF:一种复杂的神经网络(AI)方法。
结果:
- “僵化”的图书管理员(UKNN):这一类非常稳定。它完美地记住了旧书,没有被新书搞糊涂。然而,它的可塑性很低;它难以适应新的“假”书籍。这就像一个背熟了目录却无法应对新到书籍的图书管理员。
- “灵活”的图书管理员(BPRMF):这一类可塑性很高。它能非常快地适应新书。然而,它的稳定性稍差;学习新事物使其在记住旧事物方面表现稍差。
- “平衡”的图书管理员(NeuMF):这一类介于两者之间,表现出两种特性的混合。
5. 为什么这很重要
作者认为,了解系统的“个性”(它是僵化还是灵活?)有助于开发者为工作选择合适的工具:
- 快速变化的世界(如新闻或社交媒体)需要可塑的系统,能够即时适应。
- 缓慢变化的世界(如经典文学或音乐)可能受益于稳定的系统,它们不会被噪音搞糊涂。
总结
这篇论文不仅仅问:“这个算法有效吗?”它问的是:“当世界发生变化时,这个算法表现如何?”他们建立了一个新的“压力测试”,用来衡量推荐系统是一个固执的老派人物(高稳定性,低可塑性)还是一个快速学习者(高可塑性,潜在的低稳定性),从而帮助开发者为未来构建更好、更可靠的系统。
以下是论文《衡量推荐系统的稳定性与可塑性》的详细技术摘要。
1. 问题陈述
推荐系统的传统离线评估协议依赖于静态数据集,将数据划分为训练集和测试集以衡量快照性能。然而,现实世界中的系统是动态的;它们随时间演变,需要利用近期数据频繁重新训练。这导致当前评估方法存在一个关键缺口:
- 稳定性 - 可塑性困境:系统面临稳定性(保留先前学习的模式)与可塑性(快速适应新模式)之间的权衡。
- 当前方法的局限性:现有的持续学习框架(通常用于监督分类)依赖于明确的“任务”概念,而在推荐系统中,数据连续流动且没有清晰的任务边界,使得这一概念变得模糊。此外,大多数研究集中在“灾难性遗忘”(稳定性)上,而忽视了可塑性。
- 需求:缺乏一个统一的、与算法无关的框架,用于衡量不同推荐算法在利用演变数据重新训练时的表现,特别是其在保留旧知识与吸收新模式之间取得平衡的能力。
2. 方法论
作者提出了一种与算法和指标无关的离线评估协议,旨在模拟现实世界的数据演变并衡量稳定性与可塑性。
3.1 数据动态(人工偏移)
为了控制变化的时间和性质,作者在数据集中引入了人工偏移:
- 时间分割:数据集 D 按时间顺序划分为两个相等的时间段,D1(较旧)和 D2(较新)。
- 标签操纵:随机选择 D2 中 50% 的物品,将其 ID 更改为新的、唯一的标签。
- 这迫使模型将 D2 中的这些物品视为全新的实体。
- 其余 50% 的物品保留其原始 ID,从而保留部分自然的交互模式。
- 结果:这创造了一种底层分布发生变化的场景,迫使模型进行适应(可塑性),同时可能遗忘旧模式(稳定性)。
3.2 实验协议
训练两个模型以模拟“遗留”与“重新训练”的场景:
- 模型 M1(遗留):仅在 D1 上训练。
- 模型 M2(重新训练):在D1 和 D2 上训练。
- 评估:两个模型均在来自两个时间段的保留测试集(DTest1 和 DTest2)上进行测试。
3.3 指标
该框架基于模型在测试集上的性能得分(S)定义了两个核心指标:
- 稳定性:衡量重新训练的模型(M2)相对于遗留模型(M1)在旧数据上保留性能的程度。
Stability=1−(S1,1−S2,1)
其中 S1,1 是 M1 在 DTest1 上的得分,S2,1 是 M2 在 DTest1 上的得分。
- 解释:接近 1 的值表示高稳定性(旧数据性能无下降)。大于 1 的值意味着重新训练的模型在旧数据上实际上有所提升。
- 可塑性:衡量重新训练的模型(M2)相对于遗留模型(M1)适应新数据的能力。
Plasticity=S2,2−S1,2
其中 S2,2 是 M2 在 DTest2 上的得分,S1,2 是 M1 在 DTest2 上的得分。
3. 主要贡献
- 新颖的框架:一种专为推荐系统设计的评估协议,无需预定义的“任务”,使其适用于连续数据流。
- 无关性设计:该方法独立于特定算法(例如神经网络与矩阵分解)、数据集或评估指标(准确率、多样性等)。
- 实证见解:提供了不同算法范式之间稳定性与可塑性存在权衡的初步证据。
4. 实验结果
作者在 GoodReads 数据集(书籍评论)上评估了 RecBole 库中的三种代表性算法:
- UKNN:基于用户的 K 近邻(基于邻域)。
- BPRMF:贝叶斯个性化排序矩阵分解(潜在因子)。
- NeuMF:神经矩阵分解(深度学习)。
主要发现:
- UKNN(基于邻域):
- 高稳定性(1.038):重新训练后,它在旧数据上保留甚至提升了性能。
- 低可塑性(0.180):它在适应 D2 中的新物品方面存在显著困难。
- 分析:邻域方法充当交互的“记忆”;添加新数据不会覆盖旧模式,但无法有效地整合新模式。
- BPRMF(矩阵分解):
- 较低稳定性(0.989):在旧数据上性能略有下降。
- 最高可塑性(0.283):表现出适应新模式的最佳能力。
- NeuMF(神经网络):
- 平衡特征:稳定性(1.008)和可塑性(0.276)介于 UKNN 和 BPRMF 之间,显示出强大的保留能力和良好的适应性。
关于权衡的结论:结果表明存在明显的权衡。基于邻域的模型(UKNN)刚性且稳定但缺乏灵活性。基于模型的approaches(BPRMF, NeuMF)对新模式更敏感(更高的可塑性),但存在历史数据轻微退化的风险(较低的稳定性)。
5. 意义与未来工作
- 实际影响:该框架允许系统架构师根据领域的动态特性选择算法。例如,高度动态的领域(新闻、社交媒体)可能倾向于高可塑性模型,而静态领域(书籍、音乐)可能从高稳定性模型中受益。
- 合规性:了解这些特征有助于评估如欧盟《数字服务法案》等法规的风险,预测系统对数据偏移的反应。
- 局限性与未来工作:
- 50% 的人工偏移可能低估了现实世界漂移的影响。
- 当前协议存在潜在的“时间泄露”偏差,即 M2 相对于 D1 拥有未来知识。
- 未来工作包括扩展到更多数据集,测试准确率之外的指标(多样性、公平性),并发布开源软件包以确保可复现性。
总之,本文超越了静态准确率指标,为评估推荐系统提供了动态视角,强调了“最佳”算法取决于应用场景对稳定性与可塑性平衡的具体需求。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。