← 最新论文
💻 computer science

Scaling Laws for Behavioral Foundation Models over User Event Sequences

本文为基于用户事件序列训练的行为基础模型建立了缩放法则,揭示了一个小型特征嵌入器始终是计算最优的,且最优训练策略会随预算和评估指标而转变,以及负采样约束最终会从计算量限制转变为内存限制。

原作者: Rickard Brüel Gabrielsson

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Rickard Brüel Gabrielsson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一家巨型在线商店运营着一个规模庞大、高速运转的推荐引擎。每当顾客点击、购买或搜索时,都会留下一个数字足迹。你的目标是构建一个 AI,根据用户的历史行为来预测他们下一步会做什么。

这篇论文就像是一本用于构建该 AI 的大规模、科学性的“食谱”。作者进行了大约 600 次不同的实验,通过不断调整 AI 的“大脑”来寻找各种可能的方式,以确定如何最有效地利用他们的计算能力(这涉及大量的资金和电力成本)。

以下是他们的研究发现,使用了简单的类比进行说明:

1. 双部分的大脑:图书管理员与说书人

大多数这类 AI 模型都有两个协同工作的不同部分:

  • 图书管理员(嵌入器/Embedder): 这部分负责观察特定的物品(如一双鞋或一笔交易),并弄清楚它是什么。它会阅读文本、价格、颜色和类别。
  • 说书人(Transformer): 这部分负责观察事件的序列。它会记住你看了鞋子,然后看了帽子,接着看了夹克,并尝试猜测你下一步会买什么。

重大发现: 作者发现,“图书管理员”应该是微小的。

  • 类比: 想象你正在雇佣一个团队来写一部小说。你的预算有限。你可能会认为你需要一支庞大的研究团队(图书管理员)来为每一个词查阅资料。但作者发现,你只需要一个微小的研究团队(约占总员工人数的 2%)
  • 原因: “图书管理员”会反复看到相同的热门物品(如“耐克运动鞋”)成千上千次。它会感到厌倦并很快学会这些内容。然而,“说书人”看到的则是独特的事件组合,这些组合很少重复。因此,说书人需要一个强大的大脑;而图书管理员只需要一个小型且高效的大脑。

2. “批大小”的抉择:教室里有多少个学生?

在训练 AI 时,你不会一次只给它一个例子,而是给它一个“批次”(batch)的例子。

  • 类比: 想象一位老师在教班级。如果班级太小(批大小为 64),老师会被个体的奇思妙想分散注意力。如果班级巨大(批大小为 2048),老师可能会感到应接不暇,或者教学内容变得过于笼统。
  • 发现: “甜点位”(最佳平衡点)取决于你在衡量什么。
    • 如果你关心的是准确率(是否得到了正确答案?),那么甜点位是一个中等规模的班级(约 570 名学生)。
    • 如果你关心的是排序(排名第一的结果是否最好?),那么甜点位是一个较小的班级(约 200–275 名学生)。
    • 启示: 你不能只选一个批大小来应对所有情况。根据你试图优化的目标不同,“最佳”大小也会随之改变。

3. 数据与模型的权衡:是大脑更强,还是图书馆更大?

你拥有一笔固定的资金(计算预算)。你是该买一个超级聪明的 AI(更多的参数)并喂给它较少的数据?还是买一个稍微没那么聪明但能喂入海量数据模型的 AI?

  • 发现:
    • 在小预算下: 你应该向 AI 提供海量的数据。AI 就像一块海绵;它需要吸收尽可能多的信息,因为它本身还不够聪明到可以进行自我泛化。
    • 在大预算下: 当你变得更富有(拥有更多计算能力)时,这种平衡就会发生转移。你会开始需要一个更聪明的 AI 以及相对较少的数据,最终达到一个比例,看起来与训练大型语言模型(如那些编写文本的模型)的方式相似。
    • 趋势: 它始于一种“数据密集型”策略,并随着你拥有更强大的计算机而逐渐转向一种“平衡型”策略。

4. “负采样”:要展示多少个错误答案?

当 AI 学习时,它不仅看到正确的答案,还会看到“干扰项”(错误答案),以此学习什么是不应该选择的。

  • 类比: 想象一场多项选择题考试。如果你只给学生展示 3 个错误答案,他们可能会靠运气猜对。如果你展示 1,000,000 个错误答案,他们就能完美掌握规律。
  • 发现:
    • 小预算下: 你需要适中的错误答案数量(数十万个)。
    • 大预算下: 你想要尽可能多的错误答案。事实上,在测试过的最大预算下,限制因素不再是计算能力,而是内存。系统想要展示 200 万个错误答案,但计算机由于空间不足无法承载。
    • 陷阱: “最佳”错误答案数量取决于你是衡量简单的准确率还是复杂的排序。这两者并不一致。

5. 最重要的教训:目标是在不断移动的

这篇论文最关键的警告是关于指标(你如何衡量成功)。

  • 类比: 想象你正在训练一辆赛车。如果你以“最高时速”来衡量成功,你会朝一个方向调校引擎。如果你以“燃油效率”来衡量,你会朝完全不同的方向调校。
  • 发现: 在这些行为模型中,你选择的指标会改变配方
    • 如果你训练 AI 来最小化“损失”(数学误差),你会得到一组设置。
    • 如果你训练它来最大化“排序”(将最好的项目排在首位),你会得到另一组不同的设置。
    • 核心观点: 最擅长最小化数学误差的 AI,并不一定是擅长正确排序物品的 AI。你必须在开始构建模型之前,明确决定你要优化什么,因为“最优”模型会根据你的选择而改变。

总结

要构建最高效的“行为基础模型”(即理解人类行为的 AI):

  1. 保持“物品理解”部分(嵌入器)非常微小(约占总容量的 2%)。
  2. 使用中等规模的批大小,但要根据你关心的是准确率还是排序来进行调整。
  3. 从海量数据开始,但随着计算能力的增强,转向更智能的模型。
  4. 使用尽可能多的“错误答案”示例,直到达到你计算机内存的极限。
  5. 最重要的一点: 在开始之前,先决定好“成功”的具体定义(指标),因为这个决定将决定你整个 AI 的架构。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →