← 最新论文
🤖 AI

Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

本文提出了“用户行为稠密化定律”(User Behavioral Densing Law),这是一种将数据规模与最小充分分词能力联系起来的定量缩放模式,并引入了 ALGN,一种能够克服十亿级数据瓶颈并在用户表示学习中超越现有基准的自适应分词方法。

原作者: Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,每一次点击、购买和搜索都会留下痕迹。对于那些构建了我们日常使用平台的公司而言,这些痕迹不仅仅是记录;它们是理解我们是谁的原材料。通过分析一个人行为的长久且曲折的历史,人工智能系统试图构建出一个关于该个体偏好和习惯的单一且强大的总结。这个总结通常被称为“用户表示”(user representation),它充当了数字指纹的角色,帮助决定向其展示什么新闻、推荐什么产品或展示哪些广告。多年来,工程师们普遍持有一种简单的信念:为了让这些指纹更准确,你只需要更多的数据。这种逻辑看起来很合理——为系统喂入更多的用户、更长的人生轨迹以及更大的计算机大脑来处理这一切,结果自然会变得更好。

然而,一项新的研究挑战了这种“多多益善”的假设。来自蚂蚁集团和浙江大学的研究人员调查了这种无止境扩张的策略在处理如支付宝处理的数十亿笔交易这类大规模真实世界数据时是否真的有效。他们发现,当增加原始信息时,存在一个临界点,此时增加信息不再有帮助,反而会产生负面影响。正如一个房间如果堆满了家具就会变得无法移动一样,一个系统如果被过多的重复性、低价值数据淹没,就会失去识别真正重要事物的能力。团队发现,瓶颈不在于计算机模型的大小,而在于输入信息的质量和密度。他们提出了一种新方法,专注于将这种庞大的历史压缩成一个紧凑、高价值的总结,从而使系统能够“以少胜多”。

研究人员首先在包含数亿用户的数据集上测试了传统方法的极限。他们系统地增加了用户数量、观察的时间窗口以及计算机模型本身的大小。他们发现性能起初提升很快,但随后撞上了一堵硬墙。当他们在超过一定点后增加用户,或者观察超过约六十天的历史记录时,系统停止了学习任何新东西。额外的数据大多只是重复不断的旧习惯,就像一个人十年来每天早上买同样的咖啡一样。即使他们显著扩大了计算机模型,它也未能变得更聪明;它只是记住了这些重复的细节,而没有获得任何真正的洞察。研究人员称之为“原始行为缩放墙”(raw behavioral scaling wall)的这一现象表明,仅仅向问题投喂更多数据已不再是一种可行的策略。

为了突破这堵墙,团队引入了一种“数据稠密化”(densing)的方法。他们并没有将整个混乱的原始事件历史直接喂给系统,而是首先将这些事件转化为一组紧凑的数字标记(tokens),类似于一本书可以被总结成几个关键句子而不丢失主旨。他们使用了一种技术,将相似的行为归类在一起并剥离冗余,只保留最具信息量的信号。当他们在这些压缩后的、标记化的用户历史版本上训练模型时,结果令人瞩目。即使随着数据规模的扩大,系统仍在持续改进,而使用原始数据训练的系统早已停滞不前。压缩后的数据让模型能够“见森林而非迷失在树木之中”,即使在输入量巨大时,仍能保持学习和适应的能力。

该研究进一步定义了一个精确的规则,即随着数据增长需要多少压缩。他们发现,存储用户总结所需的“空间”并不需要与原始数据量成正比增长。相反,它遵循一种可预测的模式,即必要的容量随数据量的增加而缓慢增长。这意味着对于处理十亿用户的系统,你不需要十亿倍的内存或计算能力;你只需要经过精心计算的、规模小得多的高质量标记。这一发现,他们称之为“行为稠密化定律”(Behavioral Densing Law),为工程师提供了一个数学指南,让他们确切知道对于任何给定的数据量应该应用多少压缩,从而确保不会在不必要的信息上浪费资源。

最后,研究人员开发了一种名为“自适应长度门控网络”(Adaptive Length Gated Network)的新工具来将这一定律付诸实践。以往的方法对每个用户的历史记录一视同仁,无论其生活多么复杂,都分配相同数量的压缩空间。新工具则更加聪明;它会针对每个用户进行个体化观察,并决定保留多少细节。对于生活非常规律、可预测的用户,它分配极短的总结;对于生活复杂、兴趣广泛的用户,它则分配更长、更详细的总结。这种动态方法确保了不会在枯燥、重复的数据上浪费任何计算能力,同时复杂的用户仍能获得所需的关注。在测试中,这种自适应方法不仅在准确性上超越了所有之前的系统,而且使用了显著更少的计算容量,证明了效率与性能可以并行不悖。

这项工作的意义远不止于一个应用程序或网站。它暗示了我们构建未来智能系统的方式正在发生根本性的转变。未来的路径不在于无止境地收集更多数据和构建更大的模型,而在于学会从现有的数据中提取更多的价值。通过关注信息的密度而非单纯的体积,我们可以构建出不仅更准确,而且更高效、更可持续的系统。这项研究表明,在数据大时代的背景下,最强大的工具不是一个更大的桶,而是一个更好的过滤器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →