← 最新论文
💬 NLP

SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

SeqLLM 是部署于微信支付的一种新型框架,它通过紧凑的离散词表、两阶段对齐投影器以及前缀引导的能力注入,通过行为序列建模来增强大语言模型,在保持模型原有语言能力的同时,在商户风控和推荐基准测试中取得了最先进的结果。

原作者: Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图破解一个谜团。你有一位侦探,他极其擅长阅读文字形式的线索——比如日记条目或新闻文章。这位侦探是一个大语言模型(LLM),一种在几乎所有人类写过的文字上进行过训练的计算机大脑。他能理解讽刺、总结故事,并比几乎任何人都能更好地解释复杂的概念。但这位侦探有一个盲点:他不知道如何阅读长长的动作列表,比如一个人每次买咖啡、去公园或点击屏幕的完整时间轴。这个列表被称为“行为序列”(behavioral sequence)。

在现实世界中,尤其是在在线支付领域,真相往往隐藏在两者的结合之中。一家商店在描述(文本)中可能看起来完全正常,但其交易历史(行为)可能会显示它仅在凌晨 3 点于不同省份运营,且目标群体是老年人。如果你只读描述,你会错过危险;如果你只看交易列表,你会错过语境。科学家们面临的挑战在于,如何教会这位“精通文字”的侦探同时也理解“精通动作”的时间轴,而不让他忘记如何说话或推理。如果你试图强迫模型去记忆一百万个时间轴,它可能会变得如此混乱,以至于忘记如何写出一个简单的句子。这篇论文解决的正是一个这样的问题:如何给一位语言专家赋予一种在不丧失思考能力的前提下,识别时间模式的超能力。


论文的故事:教侦探阅读时间轴

来自微信支付和几所大学的研究人员提出了一个巧妙的新框架,叫做 SeqLLM。你可以把它看作是为我们这位“精通文字”的侦探开设的一个特殊训练营。他们的目标是让侦探能够同时观察商户的概况(文本)和他们漫长的交易历史(行为),从而识别欺诈。

旧方法的缺陷
以前,如果你想让语言模型理解一个动作列表,你可能会尝试把这个列表写成一个故事。“首先,用户买了一件衬衫。然后,他们买了鞋子……”但这就像是在读一部每一句话都是数字的小说;这会让内容变得太长,让侦探感到不堪重负。

另一种方法是教侦探一种专门针对动作的新数字语言。但这种方法有一个可怕的副作用:随着侦探学习这种新语言,他开始忘记原本的语言。这就像一个学生学习新学科过于投入,以至于忘记了母语。这被称为“灾难性遗忘”(catastrophic forgetting)。论文表明,如果你使用标准方法以这种方式教学,模型的通用语言理解能力会从 0.78 的高分暴跌到糟糕的 0.27。

SeqLLM 的解决方案:三个魔术技巧
作者们并没有只是向问题中投喂更多数据,而是构建了一个更智能的系统,包含三个特定部分:

  1. 紧凑的词汇表(速记法): 他们没有写出“我在下午 2 点买了一个 200 美元的商品”,而是创建了一种特殊的速记代码。他们将每个动作分解为微小且具体的 Token,如 <Time:2PM><Amount:200><Channel:QR>。这就像是给了侦探一套乐高积木,而不是一堆沙子。它更小巧、更整洁,且不会与侦探已知的单词混淆。
  2. 转换器(桥梁): 这些新的乐高积木(Token)起初对侦探来说是毫无意义的。因此,他们构建了一个“投影器”(Projector),它就像一个翻译官,教会侦探每个积木的含义。他们并没有直接把积木扔给模型,而是采用了两步教学法。首先,他们教模型将积木翻译回正常的英语(例如,将 <Time:2PM> 转化为“2 PM”)。一旦模型理解了含义,他们就进入第二步:推理。他们要求模型观察一整串积木并解释其中的模式,例如“这个人只在深夜购物”。
  3. 秘密前缀(训练掩码): 这是最重要的技巧。通常,为了教会模型一项新技能,你会让它不断练习这项技能,这会导致它忘记其他一切。SeqLLM 使用了一种“前缀引导”(prefix-guided)的方法。想象一下,侦探在执行每项任务前都会收到一张特定的指令卡,比如“现在,请担任时间轴分析师”。只有当这张卡片存在时,模型才会学习时间轴技能。当卡片消失时,模型就表现得像往常一样聪明。这防止了“时间轴学习”扩散并破坏侦探的通用知识。

他们的发现
结果令人印象深刻。当他们测试这种新方法时:

  • 没有记忆损失: 模型预测序列中下一个动作的能力与旧的、会遗忘的方法一样好(得分 0.806 对比 0.804),但它保持了语言能力完好无损(得分 0.789,而不是暴跌至 0.27)。
  • 微信支付的实际应用成功: 他们部署了这个系统来每天检查数百万家商户。与之前的最优系统相比,新系统识别风险商户的精确度达到了 97.5%(从 92.0% 上升)。更棒的是,来自无辜商户的投诉申诉数量从 12% 降至约 2%,且没有误放任何一个违规商户。
  • 更好的欺诈检测: 当他们利用新系统的“理解力”来辅助另一个欺诈检测器时,它将顶层欺诈的检测率提升了 26.8 个百分点。对于一个处理数十亿次交易的系统来说,这是一个巨大的飞跃。
  • 全能天才: 他们还在电影和书籍推荐方面进行了测试。该模型在寻找下一个正确项目方面的表现比其他顶尖模型高出达 32%,同时使用的计算能力仅为竞争对手的 1/4.8

他们排除了哪些可能
论文明确指出,仅仅将行为写成一个长篇故事(序列化)是行不通的;这实际上让系统的精确度下降到了 83%。他们还证明了你不能在模型遗忘之后通过添加更多语言数据来“修复”遗忘问题;一旦模型遗忘,就很难找回。唯一有效的方法是使用他们的前缀引导方法在遗忘发生前进行预防。

简而言之,SeqLLM 是一种让语言专家获得观察时间模式的新视角的手段,同时不会让他忘记如何说话。这是一种更智能、更快、更准确的方式来识别数字世界的麻烦,证明了你并不需要为了获得一项技能而牺牲另一项技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →