在竞技卡牌游戏的世界里,存在着一个独特的挑战,它在每一套新卡牌揭晓、但在任何人开始实际游玩之前便已产生。想象一下这样一群玩家:他们聚集在一起,准备从一盒数百张全新的卡牌中构建卡组。他们必须逐一决定哪些卡牌值得保留,哪些应该传给下一位玩家,而与此同时,他们对这些卡牌的表现一无所知。这就是“零日问题”(day-zero problem)。几十年来,旨在帮助玩家做出这些选择的计算机程序一直处于停滞状态。它们依赖于从过去的比赛中学习,但当一套新卡牌到来时,却没有任何过去的比赛可以供其学习。数据根本还不存在。这使得玩家只能完全依赖人类的直觉和专家意见,而这些虽然有价值,却是主观的,且因人而异。研究人员长期以来的疑问在于,计算机是否能够学会关于优秀卡牌选择的通用规则,从而在从未见过该套卡牌任何一次选牌的情况下,做出明智的猜测。
一位名叫布莱恩·沃德(Brian Ward)的研究员通过一个名为 DraftFM 的新系统解决了这个问题。该系统并没有试图记忆特定的卡牌,也没有等待数据的积累,而是通过学习人类玩家在过去几年中跨越 29 套不同卡牌集的近 1.5 亿次选择来进行训练。其核心创新在于计算机看待卡牌的方式。系统并非将每张卡牌视为需要记忆的独特名称,而是将每张卡牌分解为一系列物理和文字特征:它的颜色、费用、类型以及规则文本。它还利用一个固定的、预训练的语言理解能力来阅读卡牌的描述。通过学习成千上万种不同的卡牌集,该系统学会了仅凭这些特征就能识别出是什么让一张卡牌具有价值。它不知道卡牌的名字,也不知道它属于哪一个系列;它只知道它能看到的特征。这使得它在面对一张从未遇到过的新卡牌时,能够基于多年前研究卡牌时所使用的逻辑,对其进行评分。
为了测试这种方法是否奏效,研究人员从训练数据中扣留了整整三个完整的卡牌集。这些集合对模型来说是完全未知的。当系统被要求预测人类玩家会在这些新卡牌集中如何选牌时,它的表现出了惊人的准确性。在选牌的第一轮中,玩家拥有数十种选择,而靠随机运气猜对的概率仅为 7% 左右,该模型的预测与人类的选择一致率约为 51% 到 60%。这是一个显著的飞跃,因为之前的计算机模型在经过数周的实际游玩之后才能尝试执行这项任务。该系统还正确地识别出,人类玩家在选牌过程的最开始阶段——即他们拥有最多选择自由时——往往表现得最为一致,并且随着可用卡牌池的缩小,他们的选择会变得更加可预测。
该系统的真正考验来自于一套基于《霍比特人》(The Hobbit)的新系列。在这一套牌甚至尚未在大多数人进行选牌的数字平台上发布之前,研究人员就使用 DraftFM 生成了该系列中每张卡牌的完整排名。该排名被密封并附带数字时间戳,在约 3 6 小时后发布,确保是在该系列正式上线之前做出的预测,从而保证在没有任何关于卡牌实际表现知识的情况下进行。随后,研究人员将计算机生成的排名与卡牌社区中六位知名独立人类专家的预发布评论进行了对比。结果显示,计算机的排名与人类专家之间的共识程度,大约与专家们彼此之间的共识程度相当。虽然计算机并未超越人类,但它在未玩过一局游戏、也未见过任何选牌日志的情况下,达到了人类专家的共识水平。
这项工作证明了计算机可以学会复杂游戏的底层逻辑,从而对全新的内容做出明智的预测。它证明了即使在卡牌选牌这样复杂的领域,从过去的经验推广到未来的未知情况也是可能的。该系统并非完美,它在预测时表现出统一的过度自信,并且在面对困难选择时仍难以匹配人类专家的细微差别。然而,它为“零日”阶段的可能性建立了一个新的基准。通过将卡牌视为特征的集合而非记忆中的名称,该模型弥合了从历史中学习与在未知中航行之间的鸿沟。研究人员承诺,一旦该新系列的实际选牌数据可用,他将发布一项后续研究,届时将揭示模型的预测是否经得起实际玩法现实的检验。目前,这项工作本身就是一种证明:机器可以学会预测的游戏,即便规则正在被首次书写。
技术摘要:DraftFM —— 用于《万智牌》“零日”环境下起草的基座模型
问题陈述
在《万智牌》(MTG)中,起草(Drafting)是一个具有不完全信息的序列博弈过程,玩家通过从卡包中选择卡牌来构建卡组。对于数据驱动型助手而言,一个关键挑战是“零日”(day-zero)机制:当一个新系列发布时,完整的卡牌列表是公开的,但尚未存在任何起草日志。现有的监督学习选牌模型依赖于针对特定系列的特定历史起草数据,这导致了长达两周的滞后,无法在发布初期提供协助。此外,将卡牌编码为固定词表索引或依赖发布后使用统计数据的模型,无法对真正未见的卡牌或系列进行评分。虽然大语言模型(LLM)可以阅读卡牌文本,但如果没有针对目标系列的规模化微调,它们往往难以超越较小的监督学习模型,并可能受到关于发布后策略讨论的数据泄露影响。
方法论
本文介绍了 DraftFM,这是一个旨在无需目标系列选牌数据或使用统计数据即可在“零日”环境下运行的基座模型。
- 数据来源: 该模型在来自 29 个扩展系列的 1.49 亿次人类起草选牌(通过 17Lands 获取)以及 Scryfall 的卡牌元数据上进行训练。三个扩展系列(《战魔大战》、《万智牌:基石》和《漫威超级英雄》)被完全保留用于零样本(zero-shot)评估。
- 卡牌表示: DraftFM 将卡牌视为仅由公开卡牌记录衍生的冻结 775 维向量。
- 391 个结构化特征: 从 Scryfall 记录中解析(法术力费用、颜色、稀有度、类型、力量/防御力、关键词、子类型)。
- 384 个文本嵌入: 使用冻结的 BAAI/bge-small-en-v1.5 句子编码器生成的卡牌类型行和规则文本的 L2 归一化嵌入。
- 排除项: 模型不包含卡牌身份参数、系列身份参数或发布后的使用统计数据。未见过的卡牌使用与已知卡牌相同的机制进行评分。
- 神经架构: DraftFM 是一个离散选择策略(对可用卡牌进行 softmax),以当前卡包、已起草的卡池以及起草者状态为条件。
- 卡牌编码器: 一个共享的 MLP 将每张卡牌的 775 个特征映射到 d 维嵌入空间。
- 卡池编码器: 一个基于注意力的机制将累积的已起草卡牌(最多 46 张不同卡牌)总结为一个向量。
- 上下文编码器: 嵌入起草位置、格式以及玩家技能/经验等级。
- 评分器: 一个网络将候选卡牌嵌入、卡池摘要、它们的元素级交互以及上下文进行拼接,以产生分数。对可用卡包进行 softmax 运算得出选择概率。
- 训练: 模型通过最小化预测分布与观测到的实际人类选牌之间的交叉熵进行训练。在不同的模型宽度(d∈{128,256,512})下使用固定的优化方案(AdamW, label smoothing)。
核心贡献
- 零日基座模型: DraftFM 是第一个通过仅使用基于特征的输入(无目标系列选牌或使用统计数据)在多个扩展系列中进行训练,并在全新的扩展系列中实现有效零样本泛化的策略模型。
- 密封的前瞻性预测: 作者生成了针对未发布系列《魔戒》(The Hobbit, HOB)的完整 P1P1(第一包,第一选)卡牌排名。该预测通过密码学溯源(输入、模型和输出的哈希值)进行了密封,并在该系列于 MTG Arena 可玩前约 36 小时发布,确保没有数据泄露。
- 与人类专家基准对比: 本文将模型的发布前排名与六位独立的创作者进行了比较。它建立了专家在游戏前达成共识的基准,并指出专家之间本身也存在显著分歧。
结果
- 零样本性能: 在三个留出的扩展系列(《战魔大战》、《万智牌:基石》、《漫威超级英雄》)上,所选的 160 万参数模型(d=256)分别实现了 50.8%、60.4% 和 56.7% 的 Top-1 一致率。这些结果显著优于均匀分布随机选择(在首选时约为 ~7%)以及此前研究中的仅基于特征的基准模型。
- 位置结构: 模型复制了已知的行为模式:原始一致率在卡包开始时最高,在中间下降,并在接近结束时上升。当针对缩减的卡包规模进行归一化(机会归一化一致率)时,曲线在前 4–5 次选牌时下降,在第 5 或第 6 次选牌时转向,随后上升。
- 与专家对比: 与六位预发布评论员相比,DraftFM 的一致性(通过精确匹配、步长内匹配和秩相关性衡量)通常落在人类评论员之间观察到的共识范围内。模型并未超越最佳的人类间一致性,但也并未大幅低于专家群体的共识。
- 效率: 所选模型(d=256)在性能和计算成本之间提供了最佳平衡,其参数量和训练时间仅为最大变体(d=512)的 44% 和 43%,同时保持了相当的准确性。
意义与主张
本文声称,DraftFM 证明了单个基于特征的策略可以在不记忆卡牌身份或依赖发布后数据的情况下,预测全新环境中的人类起草选择。这隔离了“零日”问题,表明使用仅基于特征的输入,跨系列的迁移学习是可行的。
作者对预测的准确性持谨慎态度。他们明确表示,本文并非声称该模型比人类专家更准确,也并非声称该模型能最大化胜率。针对实际结果的评估将在 17Lands 数据可用后的后续研究中进行。其主要意义在于程序上的严谨性——即通过密封预测进行的验证,以及证明了基座模型可以在传统监督学习模型尚不存在的阶段有效运行。这项工作确立了“零日”是进化环境中模型面临的永久状态,而 DraftFM 为解决这一问题提供了一种可行的架构。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。