← 最新论文
💬 NLP

Investigating Knowledge Transfer Across Interactive Dialogue Games

本文通过分析在 Clembench 套件上进行微调的大语言模型,研究了交互式对话游戏中的知识迁移,揭示了视觉空间探索类游戏迁移效果最好,而基于相似性的任务向量则无法捕捉复杂的迁移模式。

原作者: Filippo Momentè, Mir Nafis Sharear Shopnil, Andrea de Varda, Pavel Merinov, Raffaella Bernardi, Oswald Lanz, Alessandro Suglia, Alessandro Torcinovich

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Filippo Momentè, Mir Nafis Sharear Shopnil, Andrea de Varda, Pavel Merinov, Raffaella Bernardi, Oswald Lanz, Alessandro Suglia, Alessandro Torcinovich

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的广袤领域中,研究人员长期以来一直依赖静态测试来衡量计算机对语言理解的程度。这些测试就像是多项选择题,模型只需从列表中选出正确答案。但真正的对话很少是一场考试;它是一种动态的、来回往复的交流,人们必须通过协作来解决问题、遵循规则并实现目标。为了弥补这一差距,科学家们转向了“对话游戏”。这些是结构化的场景,人工智能必须利用语言来应对某种情境,例如根据线索猜词,或引导伙伴穿过虚拟迷宫。驱动近期研究的核心问题不仅在于一个模型能否赢得单场游戏,而在于它在一个游戏中习得的技能是否能帮助它赢得其他游戏。如果一台机器学会了导航复杂的迷宫,这是否会让它更擅长猜词?还是说这些技能是完全独立的?

一个研究小组致力于通过将对话游戏视为学习的实验室来绘制这些联系。他们从十七种不同的游戏开始,涵盖了从基于词汇的谜题(如“禁忌”游戏,玩家必须在不使用禁用词的情况下描述一个词)到空间挑战(如“冒险游戏”,玩家必须探索虚拟环境并移动物体以达到目标)。他们将这些游戏分为两大类:一类依赖言语推理,另一类则需要视觉空间思维,例如理解网格和物理布局。随后,研究人员选取了一个大型语言模型,并针对每种游戏分别对其进行专门训练。这个过程创造了一系列专门的专家,每个专家都精通单一游戏,但也可能携带有助于其他游戏的隐藏知识。

为了观察这种知识如何在游戏之间转移,该团队进行了一系列大规模实验。他们将针对某一游戏训练的模型拿出来,并在所有其他游戏上进行测试,以观察其性能是否得到提升。他们发现,知识的转移并非随机的,而是遵循着清晰的模式。最令人惊讶的发现是,涉及空间推理的游戏是最慷慨的“老师”。一个经过虚拟世界导航或根据指令绘制网格训练的模型,展现出了显著提升纯言语游戏表现的能力。例如,在探索类游戏中习得的技能有助于模型更好地玩“禁忌”游戏,尽管这两个游戏在表面上看起来完全不同。相比之下,针对言语类游戏的训练很少能帮助模型完成空间任务。研究人员发现,空间类游戏提供了一种某种形式的通用基础,教会了模型诸如规划和策略等可以应用于任何地方的通用技能。

该团队还试图寻找一种更简单的方法,无需反复玩游戏即可预测这些结果。他们检查了模型的内部“权重”——即训练过程中进行的数学调整——以观察在计算机大脑内部,相互互助的游戏是否看起来相似。他们希望如果两个游戏相关,模型内部结构的改变也会相似,就像两枚指纹匹配一样。然而,这种方法未能预测结果。他们发现,虽然针对同一游戏但扮演不同角色(如线索提供者与猜测者)的模型在内部看起来很相似,但这种相似性并不能告诉他们一个游戏是否会对另一个游戏有所帮助。两个游戏在模型的内部大脑中可能看起来非常相似,但在实际游玩时却无法提供任何帮助。相反,内部结构看起来迥异的游戏仍可能带来巨大的性能提升。

这表明,衡量一个游戏如何帮助另一个游戏的真正标准不在于模型的静态结构,而在于“玩”的过程。研究人员得出结论,虽然我们可以通过观察内部变化来了解模型学到了什么,但如果不进行实际测试,我们无法预测这种学习如何转移到新任务中。这项研究强调,对话游戏需要复杂且多层次的技能,这些技能以不同的方式实例化。某些游戏,特别是涉及空间推理的游戏,充当了强大的训练场,构建了一种能够应对广泛挑战的灵活智能。而另一些游戏则更为专业化,在自身狭窄的领域之外几乎无法提供帮助。通过绘制这些关系图,研究人员为人工智能如何思考提供了一个更清晰的图景,表明通往更强大模型的路径可能在于教会它如何在这个世界中航行,而不只是谈论它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →