← 最新论文
💬 NLP

Lacuna Inc. at SemEval-2026 Task 4: Structurally Gated State-Space Models for Disentangling Narrative Similarity

本文介绍了不变-变体解耦状态空间模型(Invariant-Variant Disentangled State-Space Model, IVD-SSM),该模型结合了混合状态空间骨干网络与一种新型的结构化门控对齐头,旨在有效地将抽象叙事结构从表层词汇细节中解耦,从而提升 SemEval-2026 任务 4 中的故事相似度评估效果。

原作者: Aleksey Kudelya, Rafif Alshawi, Alexander Shirnin

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Aleksey Kudelya, Rafif Alshawi, Alexander Shirnin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的中文翻译:

核心问题:“词汇相同,故事迥异”

想象一下,你正试图判断两个故事是否本质上是同一个情节,只是用了不同的角色来讲述。

  • 故事 A: 一个被霸凌的孩子利用“丧尸病毒”进行报复,从而变得受欢迎。
  • 故事 B: 一位科学家在实验室里意外释放了“丧尸病毒”,导致所有人四处尖叫逃命。

一个标准的计算机程序可能会观察后得出结论:“它们有 90% 的相似度!”因为它发现两者都出现了“丧尸”这个词。但人类知道它们是完全不同的故事。一个是关于复仇和社会地位提升的故事;另一个则是关于生存恐怖灾难的故事。

作者们面临的挑战(SemEval-2026 Task 4)是构建一个能够忽略“丧尸”这个关键词,转而观察因果链条的计算机:谁做了什么,以及为什么这么做?

解决方案:“骨架与皮肤”法

来自 HSE 大学(高等经济学院)的团队开发了一个名为 IVD-SSM 的系统。你可以将这个系统想象成一个侦探,它将故事分为两个层面:

  1. 骨架(不变性/Invariant): 核心结构。事件的序列(例如:“被排挤者” \rightarrow “采取极端行动” \rightarrow “地位发生变化”)。即使名字变了,这个结构也永远不会改变。
  2. 皮肤(变体/Variant): 表层的细节。名字、具体的物体、环境和类型化元素(如“丧尸”、“宇宙飞船”或“城堡”)。

他们的目标是让计算机完全专注于骨架,并忽略皮肤

它是如何工作的:“大局观”与“显微镜”

该系统使用了一种特殊的 AI 引擎(基于名为 Jamba 的模型),这种引擎擅长阅读长文本,且不会感到疲劳或忘记开头。但真正的魔力在于他们发明的一个新部分,叫做结构化门控对齐(SGA)头

想象一下,SGA 头拥有两对协同工作的眼睛:

  1. “宏观”眼(广角镜头):

    • 这只眼睛从远处观察故事。它跳过细节,只看重大的里程碑:开端、冲突、高潮、结局。
    • 它创建了一张故事形状的粗略地图。它不在乎英雄的名字是“约翰”还是“简”,也不在乎武器是“枪”还是“激光”。它看到的仅仅是情节的形状
  2. “微观”眼(显微镜):

    • 这只眼睛会放大到每一个单词。它注意到两个故事都提到了“丧尸”。
    • 危险之处: 如果计算机只使用这只眼睛,它就会被“丧尸”这个词所迷惑,认为这两个故事很相似。
  3. “守门人”(门控机制):

    • 这是最重要的部分。宏观眼充当了保安守门人的角色。
    • 它先观察粗略的地图。如果宏观眼说:“嘿,这两个故事的形状完全不同,”它就会向微观眼关上大门。
    • 即便微观眼在大喊:“但它们都有丧尸啊!”,守门人也会说:“我不在乎。情节结构不匹配,所以忽略‘丧尸’这个词。”
    • 只有当大局结构确实一致时,守门人才会允许微观眼的细节通过。

他们的发现

团队将该系统与其他的标准 AI 模型,甚至是一个非常智能的预训练 AI(GPT-4o-mini)进行了对比测试。

  • 标准模型: 被“丧尸”等词汇误导,未能看出情节的区别。
  • 他们的系统 (IVD-SSM): 成功地忽略了干扰性的词汇,正确识别出“复仇”故事和“生存”故事是不同的,同时精准捕捉到了那个真正共享“被排挤者采取行动”结构的故事情节。
  • 结果: 他们的系统表现优于随机猜测,也优于简单的词汇匹配,证明了你确实可以教会计算机透过表面细节去寻找真正的故事结构。

局限性(不足之处)

作者坦诚地说明了该系统目前尚不完美的地方:

  • 门不是墙: 这个“门”是“软性”的。如果错误的故事包含了过多的特定匹配词(例如一个非常特定的名字或罕见的物体),这些“噪声”仍可能通过缝隙渗入,从而干扰系统。
  • 内存问题: 虽然主引擎效率很高,但最后一步——即对比每一个词与每一个词的过程(以检查细节)——仍然非常消耗计算机内存。它在处理短篇摘要时运行良好,但在处理长篇小说时可能会遇到困难。
  • 训练数据: 他们主要使用由其他计算机生成的故事情节来训练系统,因为人类编写的样本不足。这意味着该系统非常擅长识别标准的叙事模式,但可能会在面对非常怪异、实验性或非线性的人类故事时感到困惑。

总结

这篇论文提出了一种教计算机理解故事的新方法。与其仅仅计算两个故事共享多少单词,他们构建了一个首先检查情节骨架是否匹配的系统。只有在骨架匹配的情况下,才会允许细节影响最终的判断。这防止了计算机被像共享关键词这样的表面相似性所欺骗。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →