← 最新论文
💬 NLP

Wontopos Tablet 2: Measuring Multilingual and Multimodal Memory Retrieval Without Lexical Matching

本文介绍了 Wontopos Tablet 2,一种无词汇的、多模态的长时记忆引擎,该引擎在文本和无标题图像上的跨语言检索性能方面取得了极高的表现,同时批判性地证明了标准评估指标具有高度不稳定性,且当前的稠密检索基准模型无法实现跨语言泛化。

原作者: Sunwoo Kim

发布于 2026-08-26✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Sunwoo Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座永不闭馆的图书馆,其中一本书记录了一个人曾有过的一切对话、拍过的每一张照片以及学过的每一个事实。对于一个能像人类一样说话和思考的计算机程序来说,这座图书馆就是它的记忆。但如果不能瞬间找到正确的页面,图书馆就毫无用处。如果你问:“我上周二早餐吃了什么?”系统必须在数百万个时刻中定位到那个特定的瞬间,而不至于迷失方向。多年来,在图书馆中寻找事物的标准方法是寻找匹配的词汇。如果你询问关于“苹果”的事,系统只会找到包含“苹果”这个词的页面。当问题和答案处于同一种语言时,这种方法运作良好;但如果你的问题是用英语提问,而答案是用斯瓦希里语书写的,或者答案是一张没有任何文字的照片,这种方法就会彻底失效。如何构建一个能够直接理解世界,而不依赖于匹配词汇的记忆系统,这一问题在现实世界中很大程度上仍未得到充分测试。

来自 Wontopos 的一位研究人员现在通过一个名为 tablet-2 的新记忆引擎测试了这个想法。他们构建了一个旨在检索信息而无需寻找匹配单词或关键词的系统。该系统不是扫描文本,而是学习直接理解问题的含义和记忆的内容。为了验证这种方法是否真的有效,他们进行了三项截然不同的实验。首先,他们在关于长篇对话的两个大规模问题集上测试了该系统,测量了它找到正确答案的频率。其次,他们测试了在给定文本描述的情况下寻找特定照片的能力,即使该照片没有任何标题、说明或任何辅助文字。最后,他们测试了该系统在多种语言(包括在技术领域较少使用的语言)中的表现。

结果表明,该系统确实可以在不匹配单词的情况下找到信息,但通往完美记忆的道路比仅仅移除单词匹配工具要复杂得多。在一项涉及 500 个关于长篇对话问题的标准测试中,该系统在 95.7% 的情况下找到了正确答案。在另一项涉及来自 35 段不同对话的超过两百万个记忆的更难测试中,它找到正确答案的概率为 67.5%。这些数字很高,但研究人员发现,得分在很大程度上取决于系统被要求如何工作。如果允许系统在不确定时再次搜索,得分会显著提高;如果被迫在尝试一次后就放弃,得分则会下降。这意味着系统的性能不仅取决于记忆本身的好坏,还取决于用户如何与其交互。研究人员发现,改变重试设置可以使得分移动近九个点,这个差距甚至大于他们的系统与其他已发表系统之间的差距。这表明,除非每个人都使用完全相同的提问规则,否则很难对不同的记忆系统进行比较。

这项研究中最引人注目的部分涉及照片。研究人员存储了 300 张没有任何附加文本的真实世界照片。然后,他们根据用十四种不同语言编写的描述来寻找一张特定的照片。由于照片上没有任何文字,传统的寻找匹配单词的系统成功的概率将为零。然而,新系统平均在 91.4% 的情况下找到了正确的照片。这证明了该系统可以在不需要共享词汇的情况下,将文本描述与视觉图像联系起来。然而,系统并非完美。当照片附带英文标题存储时,系统在处理其他语言说话的人时表现反而变差了。英文标题挤占了其他语言的空间,将正确答案推到了列表的后方。这是一个现实世界中的问题,因为客户的库中通常包含混合了有标题和无标题的项目,而系统在平衡它们方面表现挣扎。

研究还揭示了该系统最挣扎的地方。虽然它对于英语、德语和俄语等常用语言表现良好,但对于数字资源较少的语言(如斯瓦希里语和泰卢固语),其准确性显著下降。对于这些语言,系统找到正确照片的概率仅为一半左右。研究人员将其与目前向公众开放的其他系统进行了比较,那些系统表现得更差,对于同样的语言,找到正确图像的概率不到 10%。这表明困难不仅在于他们特定的系统,而是在于教导计算机理解低资源语言这一更广泛的挑战。研究人员还追踪到了自己系统中一个特定的失败原因:针对某一类查询缺失了一个设置。一旦修复了这个问题,该系统在该语言下的表现便大幅提升,这表明某些弱点在于设计,而非这项技术本身的基本能力。

最终,这篇论文证明了记忆系统可以在不依赖于逐字匹配的情况下工作,成功地跨语言甚至从没有任何文本的图像中检索信息。它表明,尽管这项技术足以处理数百万个记忆和数十种语言,但它仍然对配置方式以及它所服务的语言非常敏感。该系统并不是一个解决所有问题的魔盒;它是一个只有在其局限性被理解时才能发挥最佳作用的工具。研究人员发现,系统检索信息的能力与其训练数据的质量以及搜索过程中使用的特定设置密切相关。通过仔细衡量这些因素,他们清晰地描绘了一个现代记忆系统能做什么,以及更重要的是,它在哪里仍需改进。这项工作证实,超越简单的单词匹配是可能的,但这需要精细的平衡设计选择,以确保系统无论人们使用何种语言或何种形式的记忆,都能公平地服务每一个人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →