← 最新论文
💬 NLP

ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation

该论文介绍了 ADAGE,这是一个语言无关的流水线,用于创建阿拉伯语、阿姆哈拉语和日语中无需翻译的类比推理基准测试,揭示了显著的性能差距,即精通英语的模型在这些母语中进行具有文化根基的推理时表现挣扎。

原作者: Ahmed Haj Ahmed, Alvin Grissom II

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Haj Ahmed, Alvin Grissom II

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教会一个机器人如何理解人类的笑话。你可能会认为最好的方法是拿一本用英语写的著名笑话集,将其翻译成西班牙语、日语或阿拉伯语,然后让机器人去解释它们。但问题在于:笑话往往依赖于它诞生时所处的特定文化。如果你把一个关于特定美国节日的笑话翻译成一个不存在该节日的语言,这个笑话就会失去它的魔力。机器人可能会因为听起来很有趣而猜出答案,而不是因为它真正理解了其中的含义。这就是科学家在测试“多语言”人工智能时面临的问题。他们通常只是将英语测试翻译成其他语言,这创造了一种 AI 在这些语言中很聪明的虚假幻象。

要真正测试 AI 是否能像人类一样思考,我们需要观察它是否能理解深层的、不言而喻的文化规则——比如知道“不要在雏鸡孵化前数蛋”(don't count your chickens before they hatch)意味着在事情真正发生之前不应过于自信。这种思维方式被称为类比推理(analogical reasoning)。它是指将一个旧的概念应用到全新的情境中的能力。如果一个 AI 只能在英语中做到这一点,但在面对不同文化下的相同逻辑时却失败了,那么它并没有真正学会思考,它只是记住了英语的模式。这篇论文提出了一个简单但令人恐惧的问题:我们的 AI 模型在其他语言中是真的聪明,还是仅仅非常擅长翻译?

研究人员推出了一种名为 ADAGE(用于评估具身评估的类比难度设计,Analogical Difficulty-by-design Assessment for Grounded Evaluation)的新工具。把 ADAGE 想象成一位顶级大厨,他不仅仅是翻译法国食谱;相反,他会走进阿拉伯语、阿姆哈拉语和日语的当地市场,寻找最新鲜、最地道的当地食材(谚语),并烹饪出全新的菜肴(情景),以此来测试 AI 是否能品尝出其中的差异。

以下是他们如何“烹饪”这场实验的:

  1. 食材: 他们从阿拉伯语、阿姆哈拉语和日语的母语使用者那里收集了数千条谚语(简短而充满智慧的说法,如“不知隼之贵,必将其烹之”)。
  2. 食谱: 他们没有仅仅要求 AI 解释谚语,而是使用了一个巧妙的技巧。他们按谚语的“风味”或主题(如“耐心”或“谨慎”)进行分组,然后要求 AI 为每条谚语写一个现代故事。
  3. 陷阱: 为了增加测试难度,他们创建了一个多项选择题。他们给出一个故事和四条谚语供 AI 选择。其中一条是完美的匹配项。另外三条是“干扰项”:
    • 一个属于同一个主题组(一个听起来很对但并不完全正确的“诱导项”);
    • 一个是不同的主题但听起来很相似(一个“近失项”);
    • 一个是完全随机的(一个“容易”的错误答案)。
  4. 品尝测试: 他们将这些测试输入到 14 个不同的 AI 模型中(从微型模型到巨型模型),并观察它们的表现。

他们的发现

结果令人震惊,就像发现一个在英语考试中拿了高分的学生在不同语言的数学考试中不及格一样。

  • “翻译陷阱”是真实存在的: 当 AI 模型接受英语谚语测试时,表现得非常好,得分在 80% 或更高。但当研究人员用原生的阿拉伯语、阿姆哈拉语和日语基准测试它们时,分数骤降。表现最好的模型下降了 12 到 52 个百分点。例如,一个在英语中能拿到 83% 正确率的模型,在阿拉伯语中可能只能拿到 70%,而在阿姆哈拉语中仅为 41%。
  • “低资源”的现实: 阿姆哈拉语测试是最难的。即使是规模最大、最聪明的模型,其得分也仅仅比随机猜测(四选一问题中为 25%)好一点点。AI 模型似乎卡在了语言本身,无法理解词汇,更不用说深层含义了。
  • 规模并非一切: 研究人员原本预期更大的模型(拥有更多“脑力”)会表现得更好。虽然更大的模型在阿拉伯语和日语方面有所进步,但提升幅度很小。在阿姆哈拉语上,扩大模型规模完全没有帮助。这表明,如果 AI 没有一个深厚的文化基础作为支撑,仅仅增加数据或规模并不能解决问题。
  • “干扰项策略”奏效了: 这种巧妙的“干扰项”策略非常有效。AI 模型在“近失项”(那些听起来相似但错误的选项)上犯错最多,这证明它们确实在尝试进行推理,而不是在随机猜测。

核心启示

论文得出结论,目前我们测试 AI 的方式——即简单地将英语测试翻译成其他语言——是在欺骗我们。它让 AI 在其他语言中看起来比实际情况更聪明。AI 模型擅长处理英语文化推理,但在应用同样的逻辑到阿拉伯语、阿姆哈拉语和日语这些丰富且复杂的文化时却显得力不从心。

作者指出,在建立起针对每种文化的原生测试(使用当地的谚语和故事)之前,我们无法知道我们的 AI 是真正的多语言人才,还是仅仅是一个非常优秀的翻译员。他们发布了他们的全新“厨房”(ADAGE 流水线)和“食谱”(基准测试),以便其他科学家可以为世界上任何语言烹饪出自己的测试,从而确保未来的 AI 能够真正理解我们,无论我们来自何处。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →