← 最新论文
🤖 AI

Position: Text Embeddings Should Capture Implicit Semantics, Not Just Surface Meaning

本立场论文主张,文本嵌入研究必须将焦点从表层语义转向捕捉隐含意义(如语用和说话者意图),方法是采用基于语言学的数据、更深入的评估基准以及更能反映现实世界语言复杂性的核心建模目标。

原作者: Yiqun Sun, Qiang Huang, Anthony K. H. Tung, Jun Yu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiqun Sun, Qiang Huang, Anthony K. H. Tung, Jun Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心理念:“字面主义者”问题

想象一下,你正在聘请一位翻译来帮助你理解一种外国文化。你给他们一本字典和一个单词列表。他们变得极其擅长将单词与单词进行匹配。如果你说“下雨了”,他们就知道哪个外语单词确切地表示“雨”。

然而,如果你看着一个被水淹没的地下室说“这真是太棒了”,这位翻译可能仍然只会将其翻译为“这是一个积极的情况”。他们错过了讽刺。他们错过了言外之意。他们错过了意图

这篇论文认为,现代人工智能文本嵌入(计算机用于理解语言的数学“字典”)正像这些字面主义的翻译一样运作。它们在匹配表面含义(看起来相似的单词)方面表现出色,但在理解隐含意义(实际所指、暗示或感受到的内容)方面却表现糟糕。

意义的三个层次

作者将人类语言分解为三个层次,就像洋葱一样:

  1. 最外层(话语层面): 这是字面上的词语。

    • 例子: “我设法通过了考试。”
    • 表面含义: 你通过了。
    • 隐藏含义: 这出乎意料地难,而你原本没指望能通过。
    • AI 的问题: 当前的模型看到“通过”就止步于此。它们错过了那种惊讶感。
  2. 中间层(说话者层面): 这是说话者的态度或立场。

    • 例子: 使用像“哥们”这样的俚语,或特定的口音。
    • 隐藏含义: 这表明了说话者是谁,他们有多友好,或者他们是否试图融入某个特定群体。
    • AI 的问题: AI 看到了“哥们”这个词,但感受不到其背后的“酷劲”或“团结感”。
  3. 核心层(社会层面): 这是文化和政治背景。

    • 例子: 一条听起来中立的新闻标题,但却是为了让你对特定群体感到愤怒而撰写的。
    • 隐藏含义: 词语背后的偏见或意识形态。
    • AI 的问题: AI 阅读了事实,但错过了那种“氛围”或政治议程。

“测试分数”的错觉

该论文指出了我们目前评估这些 AI 模型时存在的一个主要缺陷。

想象一个学生参加数学考试。

  • 当前的测试(表面基准): 考试问:“2 加 2 等于几?”和“5 加 5 等于几?”学生得了 100%。我们说:“太棒了!这个学生是个数学天才!”
  • 现实世界(隐含语义): 在现实生活中,你问学生:“如果我给你两个苹果,你吃了一个,你还剩几个,你对分享有什么感觉?”学生僵住了。他们无法弄清楚分享的含义或吃的感受

作者进行了一项“试点研究”(小型实验),以观察 AI 模型在这些“现实世界”问题上的表现。

  • 结果: 即使是最聪明、最昂贵的 AI 模型(如来自 OpenAI 或大型科技公司的模型),其表现也仅仅略好于一个非常简单的计算机程序,后者只是统计单词(称为“词袋”模型)。
  • 令人震惊的是: 在需要识别讽刺、立场检测或理解隐藏偏见等任务上,先进的 AI 模型的表现 barely 优于随机猜测者或简单的单词计数器。

为什么会发生这种情况?

作者表示,问题出在训练饮食成绩单上。

  1. 饮食(训练数据): AI 模型被喂食了海量的文本,但它们被训练去寻找“相似”的句子。它们被教导说“猫坐在垫子上”与“一只猫科动物在毯子上休息”是相似的。它们没有被教导说“干得漂亮,把花瓶打碎了”(讽刺地说)与“干得漂亮,把花瓶打碎了”(真诚地说)是不同的。它们被喂食的是字面匹配的饮食,因此它们只学会了消化字面食物。
  2. 成绩单(基准测试): 我们用来对这些模型进行排名的测试(如 MTEB)主要问的是:“这两个句子是否关于同一个主题?”它们很少问:“这位说话者是否在讽刺?”或“这句话是否隐藏着政治偏见?”因为测试没有要求,AI 也就没有学会去做。

提出的解决方案

该论文呼吁进行“范式转变”(彻底改变方向)。

  • 改变食物: 我们需要用专门突出讽刺、隐藏意图和社会背景的数据来训练模型。我们需要教导它们,词语的意思可能与字面意思相反。
  • 改变测试: 我们需要新的基准测试,专门测试 AI 是否能理解为什么某事被说出来,而不仅仅是说了什么
  • 将其作为目标: 我们不仅要试图让 AI 更快或更擅长匹配关键词,还需要将“理解隐藏意义”作为一个主要目标,就像我们对语法或拼写所做的那样。

总结

目前,我们的 AI 文本模型就像超级快速的字典,擅长匹配单词,但对人类细微差别一无所知。它们可以告诉你两个句子使用了相似的单词,但它们通常无法告诉你其中一个句子是玩笑、威胁还是微妙的政治攻击。作者认为,如果我们希望 AI 真正理解人类交流,我们就需要停止仅基于表面相似性来训练它们,并开始教导它们人类意图的隐藏层次。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →