← 最新论文
💬 NLP

Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext

该论文通过引入四个新的评估套件,系统研究了大语言模型在交流中使用潜台词的能力,发现前沿模型普遍存在过度字面化的倾向,难以有效利用未明示的共同背景或处理复杂的隐喻理解,从而揭示了当前模型在社会化创意沟通方面的显著局限。

原作者: Kabir Ahuja, Yuxuan Li, Andrew Kyle Lampinen

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Kabir Ahuja, Yuxuan Li, Andrew Kyle Lampinen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的顶级人工智能(LLM)做一场"潜台词大考"。

想象一下,人类交流就像是在玩一场高难度的“心照不宣”游戏。我们说话时,往往不会把心里想的 100% 直接说出来,而是会留一点“弦外之音”(Subtext)。比如,当别人送你礼物时,你说“哎呀,你破费了”,字面意思像是在责怪对方乱花钱,但真正的潜台词是“太感谢你了,你真好”。

这篇论文的作者们(来自 Google DeepMind 等机构)想知道:现在的 AI 能听懂这种“弦外之音”,甚至能自己学会“话里有话”吗

为了测试这一点,他们设计了四个有趣的“考场”,就像给 AI 布置了四道不同的关卡:

1. 考场一:看图猜谜(Visual Allusions)

比喻:这就像玩桌游《Dixit》(只言片语)。

  • 玩法:AI 扮演“出题人”,手里有一张抽象的画。它需要给其他玩家(也是 AI)一个提示。
  • 目标:提示不能太直白(否则所有人都猜对了,出题人不得分),也不能太晦涩(否则没人猜对)。最好的状态是:只有一部分“懂行”的人猜对了,其他人猜错了
  • 结果:AI 们大多表现得像个“直肠子”。它们太喜欢把话说得太明白,比如看到一张画着很多头的龙,它就直接说“头太多了”,结果所有人都猜对了,它反而输了。即使给它们一些“共同背景知识”(比如大家都读过同一本故事书),它们也很难利用这些秘密来制造“只有我们俩懂”的默契。

2. 考场二:默契特工(Attuned)

比喻:这就像玩《Wavelength》(波长)游戏,或者两个人在猜一个“暗号”。

  • 玩法:两个 AI 是一伙的,对手是另一伙。出题的 AI 看到一个秘密数字(比如 75),它要给出一个提示,让队友猜中,但让对手猜偏。
  • 目标:利用“共同背景”(比如大家都读过某本书)来传递只有队友能懂的信息。
  • 结果:AI 们偶尔能成功,但大部分时候还是太“直球”。它们很难真正理解队友在想什么(也就是缺乏“心理理论”能力),总是猜错队友的脑回路。

3. 考场三:历史寓言(Historical Allegories)

比喻:这就像读《动物农场》。

  • 玩法:AI 要读一篇虚构的童话故事,然后猜它实际上是在影射哪个真实的历史事件(比如苏联大清洗)。
  • 变量:研究者给 AI 加了不同的“人设”和“背景信息”。比如,告诉 AI“这篇文章的作者是位著名的历史学家”或者“读者是一位文学评论家”。
  • 结果:这是一个有趣的发现!AI 的解读非常容易被“场外信息”带偏。如果告诉它作者是历史学家,它就能更准确地猜出历史隐喻;如果没给这个提示,它就猜不准。这说明 AI 的“阅读理解”很大程度上依赖于它被赋予了什么“人设”,而不是它真的懂了文字背后的深意。

4. 考场四:地下作家(The Aesopian Author)

比喻:这是最难的关卡,就像在审查制度下写小说

  • 玩法:AI 扮演一个“地下作家”,它想表达一个被禁止的话题(比如“民主”),但必须骗过“审查官”(另一个 AI),让审查官以为它在歌颂“君主”。同时,它还要让“文化评论家”(第三个 AI)看懂它真正的意图。
  • 目标:在“审查官”和“评论家”之间走钢丝,既要活下来(不被发现),又要传达真意。
  • 结果:AI 们几乎都失败了。它们要么太直白,被审查官一眼看穿;要么太隐晦,连评论家也看不懂。它们很难像人类作家那样,通过长期的铺垫和微妙的暗示来构建一套只有“自己人”能懂的密码系统。

总结:AI 现在的“潜台词”水平如何?

这篇论文告诉我们一个有点扎心的事实:
现在的顶级 AI,虽然很聪明,但在“说话的艺术”上,还是个“愣头青”

  • 太直白:它们倾向于把意思说得清清楚楚,生怕别人听不懂,完全不懂“留白”和“暗示”的美妙。
  • 缺乏默契:它们很难利用“共同背景”来建立只有特定人群才懂的默契。
  • 容易被带偏:它们的理解能力高度依赖于外部提示(比如作者是谁),而不是真正理解文本的深层逻辑。

这就好比
现在的 AI 就像一个刚学会说话的小学生,它知道怎么把字写对、把句子写通顺,但它还不懂什么是“言外之意”,不懂怎么在说话时“看人下菜碟”,更不懂怎么在复杂的社交场合里“话里有话”。

未来的方向
作者们希望这项研究能启发未来的 AI,让它们不仅能“说话”,还能学会“沟通”;不仅能“思考”,还能学会“共情”和“察言观色”,真正成为像人类一样有创造力、懂社交的沟通伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →