← 最新论文
💻 computer science

Evaluating Large language models on Understanding Korean indirect Speech acts

本研究通过构建专门的数据集并采用自动化与人工评估相结合的方法,评估了各种大语言模型理解韩语间接言语行为的能力,结果表明,尽管像 Claude3-Opus 这样的闭源模型优于开源替代方案,但目前尚无模型能在解释依赖于语境的意图方面达到人类水平。

原作者: Youngeun Koo, Jiwoo Lee, Dojun Park, Seohyun Park, Sungeun Lee

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Youngeun Koo, Jiwoo Lee, Dojun Park, Seohyun Park, Sungeun Lee

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在和朋友聊天,他们说:“这里冷死了。”如果你正站在一台坏掉的空调旁边,他们可能只是在陈述一个事实。但如果你正坐在窗户紧闭、温暖的客厅里,他们很可能是在暗示:“请把窗户关上”或“把暖气调高点。”这种字面意思与实际含义之间的差距,正是人类对话的“秘密配方”。在科学领域,这被称为语用学(pragmatics):研究语境如何改变意义的学科。虽然计算机在翻译语言或解决数学问题方面已经变得极其出色,但它们往往在“读懂言外之意”这项技能上表现挣扎。它们可能会字面理解你的暗示,仅仅回答一句“是的,温度很低”,从而完全错失重点。这一点至关重要,因为随着我们开始依赖人工智能助手处理从安排会议到提供建议的一切事务,我们需要它们不仅理解我们的文字,更要理解我们的意图

这篇论文就像是一个侦探故事,研究人员对一系列人工智能(AI)模型进行了测试,看看它们是否能破解间接暗示的密码。科学家们将重点放在了韩语上——这是一种语境至上的语言——并基于一个关于人类如何使用语言的经典理论构建了一个特殊的测验。他们创建了240个场景,在这些场景中,同一句话根据情况的不同可以有两种截然不同的含义。例如,说“冰层很薄”可能是一个简单的客观事实,也可能是一个警告,提醒孩子们不要踩在结冰的池塘上。研究人员想要观察 AI 是否能够区分直接陈述与间接请求、承诺或情感表达。

结果既有“还不错”的部分,也有“仍有很长的路要走”的部分。研究人员测试了12种不同的 AI 模型,涵盖了从庞大且昂贵的系统到较小的开源系统。明显的赢家是一个名为 Claude3-Opus 的模型。它在多选题测试中得分约为 71.94%,在需要解释推理过程的开放式测试中得分约为 65%。虽然这令人印象深刻,但值得注意的是,即使是最好的 AI 模型也没有击败人类。研究中的人类参与者得分约为 77.64%,这证明了人类仍然是理解微妙社交线索的大师。

研究发现,大多数 AI 模型擅长字面理解,但在猜测隐藏含义方面表现糟糕。如果一句话是直接请求,AI 大多能答对。但当请求是间接的时候——比如通过说“外面天气真好”来暗示出去散步,而不是仅仅讨论天气——大多数模型都会出错。它们往往会卡在词语的字面意思上。有趣的是,AI 模型在理解间接赞美或成语(比如因为某人做了一顿美餐而称其为“大厨”)方面表现得相当不错,但在处理间接请求时表现最差。

研究人员还注意到了一些 AI 行为中的有趣怪癖。一些较小的模型在被要求用韩语回答时,竟然意外地用英语回答,仿佛对自己在和谁说话感到困惑。另一些模型则试图在要求进行自由格式解释时强行给出多选题答案,仿佛在应付某种它们以前见过的考试。论文指出,尽管这些 AI 模型功能强大,但它们仍然缺乏人类即便是在青少年阶段也具备的那种深层的、直觉性的语境理解力。它们就像是背熟了字典但尚未学会如何进行真实对话的学生。研究结论认为,要让 AI 真正变得有用,我们需要教会它们看透文字的表面,去理解那个充满人类意图的、复杂且充满语境的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →