✨ 要点🔬 技术摘要
想象一下你正在和朋友聊天,他们说:“这里冷死了。”如果你正站在一台坏掉的空调旁边,他们可能只是在陈述一个事实。但如果你正坐在窗户紧闭、温暖的客厅里,他们很可能是在暗示:“请把窗户关上”或“把暖气调高点。”这种字面意思与实际含义之间的差距,正是人类对话的“秘密配方”。在科学领域,这被称为语用学(pragmatics) :研究语境如何改变意义的学科。虽然计算机在翻译语言或解决数学问题方面已经变得极其出色,但它们往往在“读懂言外之意”这项技能上表现挣扎。它们可能会字面理解你的暗示,仅仅回答一句“是的,温度很低”,从而完全错失重点。这一点至关重要,因为随着我们开始依赖人工智能助手处理从安排会议到提供建议的一切事务,我们需要它们不仅理解我们的文字,更要理解我们的意图 。
这篇论文就像是一个侦探故事,研究人员对一系列人工智能(AI)模型进行了测试,看看它们是否能破解间接暗示的密码。科学家们将重点放在了韩语 上——这是一种语境至上的语言——并基于一个关于人类如何使用语言的经典理论构建了一个特殊的测验。他们创建了240个场景,在这些场景中,同一句话根据情况的不同可以有两种截然不同的含义。例如,说“冰层很薄”可能是一个简单的客观事实,也可能是一个警告,提醒孩子们不要踩在结冰的池塘上。研究人员想要观察 AI 是否能够区分直接陈述与间接请求、承诺或情感表达。
结果既有“还不错”的部分,也有“仍有很长的路要走”的部分。研究人员测试了12种不同的 AI 模型,涵盖了从庞大且昂贵的系统到较小的开源系统。明显的赢家是一个名为 Claude3-Opus 的模型。它在多选题测试中得分约为 71.94% ,在需要解释推理过程的开放式测试中得分约为 65% 。虽然这令人印象深刻,但值得注意的是,即使是最好的 AI 模型也没有击败人类。研究中的人类参与者得分约为 77.64% ,这证明了人类仍然是理解微妙社交线索的大师。
研究发现,大多数 AI 模型擅长字面理解,但在猜测隐藏含义方面表现糟糕。如果一句话是直接请求,AI 大多能答对。但当请求是间接的时候——比如通过说“外面天气真好”来暗示出去散步,而不是仅仅讨论天气——大多数模型都会出错。它们往往会卡在词语的字面意思上。有趣的是,AI 模型在理解间接赞美或成语(比如因为某人做了一顿美餐而称其为“大厨”)方面表现得相当不错,但在处理间接请求时表现最差。
研究人员还注意到了一些 AI 行为中的有趣怪癖。一些较小的模型在被要求用韩语回答时,竟然意外地用英语回答,仿佛对自己在和谁说话感到困惑。另一些模型则试图在要求进行自由格式解释时强行给出多选题答案,仿佛在应付某种它们以前见过的考试。论文指出,尽管这些 AI 模型功能强大,但它们仍然缺乏人类即便是在青少年阶段也具备的那种深层的、直觉性的语境理解力。它们就像是背熟了字典但尚未学会如何进行真实对话的学生。研究结论认为,要让 AI 真正变得有用,我们需要教会它们看透文字的表面,去理解那个充满人类意图的、复杂且充满语境的世界。
技术摘要:评估大语言模型对韩语间接言语行为的理解能力
问题陈述
尽管大语言模型(LLMs)在传统的自然语言处理(NLP)任务(如分类、翻译和逻辑推理)中表现出了卓越的能力,但它们在对话语境中理解人类意图的能力仍有待评估。目前的基准测试主要侧重于知识处理和显性的字面含义,往往忽略了语用学(Pragmatics) ——即研究特定语境下的语言使用。
在评估 LLM 是否能理解间接言语行为(Indirect Speech Acts)方面存在关键空白。在间接言语行为中,说话者的实际意图与话语的字面意思并不一致。这在 韩语 中尤其具有挑战性,因为韩语是一种高语境语言,共享的背景信息和情境线索对于有效沟通至关重要。现有的评估很少涉及根据对话语境区分直接意图与间接意图的细微差别,而这种能力对于作为日常生活中个人智能体的 LLM 至关重要。
研究方法
数据集构建
作者基于塞尔的言语行为理论(Searle's Speech Act Theory) ,构建了一个由 240 个韩语条目 组成的专门评估数据集。该数据集将言语行为分为五种类型(阐述类、指令类、承诺类、表达类、宣告类),并重点关注三种特定的间接言语行为 类型,即陈述句(阐述类)执行不同的言语行为动作:
ReDi (阐述 → \to → 指令): 用于建议或请求行动的事实性陈述(例如,“外面天气很好”暗示“我们出去走走”)。
ReCo (阐述 → \to → 承诺): 用于做出承诺或保证的事实性陈述。
ReEx (阐述 → \to → 表达): 用于表达情感或赞美的 사실性陈述。
为了测试语境依赖性,数据集将每种类型的 80 个条目配对为 40 对 。在每一对中,同一个话语出现在两种不同的场景中:一种场景下它作为直接言语行为 发挥作用,另一种场景下它作为间接言语行为 发挥作用。
评估模型
本研究评估了 12 个 LLM ,分为两类:
闭源模型 (8个): GPT-3.5, GPT-4, Claude3-Haiku, Claude3-Sonnet, Claude3-Opus, Mistral-small, Mistral-medium, 以及 Mistral-large。
开源模型 (4个): Llama3-8B, Qwen1.5-14B, Solar-10.7B, 以及 T3Q-ko-solar(Solar 的韩语微调版本)。
实验设置
采用了两种实验设置来评估性能:
多选题 (MCQ): 向模型提供语境和话语,并要求其从四个选项中选择正确的言语行为意图(一个正确选项,一个“相反”类型,以及两个随机类型)。性能通过每个条目进行三次试验的**一致率(准确率)**来衡量。
开放式问题 (OEQ): 要求模型描述话语的意图。响应由人类评估员根据推断意图和字面含义的准确性进行 1–5 分的定性评分,然后重新缩放至 0–100 分。
人类基准
为了建立黄金标准(Gold Standard) ,52 名人类参与者(年龄 20–30 岁,具有多样化的学术背景,排除语言学专业)完成了相同的 MCQ 测试。这些数据作为衡量 LLM 与人类语用能力差距的基准。
核心贡献
开发言语行为理解测试集: 一个专门的、公开可用的数据集,旨在评估 LLM 在韩语语境框架下解释三种类别间接言语行为的能力。
收集人类参考数据: 建立了人类表现基准(黄金标准),以量化当前 LLM 与人类水平语用理解之间的差距。
系统性评估与分析: 使用 MCQ 和 OEQ 形式对 12 个 LLM 进行了全面评估,包括对不同言语行为类型(ReDi, ReCo, ReEx)性能的详细分析,以及与对话含义理解的比较。
结果
整体性能
人类优越性: 人类参与者的平均 MCQ 得分为 77.64 ,显著高于所有评估的 LLM。
模型排名: Claude3-Opus 以 71.94 的 MCQ 得分和 90.37 的 OEQ 得分脱颖而出,成为表现最好的模型。它是唯一一个在直接和间接言语行为上表现出平衡准确性的模型,得分差距仅为 5.55%(直接为 69.17,间接为 74.72)。
闭源 vs. 开源: 闭源模型通常优于开源模型。在开源模型中,Solar-10.7B 表现最好(MCQ 为 65.0),而 T3Q-ko-solar (微调版)在基于语境的推理中实际上比基础版 Solar 出现了性能下降。
直接 vs. 间接差距: 大多数 LLM(除 Claude3-Opus 外)在间接言语行为上的表现明显低于直接言语行为。例如,GPT-3.5 在直接行为上的得分为 63.61,但在间接行为上仅为 36.67。
按言语行为类型分析
ReEx (表达类): 人类和 LLM 在此类上的得分最高,这可能是由于数据集中普遍存在的惯用表达方式已被模型很好地学习。
ReDi (指令类): 这是所有模型面临的最具挑战性的类别。陈述事实的声明句(例如,“已售罄”)经常被误解为信息提供,而非间接的请求或建议。
ReCo (承诺类): 表现处于中间水平,介于 ReDi 和 ReEx 之间。
定性发现 (OEQ)
Claude3-Opus 展示了复杂的推理能力,经常提供详细的解释和列表格式来证明其解读的合理性。
Llama3 表现出明显的失调,尽管使用了韩语提示词,却频繁生成英语 响应,并产生无法阅读的 Token。
Solar 显示出对 MCQ 基准的过拟合 迹象,即使在开放式任务中也会生成自己的多选题选项(A, B, C),这种行为在人类解决问题时并不典型。
与含义(Implicature)的相关性
研究发现,言语行为理解与对话含义理解之间存在中度相关性(0.67)。然而,针对间接言语行为 ,这种相关性更高(0.73),这表明解释间接意图和对话含义的机制是紧密相关的,特别是关于格莱斯(Gricean)的关系准则。
意义与主张
作者声称,这项研究提供了对 LLM 进行必要的语用评估 ,超越了基于知识的基准测试,转而评估“最高层级的语言能力”:语用能力。
当前局限性: 研究得出结论,虽然 LLM 正在进步,但目前没有任何模型在理解间接言语行为方面达到人类水平 。大多数模型难以区分字面意思与隐含意图,特别是当话语是用于提出请求的事实性陈述时。
语境敏感性: 结果强调,在大型数据集上训练的模型擅长字面意思,但在字面意思虽足够充分但语境不匹配时,往往无法推断深层意图。
未来方向: 作者强调需要进一步的研究来提高 LLM 对间接言语行为的理解,以实现更自然的人机交互。他们提出了涉及模拟多轮对话 以及将这些数据集扩展到其他语言(英语、中文、德语)的工作,以验证跨语言语境的鲁棒性。
本文将其定位为弥合统计语言建模与真正语用理解之间鸿沟的基础性步骤,认为对言语行为进行严格评估对于下一代对话式 AI 至关重要。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。