Measuring Form and Function in Language Models
本文引入语境替代选择(CAC)指标,以定量评估语言模型在英语限定词的正式句法及功能话语属性方面的表现,结果表明:尽管某些超大规模模型在两项基准测试上均能匹配人类儿童的表现,但目前没有任何在可比数据上训练的模型能同时达成这一水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人像人类一样说话。你有两种方法来检查它是否奏效:
- 语法测试:它说的是“那只猫”而不是“猫那只”吗?(正确形式)
- 对话测试:它是否知道根据对方刚才说了什么,来决定何时说“那只猫”而不是“一只猫”?(正确功能)
本文旨在通过观察真实儿童如何学习说话,来构建一个更优的语言模型(LLM)测试方法。作者们(来自宾夕法尼亚大学的研究人员)认为,我们过去对人工智能的测试过于像语法测验,而不够像真实的对话。
以下是他们工作的简要拆解,使用了简单的类比:
1. 问题所在:“多项选择”陷阱
当今大多数人工智能测试都像是多项选择题。你向人工智能展示两个句子:
- “那只狗叫了。”
- “狗那只叫了。”
然后问:“哪一个是正确的?”
人工智能通常能答对。但作者指出,这就像通过让孩子指认一张狗的照片和一张猫的照片来测试他们一样。这并不能证明他们理解如何在真实的故事中使用这个词。真实的儿童不参加多项选择题考试;他们只是说话。要真正了解人工智能是否像人类一样“学习”,我们需要观察它如何处理真实对话中那种混乱的、来回往复的流动。
2. 新工具:“语境替代选择”(CAC)
作者发明了一种名为CAC的新方法来测试人工智能。这就像是一个“填空”游戏,但有个转折。
- 设置:他们选取了一段真实的录音,内容是母亲与两岁孩子的对话。
- 游戏:他们隐藏了孩子使用的那个词(通常是小词,如“那”或“一”),然后问人工智能:“根据妈妈刚才说的话,这里应该填哪个词?”
- 目标:他们不仅仅希望人工智能选出正确的词。他们想看看人工智能的选择模式是否与儿童的模式相匹配。
3. 两个基准(评分表)
作者创建了两个具体的评分表,以观察人工智能是否表现得像一个人类儿童。
评分表 A:“混合搭配”测试(形式生产力)
- 概念:聪明的孩子知道“那”和“一”几乎可以和任何名词搭配。他们不仅仅是在死记硬背“那只狗”和“一只猫”。他们掌握了规则。
- 测试:研究人员观察人工智能将“那”和“一”与多少种不同的名词搭配使用。如果人工智能只将“那”与它死记硬背的特定词汇搭配,它就失败了。如果它能自由地将它们与许多不同的词混合搭配,它就通过了。
- 结果:许多人工智能模型通过了这项测试。它们学会了“混合搭配”的规则。
评分表 B:“对话流”测试(话语功能)
- 概念:这是最难的部分。在真实的对话中,如果妈妈说:“看那只狗”,孩子通常会回答:"那只狗很大。”但如果妈妈说:“我看见一只狗”,孩子可能会说:"一只狗正在跑。”
- 有时你会保留相同的词(“那” -> “那”)。
- 有时你会切换(“一” -> “那”)。
- 这种切换完全取决于故事的情境。
- 测试:研究人员测量了人工智能切换词汇的频率,并与真实人类切换词汇的频率进行了比较。
- 结果:大多数人工智能在这里失败了。即使是那些庞大、聪明的模型,也倾向于像抛硬币一样随机切换词汇。它们似乎并不理解词汇背后的故事。它们懂语法,但不懂对话的社会规则。
4. 大惊喜
作者测试了 45 种不同的人工智能模型。
- “小”模型:那些在大约与两岁儿童相同的数据量(1000 万到 2000 万个词)上训练的模型,通常两项测试都未通过。它们学得还不够多。
- “大”模型:那些在数十亿个词(相当于整个互联网的大小)上训练的巨型模型表现要好得多。
- 两个模型通过了两项测试。它们在语法和对话流两方面听起来都像人类。
- 一个模型通过了对话测试,但未能通过语法测试。
- 许多其他模型通过了语法测试,但未能通过对话测试。
5. 核心启示
该论文的结论是:规模很重要,但它并非一切。
仅仅因为人工智能能答对语法测验,并不意味着它像人类一样理解语言。它可能只是在死记硬背模式。要真正成为人类学习的“认知模型”,人工智能需要通过“对话流”测试,表明它理解为什么我们会根据所讲述的故事来选择某些词汇。
目前,只有那些最大的模型开始展现出这种类人的理解力,但即使是它们,表现也参差不齐。作者建议,如果我们想构建更好的人工智能,就应该停止把它们当作参加考试的學生,而是开始把它们当作对话中的幼儿来对待。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。