How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework
本文引入了一种基于最大均值差异和比伯词汇语法特征的注册感知评估框架,以证明尽管大语言模型持续偏离人类语言模式,但其拟人化程度因交际语域而异,且并非由模型规模决定。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人写故事、发短信或撰写新闻报道。你可能会问:“机器人写的内容是真的吗?”或者“它完成任务了吗?”但本文提出了一个不同且更微妙的问题:“机器人写的内容是否感觉像是由人类写的?”
作者认为,仅仅因为机器人的文本在事实上是正确的,并不意味着它听起来自然。对人类而言,语言会随着情境的变化而变化。给朋友发的短信与科学论文或新闻文章听起来截然不同。作者将这些不同的情境称为“语域”。
以下是他们研究的简要概述:
1. 问题:机器人的“恐怖谷”
将语言想象成一场化装舞会。
- 人类擅长变换装束。如果你走进图书馆,你会低声细语并使用正式词汇;如果你走进酒吧,你会大声喧哗并使用俚语。你本能地知道哪种“装束”(语域)适合当下的场合。
- 大型语言模型(LLMs) 则像是一些非常擅长背诵台词但有时会忘记换装的演员。他们可能会写出一篇听起来像随意聊天的新闻报道,或者一篇听起来像教科书的小说。即使事实正确,那种“氛围”也不对劲,让人类读者感到不自然。
2. 解决方案:一种“风格检测器”
研究人员建立了一种测试这些机器人的新方法。与其让人类阅读并猜测文本是否为真(这既缓慢又主观),他们创建了一种数学上的“风格检测器”。
- 67 个特征:他们使用了一种经典的语言学工具(来自一位名为 Biber 的研究者),将语言分解为 67 种具体的“成分”。这些不仅仅是单词,而是诸如“人们使用过去时的频率如何?”“他们使用短词还是长词?”“他们是否使用被动语态?”等模式。
- 人类基准:他们收集了大量真实的人类写作样本,涵盖五种不同的“房间”(语域):
- 随意聊天:人们之间的真实对话。
- 学术论文:计算机科学研究的引言。
- 操作指南:分步说明(如 WikiHow)。
- 创意故事:用户创作的虚构作品。
- 新闻报道:BBC 新闻文章。
- 测试:他们要求七个不同的人工智能模型用这五种风格进行写作。然后,他们使用一种数学公式(称为MMD)来衡量人工智能写作风格与人类写作风格之间的“距离”。
类比:想象你有一罐真实的蓝莓(人类写作)和一罐人造蓝莓糖果(人工智能写作)。研究人员不仅品尝它们,还测量确切的蓝色色调、质地和含糖量。他们计算出糖果与真实水果的确切距离。如果距离很大,糖果尝起来就是假的。
3. 他们的发现
结果清晰且令人惊讶:
- 没有完美的机器人:在每一次测试中,人工智能的写作在统计上都与人类实际的写作方式“相距甚远”。没有任何一个机器人能完美模仿人类的风格。
- 规模并非关键:你可能会认为更大、更强大的机器人听起来更像人类。但研究发现,更大的模型不一定更好。根据主题的不同,较小的模型(Qwen 8B)有时比巨大的模型(Llama 70B)听起来更像人类。
- 语境为王:一个机器人可能擅长写新闻报道,却不擅长写随意聊天。你不能用一个单一的分数来评判机器人的“类人程度”;你必须在每个具体情境中测试它。
- “家族”特征:来自同一“家族”的机器人(如 Llama 家族或 Gemma 家族)往往彼此听起来相似,无论其规模大小。它们似乎拥有一种固定的共同“口音”或“个性”。
4. 为什么这很重要(根据论文观点)
论文得出结论,我们需要停止仅仅将人工智能视为“任务完成者”,而开始将其视为“风格匹配者”。
如果人工智能要在现实世界中使用(例如在聊天机器人或内容创作中),它必须适应其所处的特定“房间”。作者建议,未来我们可以利用这种“距离”测量来训练机器人听起来更自然,本质上就是教它们为正确的舞会穿上正确的装束。
简而言之:这篇论文证明,虽然人工智能正变得越来越聪明,但它仍未掌握在所有情境下听起来像人类的艺术。它就像一个学识渊博的学生,知道事实,但在试图与朋友聊天时,听起来仍然有些生硬和不自然。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。