Evaluating Developmental Cognition Capabilities of LLMs
本文介绍了发展性句子补全测试(DSCT),用于评估大语言模型基于罗伯特·凯根理论检测发展性认知阶段的能力,研究发现,尽管模型能够准确识别模拟人格中的目标阶段,并在其自身输出中展现出一致的发展模式,但其与真实人类反应的一致性仍属中等,这凸显了具备阶段感知能力的人工智能所面临的主要挑战在于诱发文本中发展性信号的可用性,而不仅仅取决于分类器的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和创意类比对这篇论文的解释。
核心思想:我们如何“思考”思考?
想象你正在与一个非常聪明的机器人交谈。通常,我们试图让机器人理解你想要什么(你的目标)或你知道什么(你的事实)。但这篇论文提出了一个不同的问题:你实际上是如何理解世界的?
作者们利用罗伯特·凯根(Robert Kegan)的心理学理论来审视这一点。可以将凯根的理论想象成一座“意义构建”的梯子。
- 较低的梯级:你将世界视为一系列规则或他人对你的期望。(例如:“我这样做是因为老板这么说的。”)
- 较高的梯级:你建立自己的内在指南针,并能退后一步审视自己的信念。(例如:“我这样做是因为我分析了情况,并决定它符合我自己的价值观,即使我的老板不同意。”)
这篇论文试图弄清楚,人工智能是否仅通过阅读一个人的文字,就能检测出这个人正站在梯子的哪个“梯级”上。
问题:旧测试过于沉重
传统上,为了确定某人在这个梯子上的位置,心理学家必须进行漫长而深入的访谈(就像 90 分钟的心理治疗会话)。这就像试图通过把鲸鱼举起来称重一样;对于成千上万的人或测试人工智能而言,这种方法太沉重且太慢了。
也有较短的测试(句子补全),但它们往往很陈旧、是私有的(你需要购买),或者会询问关于性和家庭等非常私人的问题,让人感到具有侵入性。
解决方案:"DSCT"(一种新的、更轻便的测试)
作者们创建了一个新的、包含 20 个问题的测试,称为发展性句子补全测试(Developmental Sentence Completion Test, DSCT)。
- 类比:想象一个“填空”游戏。它不问“你最喜欢的颜色是什么?”,而是问诸如“当承诺被打破时,我感到……"或“当一个人不得不在两个好的选项之间做出选择时,他们……"之类的问题。
- 目标:答案的评分标准不是“对”或“错”。它们是根据思维的结构来评分的。答案听起来像是随波逐流的人,还是拥有自己内在体系的人?
三个实验:“味觉测试”
研究人员进行了三次不同的“味觉测试”,以查看人工智能是否能正确解读这些答案。
1. “机器人扮演人类”测试(模拟人格)
- 设置:他们要求一个超级聪明的人工智能假装成不同类型的人(从“规则遵循者”到“独立思考者”),并完成测试。
- 结果:人工智能分类器(即“评分者”)在这方面表现得惊人地好。当人工智能确切知道它应该扮演什么角色时,其他人工智能几乎可以完美地猜出“思维风格”。
- 隐喻:这就像演员完美地朗读剧本。其他演员(评分者)可以轻易地准确判断出正在扮演哪个角色。
2. “真实人类”测试
- 设置:他们让 83 名真实人类参加测试。然后,他们让人类专家和艺术智能对答案进行评分。
- 结果:这比较混乱。人工智能和人类专家在确切的“梯级”上大约有一半的时间达成一致,但在大致范围(例如,两者都说“在梯级 3 和 4 之间”)上达成一致的情况要多得多。
- 隐喻:真实人类是混乱的。有时他们写简短的答案,有时写长篇大论,有时甚至自相矛盾。这就像试图通过阅读某人赶时间时发的短信来猜测他们的心情;这比阅读剧本要难。人工智能比人类专家更保守(更吝啬),除非非常确定,否则很少给出“高梯级”的评分。
3. “人工智能与自己对话”测试(默认回应)
- 设置:他们要求人工智能模型在不假装成任何人的情况下参加测试。它们只是以“自己”的身份回答。
- 结果:更新的、更大的人工智能模型给出的答案听起来像是处于梯子的较高梯级,而较小的、较旧的模型则不然。
- 隐喻:想象让一个幼儿和一个大学生填写同样的“填空”测试。大学生的答案自然听起来更复杂、更具自我反思性。论文发现,随着人工智能模型变得更大、更新,它们的“默认声音”听起来更像是一个具有自我反思能力的成年人。
主要结论
- 人工智能擅长发现模式,但信号很重要:如果文本清晰且结构良好(如模拟测试),人工智能非常擅长判断“思维风格”。如果文本混乱(如真实人类的答案),这就更难了,但仍然有可能获得一个大致的概念。
- 人工智能并没有像人类那样“思考”:论文谨慎地指出,人工智能实际上并没有拥有发展阶段。只是人工智能生成的词语听起来像是来自特定的阶段。
- 人工智能的“声音”很重要:更大、更新的人工智能模型倾向于以一种听起来更“自我主导”(在梯子上位置更高)的方式说话。这可能意味着它们与较小模型相比,对人类用户的解读方式不同。
这对未来的意义(根据论文)
论文建议,为了让人工智能真正实现个性化,它不应仅仅学习你喜欢什么(例如,“我喜欢科幻电影”)。它应该尝试理解你如何思考(例如,“你是需要我给出规则,还是希望我挑战你的观点?”)。
然而,作者们警告说,我们不能仅凭随机聊天就猜测这一点。我们需要结构化的提问方式(如本测试)来获得可靠的解读。你不能仅通过瞥一眼快速短信就判断某人的“思维梯子”;你需要一场适当的对话来观察其结构。
简而言之:这篇论文构建了一个新的、更短的测试,用来衡量人们如何理解世界。他们发现,人工智能可以很好地阅读这个测试,尤其是当答案清晰时,但真实人类的答案是混乱的。此外,人工智能模型本身的写作风格也在“成长”,随着它们变得更大,听起来也更加复杂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。