On Benchmarking Human-Like Intelligence in Machines
本文认为,由于标签未经验证以及任务缺乏生态效度等问题,当前的人工智能评估范式无法准确评估类人认知能力,并基于对九个现有基准测试的人类评估研究,提出了五项旨在实现更严谨基准测试的具体建议。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何成为一个人。你不仅仅希望它在数学方面超级聪明,或者能够预测天气;你希望它能像“你”一样去思考、感受和反应。这就是“类人智能”的世界。几十年来,科学家们一直在构建这些数字大脑,希望创造出不仅能解决问题,而且能理解人类处理世界时那种混乱、困惑且有时自相矛盾的方式的机器。但棘手之处在于:你如何知道机器人是真的在像人一样行动,还是仅仅是一个演技精湛的演员在假装?为了找出答案,研究人员通常会给机器人一个测试。但如果测试本身就是破碎的呢?如果测试期望机器人给出一个单一、完美的答案,而现实中的人类实际上会给出十几种不同的、略带不确定的答案呢?这篇论文深入探讨了这一问题,认为我们目前的 AI 测试方式就像是在要求一名乐手通过演奏一个单一、完美的音符来评判一场爵士即兴演奏。
本文的作者是一支来自顶尖大学的研究团队,他们认为我们目前无法正确衡量“类人”智能。他们指出,许多流行的 AI 测试过于简单,并且依赖于并不真正符合人类思维方式的“地面真值”(ground truth)标签。为了证明他们的观点,他们进行了一项大规模实验,邀请了 117 名真实人类参加九种不同的 AI 测试。这些测试涵盖了诸如识别讽刺、判断一个笑话是否有趣,或判断一个社交情境是否具有支持性等内容。人类并没有仅仅选择“A、B 或 C”,而是使用滑块来展示他们对某个答案的感受强度以及他们对这种感受的信心程度。
结果令人大开眼界。论文表明,对于许多此类测试,AI 训练所依据的“正确”答案与大多数人的想法实际上是相悖的。例如,在一个关于“社会支持”的任务中,测试认为某个特定的句子是“不支持”的,但人类平均评价其为具有中度的支持性。更有趣的是,人类不仅对测试结果持有异议,而且是以一种结构化的方式产生分歧。有些人对自己的答案非常确定,而另一些人则并不确定,他们的观点在广泛的光谱中各不相同。论文发现,目前的 AI 基准测试往往忽略了这种“混乱性”。它们将人类的判断视为一个只有一个正确答案的数学问题,而实际上,这更像是一场对话,每个人都有着略微不同的视角。
作者提出了构建更好测试的五条新规则。首先,我们不能再靠猜测人类的想法,而应该真正去询问他们,收集来自人类的真实数据作为“金标准”。第二,我们不应寻找唯一的正确答案,而应该将 AI 与人类答案的整个“分布”进行比较——观察 AI 是否能捕捉到“有些人这样想,而另一些人那样想”这一事实。第三,我们需要衡量“等级性”(gradedness)。人类很少感到 100% 确定或 0% 确定;他们感到的是“基本是”、“有一点点不是”。论文建议我们应该使用滑块和信心评分来捕捉这种细微差别,而不是强迫进行简单的“是/否”选择。第四,测试需要基于深层的心理学理论,而不仅仅是随机的问题。仅仅因为一个孩子通过了“错误信念”测试,并不意味着通过了同样测试的机器人就拥有真正的“心理理论”;测试必须旨在真正测量该技能的复杂部分。最后,任务本身需要更贴近现实生活。现实生活是模棱两可、充满困惑且富有语境的。如果一个测试过于干净利落且过于简单,它就无法告诉我们 AI 是否能够应对现实世界。
简而言之,这篇论文建议,要构建真正像我们一样思考的 AI,我们必须停止将人类智能视为一场多选题考试。我们需要拥抱不确定性、分歧以及灰色地带。通过设计反映人类思想丰富、多样且有时令人困惑之本质的测试,我们才能最终开始构建那些不仅看起来聪明,而且真正感觉像人的机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。