← 最新论文
💬 NLP

Rethinking the Evaluating Framework for Natural Language Understanding in AI Systems: Language Acquisition as a Core for Future Metrics

本文提出了一种人工智能评估范式的转变,即从基于模仿的图灵测试转向以高效语言习得和理解为核心的新框架,并论证了在具身交互环境中评估机器从极少数据中学习语言的能力,能为真正的智能提供更稳健、更可持续的衡量标准。

原作者: Patricio Vera, Pedro Moya, Lisa Barraza

发布于 2023-10-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Patricio Vera, Pedro Moya, Lisa Barraza

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对该论文的解读,将学术术语转化为日常语言,并运用了富有创意的类比。

核心理念:停止问“它能欺骗我们吗?”,开始问“它能学习吗?”

想象你正在评判一场烹饪比赛。在过去70年里,黄金标准一直是图灵测试。在这个测试中,评委通过聊天窗口与一个人和一台机器对话。如果评委无法分辨哪一个是人,哪一个是机器,那么机器就算“通过”了。

本文的作者认为,这就像仅凭假塑料水果是否逼真到足以蒙蔽蒙眼品尝者,来评判一位厨师的水平。这关乎模仿,而非真正的技能。机器人能够模仿人类对话,并不意味着它真正理解自己在说什么。它可能只是一只非常聪明的鹦鹉。

作者提出了一种评判人工智能的新方法。我们不应问:“这台机器能假装成人类吗?”,而应问:“这台机器能像幼儿一样从头学习一门语言吗?

核心隐喻:幼儿 vs. 图书馆

将当前的大型语言模型(LLM),如 ChatGPT,想象成一个庞大的图书馆。它们几乎阅读了所有写过的书籍。如果你向它们提问,它们并不一定“理解”答案;它们只是基于图书馆中的所有资料,从统计学上预测哪些词通常会跟随在你所说的词之后。

作者希望像幼儿学习说话那样测试人工智能。

  • 旧方式(图灵测试): 给幼儿一份剧本,看他们能否令人信服地背诵出来。
  • 新方式(语言习得): 把幼儿放在一个有老师的房间里。不给他们书本、互联网或预加载的数据。老师指着一个杯子说:“杯子。”孩子必须通过观察世界、提问和犯错,来弄清楚“杯子”是什么意思。

论文认为,真正的智能不在于预加载所有答案,而在于能够从经验中获取理解的能力。

为什么“小数据”很重要

论文强调了一个称为**“小数据”**的概念。

  • 大数据(当前的人工智能): 想象通过观看1000万小时其他人骑自行车的视频来学习骑自行车。你可能懂理论,但你从未感受过平衡。
  • 小数据(类人人工智能): 想象通过真正骑上车、摔倒并再次尝试来学习骑自行车。你从少数几次具体而有意义的经验中学习。

作者声称,人类儿童之所以能从相对较少的例子(“小数据”)中学习语言,是因为他们扎根于现实。他们看到物体,感受质地,观察社交线索。当前的人工智能很脆弱——当面对其海量训练数据中未见过的内容时,它很容易崩溃。一个真正智能的系统应该能够像人类一样,仅凭极少信息就迅速适应新情况。

提出的“新测试”

作者概述了这一新测试的具体框架。实际操作中它将如下所示:

  1. 白板状态: 人工智能开始时没有任何关于语言或环境的预加载知识。
  2. 教师: 人类(或另一个智能体)与人工智能互动,发出口头指令。
  3. 任务: 人工智能必须描述其周围环境,提出问题以澄清事项,并仅使用实时学习的语言来实现目标(如找到物体或解决谜题)。
  4. 第二语言挑战: 一旦人工智能掌握了第一种语言,它必须学习一门第二门完全不同的语言(也许是一门稀有或未被记录的语言),以证明它不仅仅是在记忆模式,而是真正理解了语言的概念
  5. 严格条件: 测试在受控环境中进行(如“法拉第笼”以屏蔽外部信号),以确保人工智能不会通过在线查找答案来作弊。

测试的关键要求

为了确保测试的公平性和科学性,作者列出了几条规则:

  • 可重复性: 其他科学家必须能够运行相同的测试并获得类似的结果。
  • 透明度: 必须记录每一次互动、错误和成功。
  • 无“聪明的汉斯”诡计: 历史上,一匹名叫“聪明的汉斯”的马似乎能做数学题,但实际上它只是在解读主人细微的肢体语言线索。测试必须确保人工智能真正在理解,而不是仅仅捕捉评委无意中给出的提示。
  • 福祉: 测试还应衡量人工智能是否“茁壮成长”或适应良好,而不仅仅是生存下来。

更广阔的图景:语言作为生存工具

论文借鉴生物学和哲学,论证语言不仅仅是代码;它是一种生存工具。人类发展语言是为了合作和生存。因此,能够真正习得语言的人工智能展示了一种更深层次的智能——这种智能与其环境相连,具备社交互动能力,并能适应变化。

总结

简而言之,作者的意思是:
停止测试人工智能隐藏其人工本质的能力。开始测试它像孩子一样学习、适应和理解周围世界的能力。

他们认为,如果我们将焦点从模仿(看起来像人)转移到习得(像人一样学习),我们将获得一种更好、更诚实、更有用的衡量标准,来判断机器究竟意味着什么是真正的智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →