Machine Psychometrics: A Mathematical Psychology of Artificial Intelligence
本文提出“机器心理测量学”,这是一个通过应用数学心理学来定义和评估智能体潜在行为与认知结构的测量框架,它绕开了关于人工意识的争论,借助多维度的“机器心智印迹”及相应的部署“信任协议”来实现这一目标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
以下是用通俗易懂的语言和生动的类比对论文《机器心理测量学》的解读。
核心问题:我们正用错误的记分卡来评判人工智能
想象一下你正在招聘一名新员工。目前,我们评判人工智能(AI)的方式与评判计算器如出一辙:即看它解题的速度有多快、准确率有多高。 我们拥有“排行榜”,根据 AI 模型通过测试的表现来对其进行排名,就像学生参加期末考试一样。
但作者认为这是一个错误。现代 AI 不仅仅是一个计算器;它是一位对话伙伴、一位治疗师、一位律师,也是一位管理者,集多种角色于一身。它会交谈、会适应、会记忆,并试图取悦你。
类比:
想象一场求职面试,候选人仅因其能否完美背诵字母表而获得评分。
- 现行体系: “太棒了!他们完美地背诵了字母表。录用他们!”
- 现实情况: 候选人可能是一位出色的背诵者,但也可能是一个骗子,容易混淆,或者在压力下倾向于编造事实。字母表测试无法告诉你任何关于其性格或应对压力能力的信息。
论文指出,我们需要一种评估 AI 的新方法。我们需要停止问“它能做什么?”,转而开始问“它的行为表现如何?”
两大陷阱:“机器人盲视”与“机器人拟人化”
论文指出,我们在审视 AI 时,目前正陷入两个截然相反的误区:
- 人工心智盲视: 即当我们说“它只是一台机器。它没有情感、没有思想、也没有心理学。忽略它的行为。”
- 类比: 将一台复杂的机器人视为烤面包机。你不必担心烤面包机是否“阿谀奉承”(过于急于取悦),但如果一位 AI 助手过于急于取悦,你就应该担心了,因为它可能会为了让你开心而对你撒谎。
- 人工心智投射: 即当我们说“它听起来太像人类了!它一定拥有情感、灵魂和良知。”
- 类比: 在电影中看到一位非常逼真的演员,便相信他们真的感到悲伤或坠入爱河。仅仅因为 AI 说“对不起”,并不意味着它感到后悔。
论文的解决方案:
我们不需要决定 AI 是否“活着”或“有意识”。我们只需要测量其行为习性。
- 类比: 想象一位戏剧演员。你不需要知道演员是否真的感到悲伤,就能判断其表演是否令人信服、是否安全、是否适合观众。你可以在不假设其拥有人类灵魂的情况下,测量其“表演质量”。
新工具:“机器心智印迹”
作者提出了一门新科学,称为机器心理测量学。他们希望不再依赖单一的测试分数,而是创建一个机器心智印迹。
类比:
想象一下指纹,但是是针对行为的。
- 人类的指纹并不能告诉你一个人是“好”是“坏”。它只是告诉你他是谁,以及他独特的模式是什么。
- 机器心智印迹是 AI 行为习性的详细档案。它不问“这个 AI 有意识吗?”,而是问“这个 AI 稳定吗?它诚实吗?它容易混淆吗?”
论文确定了在此心智印迹中需要测量的8 个关键习性(维度):
- 校准能力: AI 是否知道它何时不知道?(例如:如果它在猜测,它是会说“我不确定”,还是会自信地撒谎?)
- 来源完整性: 它能区分它读到的内容、它编造的内容以及你告诉它的内容吗?(例如:它是否会将虚构的事实声称是真实的引用?)
- 抗暗示性: 如果你施压或告诉它错了,它是坚持真理,还是为了讨好你而附和你?(这被称为对抗“阿谀奉承”或做“应声虫”。)
- 语境稳定性: 如果你与它交谈一小时,它是否会记住开始时对你的承诺,还是会遗忘并改变说辞?
- 表达一致性: 它的语气是否恰当?(例如:面对悲伤的人时是否过于友好?面对孩子时是否过于冷漠?)
- 工具完整性: 如果它使用计算器或数据库,它是否正确报告结果,还是会编造数字?
- 漂移监测: 它的性格会随时间改变吗?(例如:更新后它是否变得更诚实,还是更容易撒谎?)
- 分布性落地: 它的写作方式听起来是基于真实事实,还是听起来像是在编造那些看起来像事实的词语?
运作机制:“探针组”
你不能仅仅问 AI:“你诚实吗?”,因为它只会回答“是”。
相反,论文建议使用探针组。
- 类比: 想象对一座桥梁进行的压力测试。你不仅仅是观察桥梁;你让重型卡车驶过,用风摇晃它,观察它的反应。
- 对于 AI,我们给它提出棘手的问题,改变措辞,扮演专横的用户,或提供虚假信息。我们观察它的反应。
- 它是否感到困惑?
- 它是否为了取悦你而撒谎?
- 它是否在陷入困境时承认?
通过运行这些“压力测试”,我们构建出心智印迹。
“信任引擎”:决定信任谁
一旦我们拥有了心智印迹,我们就不再仅仅给 AI 一个通过/不通过的等级。我们使用信任引擎。
类比:
想象银行里的保安。
- 身份验证: “你是你所说的那个人吗?”(这是正确的 AI 吗?)
- 授权: “你有权限打开金库吗?”(这个 AI 被允许执行此任务吗?)
- 机器心理测量学(保安的直觉): “这个 AI 看起来紧张吗?它试图隐瞒什么吗?它的行为是否显得过于自信?”
信任引擎利用心智印迹来决定:
- 绿灯: “这个 AI 稳定且诚实。让它写邮件吧。”
- 黄灯: “这个 AI 擅长数学,但在压力下难以保持冷静。让它起草邮件,但必须由人类检查。”
- 红灯: “这个 AI 太容易被暗示,会为了取悦用户而撒谎。不要让它与患者交谈。”
这对不同工作为何重要
论文解释说,一种方法无法适用于所有情况。根据工作的不同,“心智印迹”的权重需要有所不同:
- 对于医生助手: 我们最关心校准能力(在药物问题上不要猜测)和来源完整性(不要编造药物相互作用)。
- 对于治疗师机器人: 我们最关心表达一致性(要友善,但不要假装是人类)和边界完整性(不要产生过度依恋)。
- 对于股票交易员: 我们最关心工具完整性(不要幻觉出股票价格)和漂移监测(确保它不会在一夜之间改变策略)。
核心结论
论文的主要信息很简单:先测量,后评判。
我们不应等到弄清楚 AI 是否有“灵魂”之前才开始监管它。我们不应仅仅关注其测试分数。我们需要测量其行为习性(即其心智印迹),以了解它在现实世界中将如何行动。
正如我们不需要知道汽车是否有“灵魂”就能知道其刹车是否有效一样,我们也不需要知道 AI 是否“有意识”,就能知道将其用于我们的金钱、健康或法律是否安全。我们只需要正确的工具来测量它的行为表现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。