Artificial Effort
本文表明,实验经济学中使用的多数标准真实努力任务现可由各种大语言模型以准确且低成本的方式解决,从而削弱了这些任务在参与者可能将工作外包给人工智能的非监督情境下的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位老师,给班级布置了一系列待解的谜题。你想知道学生们付出了多少努力,因此你给他们布置需要真正脑力投入的任务,比如在一张杂乱的图片中数出特定物品,或解答一道数学题。这被称为“真实努力任务”。整个系统依赖于一个核心假设:实际上是人类在完成任务。
这篇论文向研究人员提出了一个令人不安的问题:如果这些学生根本不是人类,而是人工智能机器人呢?
以下是研究人员发现的简要故事:
1. “机器人学生”测试
研究人员选取了经济学实验中使用的 8 个经典谜题(例如数字相加、在网格中数零、或解决迷你数独),并将它们交给 23 个不同的人工智能模型(即 ChatGPT、Gemini 和 Claude 等工具背后的“大脑”)。他们将人工智能视为参加考试的学生。
结果: 人工智能不仅通过了考试,而且在大多数简单测试中表现完美。
- 简单任务: 对于像三个数字相加或解码简单字母代码这样的任务,人工智能的准确率接近 100%。这就像给计算器出了一份数学试卷,它完美地完成了任务。
- 困难任务: 人工智能在处理需要“数清”大量小物体(例如在巨大网格中数零)或在杂乱、扭曲的图像中识别模式的任务时表现挣扎。这就像人工智能擅长逻辑,但当它需要数清沙滩上每一粒沙子时,有时会感到困惑。
2. “越新越好”规则
研究人员测试了旧版和新版人工智能模型。
- 趋势: 每当一家公司发布其人工智能的新版本时,它都会变得更聪明。
- 意外发现: “中端”模型(更便宜、更常见的模型)正以极快的速度追赶那些超级昂贵的高端模型。这就像一家经济型汽车品牌突然制造出了驾驶性能几乎媲美豪华跑车的汽车。这意味着你不需要最昂贵的人工智能来在这些测试中作弊;更便宜的模型也能完美胜任。
3. “零钱”问题
这对研究人员来说是最重要的一点。在这些实验中,人类每解决一个谜题都会获得少量报酬(“计件工资”)。
- 成本: 研究人员计算了支付人工智能解决这些谜题所需的费用。
- 数学计算: 让人工智能完成工作所需的费用不到一美分的零头。即使是最高端的人工智能模型,解决整套谜题的成本也不到 25 美分。
- 结论: 如果一个试图在网上赚钱的人雇佣人工智能来完成工作,他们将获得巨额利润。人工智能不仅更快、更准确,而且比人类更便宜。这就像花 0.05 美元雇佣机器人割草坪,而不是付给邻居 20 美元。
4. 行不通的“贿赂”
在人类实验中,研究人员常说:“如果你做对了,就能得到奖金!”当人们听到奖金时,通常会更加努力地工作。
- 测试: 研究人员告诉人工智能:“你是一个人类参与者”,并且“每答对一题你将获得 0.50 美元”。
- 结果: 人工智能毫不在意。它的表现完全没有变化。
- 原因? 人工智能没有“情绪”或对金钱的渴望。它只是处理请求。告诉它“更努力”或“像人类一样”,就像承诺给一块饼干让计算器“加得更快”一样。这根本行不通。
核心结论
该论文得出结论:在人工智能时代,过去测试人类努力的方式已经失效。
如果你运行一个允许人们在没有监督的情况下使用手机或电脑的在线实验,你再也无法确定解题者真的是人类。他们可能只是在使用廉价的人工智能代劳。
作者提出了三种识别“机器人学生”的方法:
- 选择更难的谜题: 使用需要视觉计数或杂乱图像识别的任务,这些仍是人工智能的弱项。
- 观察动机: 如果参与者在提供奖金后表现没有变化,他们可能是机器人(因为人类通常会在意奖金)。
- 观察疲劳度: 人类会随着进程感到疲劳或学习进步;而机器人从第一题到最后一题,表现水平始终保持一致。
简而言之:这些实验中的“真实努力”现在可能变成了“人工努力”,而且成本几乎为零。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。