← 最新论文
💻 computer science

Economic Evaluations of Language Models

本文介绍了 EconEvals,这是一个具有成本效益且开源的评估套件与模拟框架,用于评估语言模型在节省美国各类职业时间方面的潜力,并揭示了虽然目前的模型能够对近半数的工作产生显著影响,但其实际应用目前受限于隐私顾虑和专有系统壁垒,而非技术能力。

原作者: Alexander Wan, Stephane Hatgis-Kessell, Tomás Aguirre, Percy Liang, Rishi Bommasani

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Wan, Stephane Hatgis-Kessell, Tomás Aguirre, Percy Liang, Rishi Bommasani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一座规模宏大、繁忙有序的图书馆,其中的书籍每天都在变得更加聪明。长期以来,图书管理员(科学家们)一直在通过让这些新出的、超级聪明的书去解决数学谜题或编写代码来测试它们。这就像是在检查一辆新车是否能在赛道上赢得比赛。但问题在于,现实生活并不是赛道。现实生活是一个混乱而复杂的城市,人们从事着成千上万种不同的工作,从修理水管到管理医院。大家都在问一个大问题:“如果这些 AI 书籍如此聪明,它们究竟能在多大程度上帮助我们的日常工作?它们是会为我们节省时间,还是只会静静地躺在书架上?”

为了回答这个问题,我们需要理解几件事。首先,有“基准测试”(benchmarks),它们就像是 AI 的标准化考试。如果一个 AI 得了高分,意味着它擅长这项特定的测试。其次,是“暴露度”(exposure),这是一个高级词汇,意指:“一个工作者的日常工作中,有多少部分实际上可以由 AI 接管?”最后,是 AI 在测试中所能做到的能力与它在现实世界中实际表现之间的差距。我们之所以关心这一点,是因为如果我们不知道答案,我们就无法规划未来。我们可能会认为 AI 明天就会改变一切,也可能会认为它根本不会改变任何事情,而这两种猜测都可能出错。

于是,来自斯坦福大学和圣保罗大学的一个研究小组决定不再靠猜,而是开始测量。他们构建了一个名为 ECONEVALS 的全新开源工具包。你可以把这个工具包想象成一张巨大的、数字化的美国就业市场地图。他们没有仅仅关注软件工程师等热门职业,而是绘制了超过 1,000 种不同的职业,并将其细分为近 19,000 个微小的任务。这就像拥有一个显微镜,可以缩放并观察每一位劳动者所做的每一件事,从“接听电话”到“设计桥梁”。

该团队面临着一个棘手的问题:他们需要知道现实中的人在工作时实际上在向 AI 请教什么,但大多数这类数据都是私密的。因此,他们做了两件事。首先,他们挖掘了数百万条公开对话,以寻找真实的与工作相关的提问。其次,当他们找不到针对特定工作的真实数据时,他们创建了“合成”数据。想象一下,一个机器人演员正在扮演护士、教师或建筑工人,向 AI 寻求关于其日常特定任务的帮助。他们利用这种真实数据与角色扮演数据的混合体,对 10 种不同的 AI 模型进行了测试。

他们发现了什么?研究结果有点像一个“潜力与现实”的故事。研究人员发现,目前的 AI 模型在协助工作方面其实非常出色。事实上,他们的模拟表明,对于 47% 的所有美国职业而言,AI 可以让劳动者在至少一半的日常任务中节省大量时间。这可是劳动力的巨大组成部分!

然而,转折点在于:仅仅因为 AI 能够 做某项工作,并不意味着人们正在使用它来做这项工作。团队发现,在 79% 的 AI 理论上可以节省大量时间的任务中,人们并没有实际频繁地使用像 Claude 这样的工具。这就像是你车库里停着一辆时速可达 200 英里的法拉利,但你却因为害怕速度或不知道如何换挡,只把它用来开车去信箱那里。

那么,是什么阻碍了我们更多地使用 AI 呢?研究人员进行了一项特别的模拟,将 AI 无法节省时间的具体原因拆解开来。他们发现,最大的瓶颈并不是 AI 太笨,而是现实世界太复杂了。AI 目前无法提供帮助的主要原因包括:

  • 物理动作: AI 无法拿起锤子或修理漏水的水管。
  • 隐私: 你不能让 AI 阅读你的私人医疗记录或法律文件。
  • 专有系统: 许多公司使用陈旧且封闭的软件,AI 无法与之连接。
  • 实时交互: AI 在处理瞬息万变的实时面对面交谈时表现挣扎。

该论文还将他们这种新的、详细的方法与旧的衡量 AI 的方法进行了对比。旧的方法像是看一份超能力清单,然后说:“这个 AI 无所不能!”而新方法则更像是实际观察 AI 尝试完成工作,并看它在哪里跌倒。他们发现,旧的方法过于乐观,预测 AI 可以辅助 68% 的工作,而他们更真实的模拟显示,这一比例接近 47%

简而言之,这篇论文告诉我们,AI 是一个强大的工具,已经准备好协助我们的许多工作,但由于隐私规则和对物理双手需求等现实世界的障碍,我们尚未充分利用它。研究人员建立了一张地图和一个测量尺,可以随着 AI 变得越来越聪明而不断更新,帮助我们理解技术下一步将落脚何处,而不是仅仅靠猜测。他们并不是在说 AI 已经解决了经济问题,但他们为我们描绘了一个更清晰的图景,让我们看清了哪里是路障,哪里又是通畅的赛道。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →