✨ 要点🔬 技术摘要
想象一下,经济就像一座巨大且繁忙的城市。长期以来,我们都知道“人工智能(AI)”正在迁入,但我们并不真正了解它们住在哪些社区、究竟在从事什么样的工作,或者它们是否真的具备独立工作的能力,还是仅仅需要人类在旁边牵着手。
这篇名为《开源 AI 应用与能力经济指数》的论文,就像是一次大规模的开源城市普查,同时也是一场严谨的入职面试。作者构建了两个主要工具,旨在回答两个核心问题:**AI 到底在哪里被使用?**以及 AI 到底能不能完成工作?
以下是利用简单类比对研究结果进行的拆解:
1. “城市人口普查”(衡量应用程度)
问题所在: 之前的研究试图通过询问人们(人们往往会撒谎或遗忘)来进行调查,或者通过观察大型科技公司内部秘密、私有的聊天记录(这些记录其他人无法核查)来推测 AI 的使用情况。
解决方案: 作者构建了一个“公共普查”。他们提取了数百万条人类与 AI 之间的公开、匿名对话(来自一个名为 WildChat 的数据集),并使用了一种智能过滤器进行分类。
过滤器: 他们询问 AI:“这段对话是关于工作的吗?”如果答案为“是”,则保留;如果只是在询问食谱或笑话,则将其丢弃。
地图: 随后,他们将这些工作相关的对话与一份庞大的官方职业字典 O*NET (可以将其想象成美国所有职业的“黄页”,详细列出了每项工作所需的具体任务)进行了匹配。
研究发现:
谁在使用它? “AI 社区”在金融、计算机科学和艺术领域 非常拥挤。如果你是一名财务顾问、程序员或创意作家,你很可能频繁使用 AI。
谁不在使用它? 令意外的是,在白领职业中,律师 的使用率是最低的。
使用有多深入? 实际情况并没有传闻中那么夸张。虽然 AI 在许多职业中都有应用,但它通常只是辅助处理某些 任务,而非接管整个工作。只有极小比例的职业(不到 1%)使用 AI 来完成其日常任务中 75% 的内容。
2. “入职面试”(衡量能力)
问题所在: 仅仅因为人们要求 AI 执行某项任务,并不意味着 AI 真的能正确地完成 它。这就像一个学生说自己能写小说,并不代表他不需要帮助就能写出一本优秀的小说。
解决方案: 作者构建了一个“模拟职场”。
设置: 他们根据 O*NET 的职业描述,创建了近 5,000 个真实的办公场景。
工具: 他们给了 AI 一套数字工具(如计算器、数据库或日历),AI 必须利用这些工具来解决问题。
测试: 他们测试了一个特定的 AI 模型(Kimi-k2.5),分为两种模式:
单人模式(Solo Mode): AI 必须独自完成整项工作。
团队模式(Team Mode): AI 必须与一名“模拟人类”协作,该人类会提出问题并给出提示。
研究发现:
大局观 vs. 细节: AI 在“大局观”方面表现得相当出色。它能够理解通用的工作流程(例如:“我需要雇佣一个人,所以我应该发布职位,然后进行面试,最后录用”)。
细节上的失误: 然而,AI 经常在微小的细节上栽跟头。它可能会调用错误的工具、按错按钮,或者在需要精确度时编造事实(幻觉)。
人类安全网: 当 AI 与人类协作(团队模式)时,它完成工作的成功率更高。但人类仍需密切观察,因为 AI 在使用工具时依然会不断犯一些小错误。
核心启示
可以将 AI 的应用想象成一种进入建筑工地的全新电钻 。
应用程度: 我们看到木匠(艺术家、程序员、金融从业者)正抓起电钻并频繁使用它。
能力水平: 但当我们观察他们尝试建造房屋时,我们发现他们擅长钻大孔,但经常会打偏钉子或钻错位置。
结论: 论文认为,目前我们不必过度恐慌 AI 会完全取代人类。虽然 AI 在特定领域正被快速采用,但它尚未达到能够完美自主完成复杂工作的“自主化”程度。它最适合的角色是副驾驶(Co-pilot) ——需要人类来掌舵、检查细节,并确保工具被正确使用。虽然完全失业的风险目前较低,但对人类监督的需求依然很高。
技术摘要:开源 AI 采用与能力的经济指数
问题陈述
尽管全球在生成式 AI 领域投入了大量资金且组织采用率广泛,但关于 AI 对特定劳动任务具体影响的实证证据仍然模糊不清。现有的衡量 AI 经济影响的方法存在关键局限性:
调查法: 由于社会期望偏差(social desirability bias),容易出现报告不足的问题。
受控实验: 通常局限于单一职业,缺乏宏观经济图景。
先前的对话分析: 先前将用户-LLM 对话映射到职业任务的研究(如 Handa 等人、Chatterji 等人)依赖于私有数据,阻碍了可复现性。此外,仅仅对对话进行分类并不能衡量 AI 执行这些任务的实际性能或能力。
能力基准测试: 现有的基准测试(如 GDPval、Remote Labor Index)通常依赖于自定义生成的任务或人工评分的交付物,这引入了歧义并限制了评估规模。
因此,需要一个开源、可复现的框架,能够同时衡量不同职业的 AI 采用率 以及 AI 智能体执行观察到的真实世界使用中的特定任务的 功能能力 。
方法论
作者提出了一个由两部分组成的系统来解决这些差距:用于衡量采用情况的 开源经济指数 和用于衡量性能的 经济能力基准 。
1. 开源经济指数(采用情况衡量)
该系统利用公开数据量化哪些职业领域正在利用 AI 以及这种利用的深度。
数据来源: 研究使用了 WildChat-4.8M 数据集,这是一个非毒性的人机对话集合。
过滤流水线:
语言/唯一性: 筛选出唯一的英文对话。
职业相关性: 使用 gpt-oss-120b 将对话分类为“职业相关”(与工作/专业任务相关)。这产生了约 789,000 条相关对话。
语义映射: 将相关对话映射到 O*NET (职业信息网络)任务。
步骤 1: 将对话总结为单个请求。
步骤 2: 使用 Qwen3-Embedding-0.6B 生成嵌入,并针对 O*NET 任务(2,087 个详细工作活动、332 个中间级、41 个工作活动)进行最近邻搜索。
步骤 3: 使用 gpt-4o-mini 作为过滤器,仅保留核心技能或活动与对话重叠的任务。
聚合: 对对话按任务数量进行加权,并在职业层面进行聚合,以创建代表性和渗透深度的指数。
2. 经济能力基准(性能衡量)
该系统评估 AI 智能体是否能够自主或协作地执行在采用指数中识别出的任务。
场景生成:
基于 O*NET 任务 和来自 Smithery 的 MCP(模型上下文协议) 服务器。
系统爬取 Smithery 服务器,验证工具质量,并通过嵌入将 O*NET 任务与可用工具进行语义匹配。
场景被生成为 (职业, 任务, 服务器) 元组,通过提示 LLM 创建具有特定工具调用答案键(answer keys)的现实工作请求。
评估模式:
单轮(Single-Turn): 工作流的自主执行。
多轮(Multi-Turn): 协作执行,其中模拟的用户智能体会隐瞒关键参数,要求 AI 提出澄清性问题(角色反转)。
评估维度(LLM-as-Judge):
工具调用准确性: 检查工具和参数是否正确的二元检查(功能等效性)。
工作流完成度: 采用 1–5 分制,评估多步序列化和数据流。
落地性(Grounding): 采用 1–5 分制,评估主张是否得到工具输出的支持(而非幻觉)。
自主性与后续质量: 专门针对多轮场景,衡量独立性和信息收集能力。
关键结果
采用情况发现
行业集中度: AI 采用率最高的是 艺术、设计、娱乐 ,商业与金融 ,以及 计算机与数学 领域。
低采用率: 与其他白领领域相比,法律服务领域的 LLM 适应率出奇地低。
使用深度: 虽然可见采用现象,但深度渗透有限。仅有 0.4% 的职业在至少 75% 的任务中显示出 AI 使用(相比之下,之前的私有研究约为 4%)。
技能使用: 认知技能(写作、编程、批判性思维、阅读理解)在指数中占据主导地位。
能力发现
作者在 9 个高频职业(如程序员、人力资源专家、记者)中测试了 Kimi-k2.5 模型,使用了约 5,000 个生成的场景。
宏观 vs 微观性能: AI 智能体在高级工作流完成度方面表现出很强的能力(平均得分 ~4.08/5),但在细粒度细节上经常出错。
工具调用准确性: 仅有约 60% 的所需工具调用被正确执行。错误通常涉及幻觉参数或缺失必要参数。
落地性: 平均落地性得分约为 3.7/5,表明存在不可忽视的幻觉率,即主张无法得到工具输出的支持。
人机协同(Human-in-the-Loop): 在多轮场景中,用户协作能提高工作流完成度,但往往会降低工具调用准确性和落地性,这表明人类监督对于细粒度步骤仍然至关重要。
差异性: 理论能力(智能体在基准测试中能 做的事)往往超过了当前现实世界采用的深度,然而,由于协作型工作流优于纯粹的自主执行,完全的职业替代目前尚不现实。
意义与贡献
该论文声称其对 AI 经济学和评估领域的贡献如下:
可复现性: 通过利用开源的 WildChat 数据集和开源映射流水线,作者提供了一个透明的替代方案,用于取代私有的经济指数,从而允许对 AI 采用趋势进行独立验证。
细粒度能力评估: 该基准测试超越了针对人类或静态任务的“胜率”对比。它在 基于 O*NET 且由工具介导的工作流 上评估智能体,区分了自主执行与协作引导。
细致的劳动力市场洞察: 研究挑战了“立即实现全面自动化”的叙述。它表明,虽然 AI 可以处理宏观工作流,但劳动力影响的“锯齿状前沿”(jagged frontier)是由细粒度工具使用的错误以及对人类监督的需求所定义的。
方法论创新: 将 MCP 服务器 与 O*NET 分类法 相结合,创建了一个可扩展且动态的基准,反映了真实的软件生态系统,而非静态的自定义任务。
作者得出结论:虽然 AI 采用正在增长,但由于在工具执行和错误纠正方面存在高水平工作流成功与频繁需要人工干预之间的差距,大规模失业的风险目前得到了缓解。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。