Design and Report Benchmarks for Knowledge Work
本文提出一个三步框架,用于设计与报告知识工作基准测试,该框架明确将评估任务、测试环境与评分标准同现实工作活动相对齐,以确保基准分数能可靠地反映系统在真实部署场景中的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《设计与报告知识工作基准》的解释,已用通俗易懂的语言和日常类比进行翻译。
核心问题:“驾驶考试”与“真实通勤”
想象一下你想雇佣一名司机。你让他们在空旷的停车场里停车,并直线行驶。他们得了满分。于是你雇佣了他们。
但在第一天上班时,他们在交通中迷路了,无法应对突如其来的暴雨,也不知道如何安抚害怕的乘客。尽管他们在考试中表现完美,却在真实工作中失败了。
这篇论文指出,当前的人工智能基准测试就像那个空旷的停车场的考试。它们非常擅长衡量人工智能能否在真空中回答问题或写出一行代码。但它们极不擅长预测人工智能是否真的能在混乱的现实世界中完成“知识工作”(例如像研究员、医生或办公室经理那样工作)。
作者认为:仅仅因为人工智能在考试中得了高分,并不意味着它能胜任实际工作。
解决方案:一份三步走的“职位描述”
为了解决这个问题,作者提出了一种设计和报告人工智能测试的新方法。我们不能只说“这个人工智能在数学考试中得了 90%",我们需要确切解释这 90% 到底意味着什么。他们为每项测试建议了一份三步检查清单:
1. 定义“工作活动”(他们实际上在做什么?)
大多数测试只说“这是‘医疗’测试”或“这是‘编程’测试”。这太模糊了。“医疗”可能意味着诊断病人、填写保险表格或订购物资。这些是完全不同的工作。
- 论文的改进: 作者创建了一个包含18 种具体工作类型的“菜单”(例如调查、协调、记录保存或故障排除)。
- 类比: 与其说“我们测试了一位厨师”,不如说“我们测试了他们切菜的能力”。也许他们切菜很棒,但调味很糟糕。我们需要知道我们具体测试的是哪种“切菜”技能。
2. 指定“工作环境”(他们使用了什么工具和规则?)
在现实世界中,律师可以访问图书馆,拥有助理团队,并面临严格的截止日期。而在测试中,人工智能可能被提供了答案键,没有时间限制,也没有团队。
- 论文的改进: 测试报告必须列出人工智能被允许使用的确切内容。它是必须自己寻找信息,还是被直接给了一叠文件?它是作为主管行事,还是作为助手?
- 类比: 如果你测试一名木匠,你需要知道:他们是否拥有电锯和全套车间?还是他们必须仅用一把黄油刀和一颗钉子来制作一把椅子?根据工具的不同,分数的含义截然不同。
3. 评估“工作成果”(他们留下了什么?)
在许多人工智能测试中,系统只是吐出一个最终答案(例如“答案是 42")。但在现实的知识工作中,过程同样重要。医生不会只说“你感冒了”;他们会留下一份图表、一张处方和一份给护士的便条。
- 论文的改进: 不要只给最终答案打分。要给人工智能留下的产物打分。它是否留下了清晰的获取答案的轨迹?这份文件是否准备好供他人使用?
- 类比: 如果学生写了一篇论文,不要只给最终的"A"打分。要给草稿、笔记和引用打分。如果论文完美无缺,但学生无法解释他们是如何写出来的,那么他们就没有真正掌握这项技能。
论文中的现实世界示例
作者在他们现有的三个基准测试上测试了他们的想法,以展示其运作方式:
GDPVAL(“办公室经理”测试):
- 旧观点: “这个人工智能擅长‘拨款管理’。”
- 新观点: “这个人工智能擅长设计特定的风险评估表格。但我们不知道它是否能处理实际的归档或审批流程,因为测试并未模拟这些环节。”
- 差距: 测试衡量的是设计,而非工作流。
OFFICEQA PRO(“研究员”测试):
- 旧观点: “这个人工智能擅长‘文档分析’。”
- 新观点: “这个人工智能擅长在文档中找到特定数字并进行数学运算。但它没有留下供人类审查的研究备忘录或引用列表。”
- 差距: 测试衡量的是答案,而非证据链。
APEX-SWE(“软件工程师”测试):
- 旧观点: “这个人工智能擅长‘软件工程’。”
- 新观点: “这个人工智能擅长编写通过特定自动化测试的脚本。但它没有进行真正的工程师所做的代码审查、部署或维护。”
- 差距: 测试衡量的是代码执行,而非工程责任。
结语
这篇论文并不是说人工智能不好。它说的是我们误解了成绩单。
如果你看到人工智能得了 95 分,你不应该假设“这个人工智能能做我的工作”。相反,你应该问:
- 它具体做了什么活动?(例如:“它分析了数据。”)
- 它在什么环境下做的?(例如:“它拥有完美的数据且没有时间压力。”)
- 它留下了什么产品?(例如:“它给出了一个数字,但没有解释。”)
通过如此具体地界定,我们停止对人工智能的能力做出过度承诺,并开始确切理解它在何处有帮助,以及在何处仍需要人类的协助。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。