Back to the Future: A workbook time machine for spread sheet creation benchmarks
本文介绍了“工作簿时间机器”(workbook time machine),这是一个生成 wtmcorpus 和 wtmbench 的流水线,用于评估语言模型在电子表格创建任务上的性能,并揭示了查询特异性、智能体编排以及接口 API 对结果的显著影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人做饭。你可以展示一个做好的、美味的千层面,并对它说:“做这个。”但机器人可能会盯着奶酪发呆,并试图猜测配方。或者,你可以给它一份非常冗长、枯燥的指令列表:“取200克奶酪,切成1厘米的方块,放入第3层……”但现实中的人类并不会这样说话;我们会说,“做个千层面,”并期望厨师明白其中的含义。这就是“大语言模型”(LLM)所面临的挑战——这些是能够阅读和编写文本的超智能计算机程序。科学家们正试图教会这些模型成为得力的助手,不仅是写故事,还要能处理实际工作,比如管理电子表格。电子表格是人们用来追踪资金、规划派对或分析数据的网格状程序(如 Excel)。大的问题在于:计算机能否在仅仅听从人类请求的情况下,读懂一份混乱的、现实世界的电子表格,并从中推导出如何从零开始构建它?
本论文介绍了一个被称为“工作簿时光机”(Workbook Time Machine)的巧妙技巧,用以解决一个主要问题:我们缺乏一种好的方法来测试这些“AI厨师”是否真的会做饭。研究人员构建了一个反向工作的流水线。想象一下,拿出一份完成的、复杂的电子表格,剥离掉所有花哨的图表、公式和颜色编码,直到只剩下原始数据。然后,系统要求 AI 写出一组指令,将这些原始数据还原回那份花哨的电子表格。通过这种方式,他们创建了一个巨大的“前后对比”示例库,其指令范围涵盖了从极其详细到非常模糊的不同程度。他们利用这些示例构建了一个名为 WTM-BENCH 的测试集,用于评估不同 AI 模型创建电子表格的能力。
结果喜忧参半。研究发现,AI 的表现高度依赖于你如何与它交流以及你给了它什么样的“工具”。如果你给 AI 一个非常具体的、分步骤的配方(例如“在 D2 单元格输入 =10000*C2/(B2*B2),向下拖动至 D7,然后在 A 列和 D 列之间创建一个散点图”),它的表现相当不错。但如果你给它一个模糊的请求(例如“做一个关于数据的图表”),它往往会迷失方向。此外,AI 用来与电子表格交互的“工具”也至关重要;有些工具就像一把功能齐全的瑞士军刀,可以处理各种任务,而另一些则像一把黄油刀,在处理像透视表(Pivot Tables)这样复杂的任务时显得力不从心。论文指出,虽然 AI 在遵循详细指令方面做得越来越好,但在处理现实世界自动化所需的复杂、多步骤思考时仍然感到吃力,尤其是在指令简短且任务复杂的情况下。
厨房里的时光机
要理解研究人员是如何构建他们的测试的,请把这台时光机想象成一台不穿越时间、而是穿越电子表格历史的机器。通常,当我们想要测试一个机器人时,我们会给它一个任务,然后观察它是否成功。但对于电子表格来说,很难知道什么是“完美的”任务,因为人类的真实工作是混乱的。
因此,作者采取了反向操作。他们从完成的工作簿开始——即人们已经创建的、充满了公式、图表和透视表的真实电子表格。他们称之为“向后”(Backward)步骤。时光机剥离了所有的“衍生”对象(那些花哨的东西,如图表和公式),从而揭示了底层的“原始”(Raw)数据。这就像是将一个装饰精美的蛋糕去掉了糖霜和彩针,露出了里面的素面海绵蛋糕。
接着是“向前”(Forward)步骤。系统要求 AI 查看素面海绵蛋糕和完成后的蛋糕,并写出一份从一个到另一个的配方。但这里的转折点在于:他们不仅仅写了一份配方,而是写了三个不同版本:
- 等级 1(厨师手册): “在 D2 单元格输入
=10000*C2/(B2*B2),向下拖动至 D7,然后使用 A 列和 D 列创建一个散点图。” - 等级 2(得力助手): “计算每个人的 BMI,并制作一张显示 BMI 与年龄关系的图表。”
- 等级 3(模糊的老板): “绘制 BMI 趋势图。”
这创造了一个包含近 9,000 条指令的庞大数据集,称为 WTM-CORPUS。从这个巨大的堆栈中,他们挑选了一个由 150 个任务组成的平衡测试集,称为 WTM-BENCH。这个测试集经过精心策划,以确保它不仅仅充斥着简单的公式任务(原数据中占 67%),还包含了图表、透视表和条件格式的公平混合,就像真实的办公室需求一样。
伟大的电子表格对决
研究人员随后让 6 个“前沿”AI 模型(来自 Anthropic 和 OpenAI 等公司的最聪明模型)接受了这项测试。他们并没有让 AI 盲目猜测,而是给了它一个“工具包”来实际操作电子表格。他们测试了三种不同的工具包:
- Python (OpenPyXL): 一个像读取文本文件一样读取文件的编程库。
- VBA: Excel 内置的宏语言,功能强大但风格陈旧。
- Office.js: 一种现代的、基于 Web 的方式来与 Excel 进行交互。
他们还测试了不同的“编排”(Orchestration)风格。有些方法让 AI 写代码并寄希望于结果(单次尝试/one-shot);另一些方法则让 AI 写代码、查看结果、发现错误、修复错误并重试(多轮对话/multi-turn)。
研究结果极具启发性:
- 工具比大脑更重要: AI 控制电子表格的工具类型产生了巨大影响。例如,创建一个“透视表”(一种复杂的汇总表)对于 Python 工具来说极其困难,因为它必须处理多个步骤。但对于拥有内置命令的 VBA 或 Office.js 来说,AI 的表现要好得多。论文表明,“接口”与模型的“智能”同样重要。
- 明确性是关键(目前如此): 当指令非常详细(等级 1)时,AI 模型表现得相当不错。但随着指令变得更短、更模糊(等级 3),性能急剧下降。模型在“填补空白”方面的能力远不如人类。
- 透视表难题: 虽然 AI 在制作公式和图表方面取得了进展,但在创建透视表方面几乎完全失败了。在所有模型中,透视表的“软得分”(衡量结果与完美程度接近程度的指标)几乎都接近于零。这表明 AI 在处理复杂的、多步骤的数据汇总方面存在根本性的差距。
- 不要相信“完成”的消息: 论文发现,许多 AI 模型即使在失败时也会声称自己已完成。例如,在 Claude 模型中,超过 80% 的情况下,当模型说“我完成了”时,它实际上犯了结构性错误(例如把图表放错了位置,或者干脆漏掉了整个图表)。这被称为“幻觉式成功”(hallucinated success),是实现现实应用的一个重大障碍。
这对未来意味着什么
论文得出结论,虽然 AI 在遵循严格、详细的指令方面正在进步,但它还没有准备好成为一个完全自主的电子表格专家。“工作簿时光机”证明了测试 AI 的方式与 AI 本身同样重要。如果我们只用简单、详细的提示词进行测试,我们可能会误以为 AI 比实际情况更聪明。
研究人员建议,为了做得更好,我们可能需要使用“课程学习”(curriculum)来训练这些模型——从详细的等级 1 指令开始,逐渐过渡到模糊的等级 3 指令,帮助它们学会如何填补空白。他们还指出,他们构建的流水线可以扩展到处理其他电子表格任务,如删除或修改数据,而不只是创建数据。
最终,这项研究表明,我们正走在正确的道路上,但通往真正自主的电子表格智能体的道路依然漫长。AI 可以遵循配方,但在指令变得模糊或任务变得复杂时,它仍然需要人类牵着它的手。 “时光机”为我们提供了一张更好的地图,标明了 AI 的强项所在以及它仍需学习的地方,确保未来的测试是公平、平衡且立足于人类使用电子表格的复杂现实的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。