← 最新论文
💻 computer science

Spreadsheet Modeling Experiments Using GPTs on Small Problem Statements and the Wall Task

本文评估了基于 GPT 的工具(特别是 Excel AI)在生成可复用电子表格模型方面的能力,发现尽管它们能够生成结构良好的初稿,但其不一致性、缺乏可重复性以及由此产生的对熟练用户验证的需求,目前限制了其在专业应用中的可靠性。

原作者: Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas A. Grossman, Yuan Chen, Sopiko Datuashvili

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明、但有时有点丢三落四的机器人助手如何制作电子表格。你给它一个简单的数学问题描述,希望它能交还给你一个组织完美、可以永久使用的 Excel 文件。

这篇论文是一份成绩单,评估那个机器人助手实际表现如何。研究人员托马斯·格罗斯曼(Thomas Grossman)及其团队对五种不同的"AI 助手”进行了测试,看看哪一个能最好地构建可复用的电子表格模型。他们选出了一位优胜者,一款名为Excel AI的工具,然后对它进行了一系列压力测试。

以下是他们研究发现的详细拆解,使用了一些日常类比:

1. 目标:建造“乐高套装”,而非“沙堡”

研究人员希望 AI 构建的电子表格是可复用的

  • 糟糕的方式(沙堡): 想象 AI 直接将数字写入单元格(例如"10"和"12")。如果你稍后想改变房间尺寸,你就必须擦除并重写所有内容。这就像建造沙堡;它看起来不错,但无法轻易重建。
  • 良好的方式(乐高套装): 研究人员希望 AI 将数字放入特殊的“输入”框中,并对其余部分使用公式(例如 =A1*B1)。这就像一套乐高。你可以更换积木(输入数字),整个结构会自动更新。这就是他们所说的ERFR(可复用性的基本要求)。

2. 筛选:寻找最佳助手

团队试用了五种不同的 AI 工具。这就像雇佣了五位不同的承包商来建造一个棚屋。

  • 有些承包商交回了破损的蓝图。
  • 有些则给了他们一张棚屋的照片,而不是棚屋本身。
  • 其中一位承包商,Excel AI,表现最为稳定。它通常能交付一个结构正确、干净且可下载的文件。因此,研究人员决定将所有未来的测试集中在这个工具上。

3. 实验:机器人如何处理不同任务

研究人员给了 Excel AI 八个不同的简单数学问题来解决,例如“计算房间面积”或“计算一个月的苹果成本”。他们测试了三个具体方面:

  • “食谱”测试(数据与变量):

    • 场景 A: “这里有数字:10 和 12。”
    • 场景 B: “这里有数字的名称:长度和宽度。”
    • 结果: 机器人完美地处理了这两种情况。它知道如果未提供数字,就留出空白框供用户稍后填写。
  • “日历”测试(30 天与一个月):

    • 场景 A: “为 30 天执行此操作。”
    • 场景 B: “为一个月执行此操作。”
    • 结果: 这是机器人失足的地方。当被告知"30 天”时,它构建了一个完美的 30 行列表。但当被告知“一个月”时,它感到困惑。有时它会构建当前月份的列表(可能是 31 天或更少),有时它会在单元格中填入实际数字而不是公式。这就像一位厨师能完美遵循"30 分钟”的食谱,但当你说“一小时”时,它却开始猜测。
  • “无意义词汇”测试:

    • 他们使用了一个虚构的单词(如"Zorp")代替真实物体(如“苹果”)。
    • 结果: 机器人完全不在乎。它将"Zorp"与“苹果”同等对待。这是一个成功。

4. 大问题:“魔法八号球”效应

研究人员发现的最大问题是可重复性

  • 如果你两次问机器人完全相同的问题,你可能会得到两个不同的答案。
  • 类比: 想象你问一位人类助手:“给我做个三明治。”第一次,他们给了你一个完美的火鸡三明治。第二次,你问完全相同的问题,他们却给了你一个去掉了面包边的花生酱三明治。
  • 在“墙壁任务”(一个关于建造墙壁的稍复杂问题)中,机器人有时能构建出完美、专业级的模型。其他时候,它构建的模型是破损的,缺少公式,导致 Excel 崩溃。你永远不知道会得到哪个版本。

5. “信心”与“工作流”问题

论文最后总结了任何试图使用该技术的人面临的两大难题:

  • 信心问题:
    如果机器人交给你一个电子表格,你怎么知道它是对的?

    • 类比: 如果一个学生把数学试卷交给你,你可以检查答案。但如果这个学生是一个可能会产生幻觉的机器人,你自己就必须成为一位数学专家来验证它的工作。你不能仅仅信任它。论文指出,你需要一位熟练的工人来双重检查机器人的工作,这违背了使用机器人来节省时间的初衷。
  • 工作流问题:
    有些人争辩说:“也许机器人应该只给我们一个可以修复的‘草稿’。”

    • 类比: 这就像让机器人写小说的第一稿。如果草稿充满了情节漏洞和拼写错误,是修复它更快,还是从头开始写这本书更快?研究人员发现,对于复杂的电子表格,修复机器人混乱的草稿所花的时间往往与你自己做一样多(甚至更多)。

最终裁决

论文的结论是谨慎的。

  • 好的一面: AI 有时可以根据简单的指令构建出美观、看起来专业的电子表格。
  • 坏的一面: 它不一致、不可靠,且往往不可预测。
  • 现实情况: 目前,这些工具尚未准备好投入正式使用。它们在专业用途中不够可靠,而错误可能会导致金钱损失。它们最好被视为一种“起草助手”,需要熟练的人类进行监督、验证和修复工作。

简而言之:这个机器人是一位才华横溢的学徒,有时能建造杰作,有时却会建造纸牌屋。在它学会保持一致性之前,你仍然需要一位大师级建造者(人类)来拿着剪贴板。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →