← 最新论文
💻 computer science

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

本文介绍了 SheetMind,这是一个由大语言模型驱动的模块化多智能体框架,通过由管理者(Manager)、执行(Action)和反思(Reflection)智能体组成的层级系统来自动化电子表格任务,与现有方法相比,在 SheetCopilot 基准测试中实现了卓越的功能正确性和完美的执行可靠性。

原作者: Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个超级聪明但有点丢三落四的机器人如何运行电子表格。你给了它一个庞大且混乱的指令:“删除第五列中以数字开头的项目,让剩下的部分看起来很华丽,然后统计‘Q2’出现了多少次。”如果你只是向一个标准的 AI 提出这样的要求,它可能会试图完成一个巨大的、混乱的跨越,导致程序崩溃,或者因为把步骤搞混了而给你错误的答案。

SheetMind 应运而生,它是一个全新的系统,就像在你电脑内部的一个微型、高度组织化的工厂。SheetMind 并没有让一个机器人去尝试完成所有事情,而是使用了一个由三个专门的“智能体”(Agent,可以理解为具有特定工作的不同工人)组成的团队来完成任务,从而避免了手忙脚乱。

三人协作工厂

  1. 经理(管理者/老板): 当你输入你的请求时,经理并不会直接跳进去执行。它会将你那句复杂的大句子拆解成一份整齐的、简单的步骤清单。这就像一位厨师在阅读一份复杂的食谱,并说道:“首先,切洋葱。第二,翻炒它们。第三,加入酱汁。”这防止了团队试图在一个巨大的锅里就把整顿饭做完。
  2. 执行智能体(构建者): 这个工人负责将经理的简单步骤转化为代码。但最酷的部分在于:这个工人被严格禁止制定自己的规则。它必须使用一套特定的、经过预先批准的“语法”(一种被称为 BNF 的严格构建指令)来构建命令。这就像一套乐高积木,你只能按照物理上可行的方式将零件拼接在一起。这意味着机器人的设计目标是编写出语法有效的命令;经验测试表明,它生成的每一个动作都是可执行的,且不会导致电子表格崩溃。
  3. 反思智能体(检查员): 在构建者完成一个步骤后,检查员并不会仅仅点头说声“做得好”。它实际上会查看变化前后的电子表格,以观察是否符合你的要求。如果构建者不小心把酱汁倒在了错误的盘子里,检查员会立即发现并指出:“嘿,这不对!重试一下。”如果构建者一直犯同样的错误,检查员就会变得更加严格,给出提示并要求构建者尝试不同的策略。

结果:完美的安全性,良好的准确性

研究人员在 SheetCopilot Benchmark 上测试了这个工厂,这是一个包含 221 项不同电子表格任务(从简单的格式设置到复杂的图表和公式)的巨大挑战。他们使用了一种流行的 AI 模型(GPT-3.5-Turbo)来驱动这些工人。

以下是他们的发现:

  • “零崩溃”记录: 在这个包含 221 个任务的特定基准测试中,SheetMind 实现了 100% 的执行成功率。这意味着对于该测试集中的每一个任务,系统都能顺利完成,而没有出现程序崩溃或报错的情况。之前的系统,如 SheetCopilot 和 SheetAgent,在同一个基准测试中的成功率分别为 87.3%94.1%。执行智能体所遵循的严格“语法”规则似乎完全消除了通常会导致程序出错的“语法错误”。
  • “正确答案”得分: 虽然系统在这些测试中从未崩溃,但它并不总是能得到“完美”的答案。SheetMind 在 54.8% 的情况下得到了正确的函数结果。这优于旧的 SheetCopilot 系统(44.3%),但仍落后于 SheetAgent(61.1%)。

为什么它有时会失误

论文指出,SheetMind 无法获得完美分数的主要原因并不是工厂本身出了问题,而是其“大脑”(AI 模型)有时会犯逻辑错误。

在他们对系统未能得到正确答案的 100 个任务进行分析时发现,64% 的失败归因于 AI 本身的推理错误。例如,系统可能正确地构建了一个公式,但却颠倒了两个数字的顺序,或者使用了一个电子表格软件实际上无法计算的函数。检查员(反思智能体)会捕捉到这些错误并要求重做,但有时 AI 会在即使被告知错误之后,仍然不断尝试同样的错误逻辑。

这对你意味着什么

研究人员将这个系统构建为一个真实的 Google Sheets 扩展程序,所以你现在就可以通过聊天来操作你的电子表格。他们发现,“经理”工人在处理困难任务时至关重要;如果没有它,处理复杂指令的成功率会从 71% 骤降至仅为 24%。“检查员”也带来了巨大的提升,它本身就能提高约 12–14% 的成功率。

虽然该系统目前还不是一个能完美解决所有电子表格问题的“魔杖”,但它证明了将大任务拆分为小块,并强制 AI 遵循严格的构建规则,会让其可靠性变得极高。作者认为,随着 AI 模型在推理方面变得更加聪明,SheetMind 的准确性可能会上升,未来甚至可能达到更高的成功率。就目前而言,它是一个承诺在这些特定测试中让你的电子表格永不崩溃的工具,即便它偶尔需要重新审视一下数学计算是否完全正确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →