← 最新论文
💬 NLP

Reasoning by Commented Code for Table Question Answering

本文提出了一种带有注释的逐步代码生成框架,该框架将表格问答分解为具有自然语言推理的可执行程序,通过增强数值精度和可解释性,在 WikiTableQuestions 基准测试上实现了 84.3% 的最先进准确率。

原作者: Seho Pyo, Jiheon Seok, Jaejin Lee

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Seho Pyo, Jiheon Seok, Jaejin Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《通过带注释代码进行推理以实现表格问答》的解释,使用了简单的语言和日常类比。

问题所在:“线性”大脑 vs. “网格”世界

想象一下,大语言模型(LLM)就像一个非常聪明的读者,但他只能一次读一个词,从左到右地阅读。这对于阅读故事或文章来说效果很好。

然而,表格(如电子表格或财务报告)就像是网格。它们拥有行和列,数据点之间的关系是二维的。如果你强迫一个“读书人”去读一个“网格”,他往往会感到困惑。他可能会忽略顶行的一个数字与底列的一个类别之间的联系。

现有的方法尝试用两种方式来解决这个问题,但两者都有缺陷:

  1. “神奇的直觉”(端到端方法): 模型直接观察表格并猜出答案。这种方法很快,但不擅长数学。这就像要求一个人在脑中进行复杂的除法而不使用计算器;他们可能大概知道答案,但会算错数字。
  2. “单行指令”(旧的代码方法): 模型编写一行代码来解决问题。虽然这使用了计算器(这对数学很有帮助),但它就像一个黑盒。你能看到输入和输出,但你看不见机器是如何得出结果的。如果它犯了错,你根本不知道原因。

解决方案:“食谱”法

论文作者提出了一种教导 AI 的新方法:写一份带有注释的食谱。

AI 不再只是猜测答案或编写晦涩的单行指令,而是被要求编写一个分步执行的 Python 程序(一套给计算机的指令),并且每一个步骤都必须附带一条解释其作用的注释。

这就像写一份烹饪食谱:

  • 旧方法: “做汤。”(你不知道他们是加了盐还是糖)。
  • 新方法(带注释的代码):
    • # 计划:我们需要找到列表中最长的年份。
    • # 过滤:首先,我们要剔除所有关于 "USL A-League" 的行。
    • # 聚合:现在,查看剩余的年份,并选出最大的数字。
    • # 答案:结果是 2004。

通过强制 AI 在“代码”(行动)旁边编写“注释”(推理),模型被迫在行动之前进行逻辑思考。这就像要求学生在数学考试中写出解题步骤一样。如果他们在逻辑上犯了错,注释会揭示问题,而代码执行则会捕捉错误。

他们是如何训练 AI 的

研究人员不仅仅是告诉 AI 这样做,他们还构建了一个特殊的训练系统:

  1. 老师: 他们使用一个非常聪明的 AI,为数千个表格问题生成这些“带注释的食谱”。
  2. 安全网: 如果 AI 编写的食谱无法运行(代码崩溃或给出错误答案),系统并不会直接丢弃它。系统会向 AI 展示错误之处,并要求它再次尝试,修复失败的具体步骤。
  3. “答案选择器”: 他们意识到,有时“食谱”方法擅长数学但不太擅长理解复杂的语言,而“神奇的直觉”方法擅长语言但不太擅长数学。因此,他们构建了一个微小的“裁判” AI。当问题进来时,裁判会观察来自“食谱”方法的答案和来自“神奇的直觉”方法的答案,并挑选出它认为正确的那个。

实验结果

他们在 WikiTableQuestions 上进行了测试,这是一个流行的基准测试,其中的 AI 需要根据混乱的、现实世界的表格(如体育统计数据或财务日志)来回答问题。

  • 独立表现: 他们的“带注释代码”方法,使用了一个相对较小的 AI 模型,实现了 70.9% 的准确率。这击败了之前的最佳“仅代码”方法(准确率为 67.6%)。
  • 团队表现: 当他们将该方法与表现最好的“神奇直觉”模型(Table-R1)结合使用其“裁判”选择器时,准确率跃升至 84.3%

为什么这很重要(根据论文观点)

论文声称,这种方法弥合了“思考”与“执行”之间的鸿沟。

  • 可靠性: 因为数学是由计算机引擎(Pandas)而非 AI 猜测完成的,所以数字是精确的。
  • 透明度: 由于有了注释,人类可以阅读代码并准确理解 AI 为什么选择那个答案。
  • 鲁棒性: 它处理混乱数据(例如写成 "1,234" 的数字或格式奇特的日期)的能力比以往的方法要好得多,因为代码明确地告诉了计算机如何在计算前清洗这些数据。

简而言之,论文表明,如果你强制 AI 在解决表格中的数学问题之前,先写出一套带有解释的分步计划,它就会变得更聪明、更准确,也更易于信任。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →