← 最新论文
💬 NLP

TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering

本文介绍了 TopBench,这是一个旨在评估大语言模型在表格数据上进行隐式预测推理的新基准,结果表明当前模型在意图识别方面存在困难,且往往倾向于简单的查找操作,而非从历史模式中推断未观察到的答案。

原作者: An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一本巨大的、老式的账本,里面记录着人们的健康保险账单。大多数时候,如果你问电脑:“这位 37 岁的男性吸烟者付了多少钱?”它只是在书中查找那个确切的名字并读出数字。这就是旧有的做法。

但如果你问:“我儿子 18 岁,住在东南部,不吸烟,BMI 为 30.14。他的账单会是多少?”电脑无法直接查找他,因为书中还没有他的记录。电脑必须根据它从其他人的历史数据中看到的模式来猜测答案。它必须像个侦探,而不仅仅像个图书管理员。

本文介绍了一项名为TOPBENCH的新测试,旨在检验现代人工智能计算机(大语言模型)是擅长充当侦探,还是仅仅在假装。

问题所在:“图书管理员”与“侦探”

作者发现,大多数 AI 模型都困在扮演图书管理员的角色中。当它们看到关于数据中不存在的人的问题时,就会惊慌失措。它们不是构建预测,而是试图在书中找到最接近的匹配项,然后直接复制那个数字,或者编造一个听起来不错但并非基于数学的数字。它们未能意识到这个问题要求的是预测,而非查找

解决方案:TOPBENCH(侦探考试)

为了解决这个问题,研究人员建立了一项名为TOPBENCH的新考试。它就像 AI 侦探的训练场。他们基于现实世界数据(健康、金融和日常生活)创建了 779 个棘手问题,要求 AI 执行四种特定类型的“侦探工作”:

  1. 单点预测:“这是新人的档案。他的账单是多少?”(就像根据社区趋势猜测你从未见过的房子的价格)。
  2. 决策制定:“这三个人中谁将支付最多?”(比较未来以选出赢家)。
  3. 治疗效果:“如果这个人搬到一个不同的城市并减肥,他的账单会上升还是下降?”(预测变化的结果)。
  4. 排序与筛选:“找出支付金额最高的前 10 个人。”(从庞大的人群中筛选出最佳候选人)。

结果:AI 仍是个新手

研究人员让目前最先进的人工智能模型(如 GPT-5、Claude 和 Gemini)参加了这项考试。结果如下:

  • 它们陷入了“搜索陷阱”:当被要求预测时,AI 经常试图在数据库中搜索完全匹配的条目。如果找不到,它就会困惑。这就像 GPS 试图寻找一条尚不存在的街道,而不是根据地图计算路线。
  • “思考”模型并未提供太大帮助:某些模型具有特殊的“思考”模式,即通过自言自语来解决问题。令人惊讶的是,这往往使它们在这项特定任务上表现得更。它们会陷入循环,一行接一行地检查数据,试图寻找一个不存在的完美匹配,直到耗尽内存。
  • 工具有帮助,但前提是正确使用:当允许 AI 编写和运行代码(如计算器)时,它的表现有所改善。然而,许多模型仍然使用简单的数学运算,而不是构建适当的预测模型。它们试图用锤子而不是螺丝刀来解决复杂的谜题。
  • 专家与通才:专门针对表格训练的模型(如"TableLLM")实际上表现得比通用的智能模型更差。事实证明,擅长阅读表格并不能帮助它们学会如何预测未来。

核心结论

该论文得出结论:虽然 AI 擅长查找已经写好的事实,但在基于数据想象未来方面仍然非常糟糕。

为了变得更好,AI 需要两样东西:

  1. 理解意图:它需要意识到:“哦,这个人不在书中;我需要计算一个答案,而不是查找一个答案。”
  2. 更好的数学技能:一旦它意识到需要计算,它就需要使用复杂的工具(如构建真正的统计模型),而不仅仅是猜测或进行简单的数学运算。

目前,AI 就像一个擅长背诵教科书但在期末考试中不及格的学生,因为它无法将规则应用到新问题中。TOPBENCH 是一项新设计的考试,旨在教会它们如何思考,而不仅仅是记忆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →