TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs
该论文介绍了 TABVERSE,这是一个受控的多模态基准测试,旨在隔离表格表示格式(如 HTML、Markdown、LaTeX 和图像)对模型性能的影响,揭示了结构化文本的表现通常优于图像,但表示形式的选择在不同任务和模型之间会显著影响结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你有一份非常重要的电子表格,其中包含了关于天气、销售额或体育比分的数据。现在,想象你可以通过四种不同的方式将这张同样的表格展示给计算机:
- 作为图片(就像你用手机拍的一张截图)。
- 作为 HTML 代码(网页用来构建表格的语言)。
- 作为 LaTeX 代码(科学家们用来输入复杂文档的语言)。
- 作为 Markdown(一种用于聊天应用和笔记的简单文本格式)。
名为 “TABVERSE” 的论文提出了一个简单但棘手的疑问:我们向 AI 展示表格的方式是否重要?
以往的大多数测试在给出不同表格的同时也给出了不同的格式。这就像是在问:“你能解出这道数学题吗?”但有时是在纸上给题目,有时是在白板上,有时则是耳语。你无法判断 AI 是因为数学题太难而失败,还是因为白板太乱而失败。
TABVERSE 通过解决这个问题,将同一个表格同时以四种格式展示给 AI。这让研究人员能够准确地观察出哪种格式能帮助 AI 更好地思考,以及哪种格式会让它感到困惑。
以下是他们发现的研究结果,通过日常类比进行了解释:
1. “阅读 vs. 观看”测试(问答)
研究人员向 AI 提问,例如:“谁的销量最高?”或“平均价格是多少?”
- 研究发现: 通常情况下,AI 更擅长“阅读”文本代码(如 HTML 或 Markdown),而不是“观看”图片。
- 类比: 想象你正在电话簿中寻找一个特定的名字。
- 文本格式: 这就像把真实的电话簿摊在你面前。你可以扫描字母并轻松找到那个名字。
- 图片格式: 这就像看着一张模糊的电话簿照片。你仍然能看到文字,但你的眼睛必须更加努力地去聚焦,而且你可能会漏掉某个字母。
- 获胜者: HTML 是最可靠的“电话簿”格式。AI 很少会被它搞混。LaTeX 则稍微复杂一些,就像一本用非常华丽、严苛字体编写的电话簿,有时会让读者感到困惑。
2. “地图阅读”测试(结构理解)
接下来,他们要求 AI 扮演制图师的角色。他们问道类似这样的问题:“一共有多少行?”或者“第 3 行第 2 列的内容是什么?”
- 研究发现: 即使 AI 能完美地阅读文本,它在计数行数和定位特定位置方面也表现得相当糟糕。
- 类比: 把 AI 想象成一名拿着地图的游客。
- 列: AI 非常擅长计算南北走向的“街道”(列)。垂直线条很容易辨认。
- 行: AI 在尝试计算东西走向的“大道”(行)时会迷失方向。它经常会忘记顶部的“标题”并不是一条街,或者会对第一条街从哪里开始感到困惑。
- 转折点: 当研究人员给 AI 提供一个文本列表形式的行,而不是图片时,它的计数能力变强了。但即便如此,它在处理“行”的概念时仍然比处理“列”的概念要困难得多。
3. “复印机”测试(重构)
最后,他们向 AI 展示了一张表格图片,并要求它用代码(HTML、LaTeX 或 Markdown)重建这张表格。
- 研究发现: AI 非常擅长复制表格的形状(方框和线条),但在完美复制内容方面表现很差,尤其是在使用 LaTeX 时。
- 类比: 想象要求一个孩子临摹一幅房屋的画作。
- 拓扑结构(形状): 孩子画了一个正方形代表房子,画了一个三角形代表屋顶。他们把“形状”画对了!(这就是论文中所说的“拓扑结构”)。
- 内容(细节): 但是,孩子可能会把“车库”这个词拼错,或者把门画在了错误的位置。
- LaTeX 问题: 要求 AI 用 LaTeX 重建表格,就像要求这个孩子仅使用一套非常严格、复杂的规则来画这栋房子。如果孩子在规则上出了哪怕一点点小错,整幅画就会失效且无法运行。研究发现,许多 AI 模型生成的 LaTeX 代码是“损坏”的,即使看起来没问题,计算机也无法读取。
核心结论
论文得出结论:你向 AI 输入数据的方式与数据本身一样重要。
- 不要想当然: 你不能仅仅因为 AI 在图片上答对了问题,就假设它理解了表格。
- 格式至关重要: 如果你想让 AI 进行复杂的数学运算或寻找特定行,给它一个干净的文本文件(如 HTML)通常比给它一张截图更好。
- “行”的盲点: 即使是最聪明的 AI 模型,在追踪每一行属于哪一行时仍然会遇到困难,经常会对标题产生混淆或数错行数。
简而言之,TABVERSE 就像是 AI 的一场新驾驶测试。它不仅测试汽车是否能驾驶,还测试汽车是在平坦的高速公路(HTML)、颠簸的土路(LaTeX),还是在看地图而不是看路(图片)的情况下开得更好。结果表明,AI 驾驶的“道路”会改变它的表现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。