← 最新论文
💬 NLP

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

本文提出了名为 TraceBack 的多智能体分解框架,旨在通过细粒度的单元格级归因提升表格问答的可解释性与可信度,并配套发布了 CITEBench 基准数据集及无需参考标注的 FairScore 评估指标。

原作者: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

发布于 2026-02-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 TRACEBACK 的新系统,以及它背后的两个重要工具:CITEBENCH(一个考试)和 FAIRSCORE(一个自动评分器)。

为了让你轻松理解,我们可以把“在表格中回答问题”想象成在一个巨大的图书馆里找书并写书评

1. 核心问题:为什么现在的 AI 像“瞎编故事”的导游?

想象一下,你问一个导游:“哪个景点最省钱且风景最好?”
导游回答:“是‘阳光海滩’,只要 30 块钱,风景绝美。”

  • 以前的 AI(旧系统): 它可能真的答对了,但它说不出它是怎么知道的。它可能只是猜的,或者它心里其实查了“门票价格”和“风景评分”这两个数据,但嘴上只说了结果。
    • 风险: 如果它猜错了,你完全不知道它错在哪,也不敢相信它。
  • TRACEBACK 的目标: 它不仅要告诉你答案,还要像侦探一样,把推理过程一步步展示出来:“我是先查了‘门票价格’表(发现阳光海滩便宜),又查了‘风景评分’表(发现它分数高),最后才得出这个结论的。”

2. TRACEBACK:聪明的“多特工”侦探团队

TRACEBACK 不是一个单打独斗的 AI,而是一个分工明确的侦探团队。当面对一张复杂的表格(比如一张包含成千上万行数据的能源价格表)时,它会这样工作:

  1. 筛选员(剪枝): 就像在图书馆里,先把你不需要看的“历史书区”和“科幻区”全部锁上,只留下“旅游指南区”。它先把表格中无关的行和列删掉,只保留可能有关的部分。
  2. 拆解员(分解问题): 如果问题很复杂(比如“找出成本低于 50 且可扩展性大于 3 的最有效能源”),它不会一口吞下,而是把大问题拆成小问题:
    • 第一步:找出所有成本低于 50 的。
    • 第二步:在这些里面,找出可扩展性大于 3 的。
    • 第三步:比较剩下的,谁效率最高?
  3. 定位员(细胞级归因): 这是最厉害的一步。它不仅要找到答案,还要精确指出答案里的每一个词对应表格里的哪一个格子(Cell)。
    • 比如答案说“风力发电,效率 30-45%",它会指着表格里的“风力发电”那一行,“成本”那一列,“效率”那一列,告诉你:“看,这三个格子就是证据。”
    • 它甚至能指出那些没直接写在答案里,但对推理至关重要的格子(比如用来计算时长的“开始时间”和“结束时间”格子)。

比喻: 以前的 AI 像是直接给你看一张最终照片;TRACEBACK 则是给你看整个拍摄过程,包括你调整光圈、对焦、按下快门的每一个瞬间,让你确信这张照片是真实的。

3. CITEBENCH:给 AI 出的“高难度考试”

为了测试这个侦探团队厉不厉害,作者们发现以前的考试(基准测试)太简单了,或者题目出得有问题(比如答案和证据对不上号)。

于是,他们自己出题,建立了 CITEBENCH

  • 内容: 从三个真实的数据集里挑了 1500 道题。
  • 特点: 每一道题都有人工标注的标准答案,而且标注得非常细。不仅标了“答案是什么”,还标了“答案里的每个词对应表格里的哪个格子”。
  • 作用: 就像给侦探团队做了一场严格的“模拟考”,看看它们能不能精准地找到证据。

4. FAIRSCORE:不用标准答案也能打分的“智能裁判”

通常,要检查侦探找得对不对,需要有人工专家拿着标准答案一个个核对,这太贵、太慢了。

作者们发明了一个叫 FAIRSCORE 的自动裁判:

  • 原理: 它不看“标准答案里的格子”,而是看逻辑
    • 它把 AI 找到的证据(表格格子)变成一句话(事实 A)。
    • 它把 AI 给出的答案也变成一句话(事实 B)。
    • 然后它问:“事实 A 能推导出事实 B 吗?”
  • 比喻: 就像老师批改作文。以前老师要拿着“标准范文”来比对(太累);现在 FAIRSCORE 是看你的作文里引用的论据(表格数据)能不能逻辑自洽地支撑你的观点。如果逻辑通顺,就给你高分;如果逻辑不通,就扣分。
  • 好处: 不需要人工标注,就能大规模、快速地给 AI 打分,而且打分结果和人工专家的看法非常接近。

5. 总结:这有什么意义?

  • 对普通人: 以后你问 AI 关于数据的问题(比如“哪个股票最赚钱?”),AI 不仅能告诉你答案,还能把证据摊开给你看,告诉你它是怎么算出来的。你不再需要盲目信任它。
  • 对开发者: 他们有了更好的考试(CITEBENCH)和更好的评分器(FAIRSCORE),可以更快地训练出更靠谱的 AI。

一句话总结:
这篇论文给 AI 装上了“透明眼镜”和“逻辑放大镜”,让它不仅能回答问题,还能像侦探一样,把每一个结论背后的具体证据(表格里的哪个格子)都清清楚楚地指给你看,并且发明了一套自动方法来判断它是不是在“瞎编”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →