← 最新论文
💬 NLP

Confidence Estimation for Financial Vision-Language Models in Chart and Document Understanding

本文评估了金融视觉语言模型的置信度估计方法,发现虽然仅基于推理的基准模型缺乏安全自动化所需的校准能力,但特定的训练探针可以有效地将可靠答案与幻觉区分开来,尽管能够安全自动化的任务总量仍受限于模型内在的能力水平,而非仅仅取决于其置信度分数。

原作者: Reza Khanmohammadi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Mohammad M. Ghassemi

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Reza Khanmohammadi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Mohammad M. Ghassemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位飞船船长,但你航行的不是星辰大海,而是由金融图表、股票表格和复杂文档组成的海洋。你有一位非常聪明、反应极快的机器人助手(AI),它能够阅读这些文档并回答你的问题。这个机器人擅长发现模式,但有时它会过于自信。它可能会对着一张白纸,自信满满地告诉你某只股票的价格;或者它在阅读图表时,虽然听起来极其笃定,却读错了数字。在金融世界里,出错不仅仅是一个小失误,它可能意味着损失数百万美元。因此,核心问题不仅是“这个机器人是否聪明?”,而是“我们现在能否信任它所说的话?”

为了解决这个问题,科学家们一直在教机器人给自己一个“置信度评分”——一个从 0 到 1 的数值,用来表达:“我非常确定我是对的”或“我只是在瞎猜”。这就像天气预报。如果气象学家说有 90% 的降水概率,你会带上伞;如果他说只有 10%,你就留在家里。但如果气象学家是个骗子,无论天空看起来如何都始终说“90%”呢?你会被淋成落汤鸡。这篇论文正是关于测试我们的金融机器人助手是诚实的天气预报员,还是自信的骗子。研究人员想要看看,当我们使用的检查工具面对的是它从未见过的复杂金融图表,而非普通的猫狗图片时,是否还能有效检测机器人的置信度。

机器人的“直觉”测试

研究人员设计了一个大规模实验,测试了七种检查 AI 是否在说实话的方法。他们使用了五种不同的“智能”AI 模型,并要求它们解决来自三个不同金融题库的问题。这些测试包括阅读股票图表、分析公司报告,甚至还要回答英文和中文的问题。问题的关键在于:用于检查 AI 置信度的工具仅在普通的日常图片(如坐在垫子上的猫)上进行了训练,然后就被直接扔进了金融领域的深海中进行测试。这就像是带一名只在平静泳池里练习过的救生员,去拯救风暴中的海洋里的溺水者。

团队发现了三个重大发现,这对任何希望让 AI 单独掌舵的人来说都是一次警钟。

1. 仅仅做到“排序”是不够的;你还需要做到“诚实”
第一个发现是,许多用于检查置信度的工具擅长将答案从“最佳猜测”到“最差猜测”进行排序,但在表达“有多确定”方面表现得很糟糕。想象一个学生在考试。一个“排序”工具可能会说:“这个答案比那个好”,但它可能会给两个答案都打出 100% 的置信度,即便学生只是在瞎猜。研究人员发现,标准的、易于使用的评估方法存在严重的过度自信问题。它们给出错误答案的置信度为 90% 的频率,几乎与给出正确答案时一样高。这是非常危险的,因为如果你设定一条规则——“只信任置信度高于 80% 的答案”,你仍然会信任大量的错误答案。

然而,两种特殊的工具(称为“探针”)通过观察 AI 的内部机制表现得更好。它们是“经过校准的”,这意味着如果它们说有 80% 的把握,那么实际情况确实是 80% 的时间是对的。这些是仅有的可以被用来在“自动化执行”与“询问人类”之间划定安全界限的工具。

2. 没有“一劳永逸”的解决方案
第二个发现是,你不能只选一个“最好的”工具并永远使用它。最好的工具取决于 AI 在做什么以及使用的是哪种 AI 模型。这就像是在工具箱里寻找最好的工具:锤子对钉子很管用,但对螺丝钉却很糟糕。

  • 当 AI 查看简单的图表时,一种工具效果最好。
  • 当它阅读复杂的文档时,另一种工具更合适。
  • 当任务是中文时,排名又发生了变化。

研究人员发现,在 20 个不同的场景中,没有一个工具能在超过 8 个场景中胜出。这意味着,如果你只是看一个通用的排行榜并挑选其中的“顶尖”工具,你很可能会选错适合特定工作的工具。AI 的可靠性不是全局性的属性,而是局部且混乱的。

3. AI 的技能水平决定了上限
第三个发现关于你可以交给机器人多少工作量。研究人员问道:“在我们需要停止并检查剩余部分之前,我们可以让机器人自动回答多少个问题?”他们发现,答案主要取决于机器人本身的聪明程度。

  • 对于简单的任务(如阅读简单图表),如果使用了正确的置信度工具,机器人可以处理相当一部分工作。
  • 对于困难的任务(如复杂的金融文档),机器人出错的频率如此之高,以至于即使是最好的置信度工具也无法挽救局面。在这种情况下,“安全的”自动化程度几乎为零。

事实证明,置信度工具并不能让一个差的机器人变好;它只是帮助你判断机器人何时表现不佳。该工具的价值主要体现在机器人遇到困难时,通过帮助你捕捉错误来体现。但如果机器人本身已经有一半的时间在出错,再多的置信度检查也无法让它安全地独立工作。

识破谎言的“魔法”工具

研究人员测试的最有趣的工具之一叫做 BICR。这个工具有一个特别的技巧:它能识别 AI 是否忽略了图像,而仅仅根据其训练知识在编造内容。
假设 AI 被问到:“这张图表的最高点在哪里?”如果 AI 正在关注图像,它会观察图表。如果它忽略了图表,它可能会根据常识来猜测一个数字。BICR 工具可以检测到 AI 是否在忽略图表。当 AI 试图在不看图表的情况下进行回答时,BICR 会降低其置信度得分。这就像是一个知道机器人在“空谈”而非利用数据进行回答的测谎仪。这一点至关重要,因为在金融领域,AI 最可怕的错误就是给出一个听起来流利、自信,但却与实际数据毫无关系的答案。

底线

论文总结道,虽然 AI 正在变得越来越聪明,但我们还没有准备好让它单独驾驶飞机。测试的五种 AI 模型还不足以在金融领域所需的极高安全标准下,独立处理金融图表和文档。

目前最好的方法是采用“置信度门控”系统。这意味着 AI 可以处理简单的任务,但必须有一个“人类在环(human in the loop)”来检查困难的部分。只有当置信度工具显示置信度很高,且该工具是经过校准(诚实)的时,才允许 AI 执行操作。如果工具显示“我不确定”或“AI 正在忽略图表”,则必须将该问题提交给人类专家。

简而言之,AI 是一个非常快速、非常有自信的实习生。它可以承担大量的琐碎工作,但你需要一位懂得如何阅读实习生置信度计数的监督者,以确保他不会不小心把数百万美元转入错误的账户。实现这一目标的工具是存在的,但必须针对特定任务进行仔细选择,而且这些工具无法修复一个根本无法胜任该任务的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →