这篇论文就像是对这二十个 AI 模型进行的一次大规模、高风险的测试。研究人员设立了一个“金融触点”(Financial Touchstone)挑战赛,这基本上是一个由来自世界各地公司的 495 份真实年报组成的巨大图书馆,并配有关于它们的 2,967 个棘手问题。把它想象成给一个学生一叠 495 本教科书,然后问他:“X 公司在 2022 年赚了多少利润?”或者“主要的三个业务板块是什么?”目标是观察哪些 AI 能够在不编造内容(一个被称为“幻觉”的问题)且不会因为找不到书中的正确页面而卡壳的情况下,找到正确的答案。
结果是一个完全出人意料的剧情转折。长期以来,人们认为你需要一个特殊的“推理”大脑或一个秘密的、专有的模型来处理复杂的财务数学。但这项研究发现,开放权重模型正在快速追赶。事实上,名为 Kimi K2.6 的开放权重模型在总排名中位列第三,击败了几款著名的、秘密的美国模型!表现最好的实际上是一个名为 Claude Opus 4.6 的模型,它的正确率达到了 88.4%。然而,故事中还有一个转折:虽然有些模型非常擅长找到正确答案,但另一些模型则在“不编造内容”方面表现出色。谷歌的 Gemini 2.5 Pro 的造假率最低,幻觉率仅为 0.08%,但它最初寻找答案的能力并不是最好的。
研究人员还发现,所有这些 AI 模型面临的最大问题不是它们的大脑,而是它们的眼睛。近一半的错误(48.9%)都是因为计算机根本无法在庞大的报告中找到正确的页面进行阅读。这就像是一个天才却找不到书架上的书。另一个奇怪的发现是,一些中国模型拥有“安全过滤器”,如果报告中提到了某些政治人物或事件,它们会突然拒绝回答完全正常的财务问题,就像一个学生因为考试题目涉及了某条他们不被允许触碰的规则而拒绝参加考试一样。
那么,底线是什么?这篇论文表明,开放权重模型现在已经足够强大,足以在理解金融方面与世界上最好的秘密模型相竞争。它们不需要成为“推理型”超级计算机也能做得很好;有时,一个更简单的开放模型同样有效。但这项研究也警告说,我们仍有很长的路要走。计算机在阅读方面正在变得更好,但它们在巨大的文档中搜索信息时仍然感到吃力,并且有时会被过于敏感的安全规则所阻碍。作者总结道,虽然我们距离拥有能够处理现实世界财务报告的 AI 助手已经很近了,但在我们可以完全信任它们处理我们的金钱之前,我们仍需解决它们如何搜索信息的问题。
模型表现:Anthropic 的 Claude Opus 4.6 取得了最高准确率(88.4%),紧随其后的是 Claude Sonnet 4.6(86.7%)。值得注意的是,开源权重模型 Kimi K2.6 以 83.5% 的准确率排名第三,超越了人工基准。非推理模型 GLM 5(82.0%)和 Mistral 3(81.3%)也位列前五,这挑战了“推理架构是强金融理解先决条件”的假设。
幻觉 vs. 准确率:Google 的 Gemini 2.5 Pro 保持了最低的幻觉率(0.08%),显著低于人工基准,但其准确率排名第 13 位(76.6%)。相反,Mistral 3 虽然准确率尚可,但幻觉率高达 13.0%。Kimi K2.6 展现出了极佳的平衡性,在准确率排名第三的同时,保持了较低的幻觉率(0.13%)。