← 最新论文
💰 quantitative finance

Can Open-Weight Models Compete on Financial Text Comprehension?

本文通过对二十个模型进行更新后的 Financial Touchstone 基准测试评估,揭示了尽管存在持续的信息检索瓶颈以及中国模型中不一致的地缘政治拒绝行为,但像 Kimi K2.6 这样的开源权重模型在金融文本理解方面仍能与专有系统相媲美。

原作者: Jan Spörer

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jan Spörer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机正在学习像人类一样阅读、写作和推理的世界。这个被称为人工智能(AI)的领域,最近涌现出了许多能够聊天、解决数学问题甚至编写代码的新模型。但问题在于:许多这些超级聪明的计算机都是“黑盒”。我们知道它们有效,但并不确切了解它们是如何构建的,也不了解其代码内部隐藏着什么秘密。最近,来自中国实验室的一波新模型出现了,它们是“开放权重”的,这意味着它们的蓝图是公开的,任何人都可以研究,这与来自美国大型科技公司的那些秘密、封闭的版本不同。每个人心中都在思考一个大问题:这些开放、公开的模型真的能胜任阅读财务报告并寻找真相这种艰苦、枯燥但又极其重要的工作吗?还是说它们仅仅是擅长听起来很聪明而已?

这篇论文就像是对这二十个 AI 模型进行的一次大规模、高风险的测试。研究人员设立了一个“金融触点”(Financial Touchstone)挑战赛,这基本上是一个由来自世界各地公司的 495 份真实年报组成的巨大图书馆,并配有关于它们的 2,967 个棘手问题。把它想象成给一个学生一叠 495 本教科书,然后问他:“X 公司在 2022 年赚了多少利润?”或者“主要的三个业务板块是什么?”目标是观察哪些 AI 能够在不编造内容(一个被称为“幻觉”的问题)且不会因为找不到书中的正确页面而卡壳的情况下,找到正确的答案。

结果是一个完全出人意料的剧情转折。长期以来,人们认为你需要一个特殊的“推理”大脑或一个秘密的、专有的模型来处理复杂的财务数学。但这项研究发现,开放权重模型正在快速追赶。事实上,名为 Kimi K2.6 的开放权重模型在总排名中位列第三,击败了几款著名的、秘密的美国模型!表现最好的实际上是一个名为 Claude Opus 4.6 的模型,它的正确率达到了 88.4%。然而,故事中还有一个转折:虽然有些模型非常擅长找到正确答案,但另一些模型则在“不编造内容”方面表现出色。谷歌的 Gemini 2.5 Pro 的造假率最低,幻觉率仅为 0.08%,但它最初寻找答案的能力并不是最好的。

研究人员还发现,所有这些 AI 模型面临的最大问题不是它们的大脑,而是它们的眼睛。近一半的错误(48.9%)都是因为计算机根本无法在庞大的报告中找到正确的页面进行阅读。这就像是一个天才却找不到书架上的书。另一个奇怪的发现是,一些中国模型拥有“安全过滤器”,如果报告中提到了某些政治人物或事件,它们会突然拒绝回答完全正常的财务问题,就像一个学生因为考试题目涉及了某条他们不被允许触碰的规则而拒绝参加考试一样。

那么,底线是什么?这篇论文表明,开放权重模型现在已经足够强大,足以在理解金融方面与世界上最好的秘密模型相竞争。它们不需要成为“推理型”超级计算机也能做得很好;有时,一个更简单的开放模型同样有效。但这项研究也警告说,我们仍有很长的路要走。计算机在阅读方面正在变得更好,但它们在巨大的文档中搜索信息时仍然感到吃力,并且有时会被过于敏感的安全规则所阻碍。作者总结道,虽然我们距离拥有能够处理现实世界财务报告的 AI 助手已经很近了,但在我们可以完全信任它们处理我们的金钱之前,我们仍需解决它们如何搜索信息的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →