← 最新论文
💰 quantitative finance

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

本文介绍了 UniFinEval,这是首个涵盖五个核心金融场景、包含文本、图像和视频的统一多模态基准测试,研究表明,尽管像 Gemini-3-pro-preview 这样的当前模型在性能上处于领先地位,但在处理高密度信息和复杂推理方面,它们仍显著落后于金融专家。

原作者: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin
发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一个规模宏大、高风险的投资公司招聘一名新助理。这位助理需要是一名“超级分析师”,能够阅读厚重的财务报告、解读复杂的图表、观看数小时的市场分析视频,然后对资金去向做出明智的决策。

长期以来,我们一直在用简单的测试来检验这些 AI 助手——比如让它们读一段话或识别一个简单的图形。但在现实世界中,金融是混乱的。这就像是在阅读地图的同时,还要一边听着广播,一边盯着实时视频画面,在波涛汹涌的大海中航行。旧的测试太简单了,无法反映真实工作的混乱程度。

迎来 “UniFinEval”:终极金融魔鬼训练营

该论文的作者创建了一个全新的、极具挑战性的测试,名为 UniFinEval。你可以把它看作是 AI 模型的“生存课程”,专门用于测试它们是否能够应对高压、信息过载的真实金融环境。

以下是他们构建这个训练营的方式:

1. 训练营的五个等级

测试并非只问一种类型的问题,而是分为五个递进的、符合现实逻辑的情景,难度随之增加:

  • 等级 1:侦探(财务报表审计): 想象一名侦探正在观察一个混乱的犯罪现场。AI 必须在一份充满了文本、图表和混乱布局的财务报告中,找出极其微小的矛盾之处。这就像是在有人在你耳边大声叫喊干扰时,要在 100 页的文件中找出一个错别字。
  • 等级 2:调查员(公司基本面推理): 现在,AI 需要判断一家公司是否真的健康。它需要从不同的报告中提取数字,进行复杂的数学计算,并将文本描述与图表之间的联系串联起来。这就像是在解一个拼图,而拼图的碎片是用不同的语言编写的。
  • 等级 3:趋势观察者(行业趋势洞察): AI 开始扩大视野。它不再仅仅关注一家公司,而是关注整个行业。它必须通过对比数十家公司随时间变化的数据来发现重大模式。这就像是在观看一场足球比赛,并根据场上每一位球员的表现来预测胜负,而不仅仅是看明星四分卫的表现。
  • 等级 4:雷达(金融风险感知): 这是令人恐惧的部分。AI 必须在阅读报告和查看图表的同时,观看一段市场分析师说话的视频。它需要从噪音中捕捉到隐藏的危险(风险)。这就像是在飓风中试图听清一声低语。
  • 等级 5:将军(资产配置分析): 最终的终极关卡。AI 必须整合前四个等级所学到的所有知识,做出最终的投资决策,平衡所有的风险和规则。这是“将军”必须决定将部队派往何处的时刻。

2. 游戏规则

  • 禁止作弊: 测试题目并非由其他 AI 编写(因为 AI 可能会出错或编造事实),而是由真正的金融专家——拥有高级学位并拥有多年从业经验的人员编写。
  • 多模态结合: 测试综合使用了文本、图像和视频。你不能仅仅通过阅读来获取答案;你必须“看到”图表并“观看”视频才能理解上下文。
  • 规模: 他们创建了近 4,000 个这类高难度问题,涵盖英文和中文。

3. 结果:谁通过了测试?

研究人员让 10 个最聪明的 AI 模型(即“学生”)参加了这个训练营。结果如下:

  • 表现最佳者: 其中一个模型,Gemini-3-pro-preview,脱颖而出。它的正确率约为 74%。这听起来不错,但请记住,这是一个非常难的测试。
  • 差距: 即便是最好的 AI,与人类专家(正确率约为 90-95%)相比仍有很大差距。AI 擅长阅读文本,但当它需要将视频、图表和报告中的信息联系起来时,就会感到吃力。
  • 困境:
    • 数学难题: 许多模型在简单的数学运算上出错。
    • 幻觉问题: 一些模型会编造不存在的事实(就像一个学生因为害怕说“我不知道”而开始瞎猜)。
    • “视频”问题: 当涉及视频时,大多数模型都迷失了。它们无法随着时间的推移保持对故事逻辑的追踪。
    • 最终关卡: 在最难的等级(资产配置)中,AI 的表现显著下降。它们可以收集信息,但会在进行最终的复杂决策时感到混乱。

4. 核心启示

论文结论指出,虽然 AI 在阅读和理解简单金融数据方面正变得越来越出色,但在处理复杂、真实的现实情况时,它尚未准备好取代人类金融专家

可以这样理解:AI 就像是一个能背诵整座图书馆书籍的天才学生。但当你把他们置于一个带有实时视频流、手部颤抖且时钟滴答作响的真实作战室时,他们会开始恐慌并犯错。

作者创建 UniFinEval 是为了向我们展示 AI 在哪里失败,以便开发者可以在信任这些模型处理真实资金之前,修复这些特定的弱点。他们并不是在说 AI 即将掌控股市;他们是在说:“这是一张悬崖边缘的地图,让我们知道 AI 可能会在哪里跌落。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →