UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos
本文介绍了 UniFinEval,这是首个涵盖五个核心金融场景、包含文本、图像和视频的统一多模态基准测试,研究表明,尽管像 Gemini-3-pro-preview 这样的当前模型在性能上处于领先地位,但在处理高密度信息和复杂推理方面,它们仍显著落后于金融专家。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为一个规模宏大、高风险的投资公司招聘一名新助理。这位助理需要是一名“超级分析师”,能够阅读厚重的财务报告、解读复杂的图表、观看数小时的市场分析视频,然后对资金去向做出明智的决策。
长期以来,我们一直在用简单的测试来检验这些 AI 助手——比如让它们读一段话或识别一个简单的图形。但在现实世界中,金融是混乱的。这就像是在阅读地图的同时,还要一边听着广播,一边盯着实时视频画面,在波涛汹涌的大海中航行。旧的测试太简单了,无法反映真实工作的混乱程度。
迎来 “UniFinEval”:终极金融魔鬼训练营
该论文的作者创建了一个全新的、极具挑战性的测试,名为 UniFinEval。你可以把它看作是 AI 模型的“生存课程”,专门用于测试它们是否能够应对高压、信息过载的真实金融环境。
以下是他们构建这个训练营的方式:
1. 训练营的五个等级
测试并非只问一种类型的问题,而是分为五个递进的、符合现实逻辑的情景,难度随之增加:
- 等级 1:侦探(财务报表审计): 想象一名侦探正在观察一个混乱的犯罪现场。AI 必须在一份充满了文本、图表和混乱布局的财务报告中,找出极其微小的矛盾之处。这就像是在有人在你耳边大声叫喊干扰时,要在 100 页的文件中找出一个错别字。
- 等级 2:调查员(公司基本面推理): 现在,AI 需要判断一家公司是否真的健康。它需要从不同的报告中提取数字,进行复杂的数学计算,并将文本描述与图表之间的联系串联起来。这就像是在解一个拼图,而拼图的碎片是用不同的语言编写的。
- 等级 3:趋势观察者(行业趋势洞察): AI 开始扩大视野。它不再仅仅关注一家公司,而是关注整个行业。它必须通过对比数十家公司随时间变化的数据来发现重大模式。这就像是在观看一场足球比赛,并根据场上每一位球员的表现来预测胜负,而不仅仅是看明星四分卫的表现。
- 等级 4:雷达(金融风险感知): 这是令人恐惧的部分。AI 必须在阅读报告和查看图表的同时,观看一段市场分析师说话的视频。它需要从噪音中捕捉到隐藏的危险(风险)。这就像是在飓风中试图听清一声低语。
- 等级 5:将军(资产配置分析): 最终的终极关卡。AI 必须整合前四个等级所学到的所有知识,做出最终的投资决策,平衡所有的风险和规则。这是“将军”必须决定将部队派往何处的时刻。
2. 游戏规则
- 禁止作弊: 测试题目并非由其他 AI 编写(因为 AI 可能会出错或编造事实),而是由真正的金融专家——拥有高级学位并拥有多年从业经验的人员编写。
- 多模态结合: 测试综合使用了文本、图像和视频。你不能仅仅通过阅读来获取答案;你必须“看到”图表并“观看”视频才能理解上下文。
- 规模: 他们创建了近 4,000 个这类高难度问题,涵盖英文和中文。
3. 结果:谁通过了测试?
研究人员让 10 个最聪明的 AI 模型(即“学生”)参加了这个训练营。结果如下:
- 表现最佳者: 其中一个模型,Gemini-3-pro-preview,脱颖而出。它的正确率约为 74%。这听起来不错,但请记住,这是一个非常难的测试。
- 差距: 即便是最好的 AI,与人类专家(正确率约为 90-95%)相比仍有很大差距。AI 擅长阅读文本,但当它需要将视频、图表和报告中的信息联系起来时,就会感到吃力。
- 困境:
- 数学难题: 许多模型在简单的数学运算上出错。
- 幻觉问题: 一些模型会编造不存在的事实(就像一个学生因为害怕说“我不知道”而开始瞎猜)。
- “视频”问题: 当涉及视频时,大多数模型都迷失了。它们无法随着时间的推移保持对故事逻辑的追踪。
- 最终关卡: 在最难的等级(资产配置)中,AI 的表现显著下降。它们可以收集信息,但会在进行最终的复杂决策时感到混乱。
4. 核心启示
论文结论指出,虽然 AI 在阅读和理解简单金融数据方面正变得越来越出色,但在处理复杂、真实的现实情况时,它尚未准备好取代人类金融专家。
可以这样理解:AI 就像是一个能背诵整座图书馆书籍的天才学生。但当你把他们置于一个带有实时视频流、手部颤抖且时钟滴答作响的真实作战室时,他们会开始恐慌并犯错。
作者创建 UniFinEval 是为了向我们展示 AI 在哪里失败,以便开发者可以在信任这些模型处理真实资金之前,修复这些特定的弱点。他们并不是在说 AI 即将掌控股市;他们是在说:“这是一张悬崖边缘的地图,让我们知道 AI 可能会在哪里跌落。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。