✨ 要点🔬 技术摘要
想象一下你是一位烹饪节的评委。通常情况下,评委手里都有一张“完美”的食谱卡。如果参赛者的菜肴味道哪怕只与这张卡片有细微差别,就会被扣分。但如果制作美味千层面的方法其实有十种呢?如果所谓的“完美”食谱仅仅是一个人的观点,而参赛者的版本同样美味,只是使用了不同的香料呢?这就是科学家在测试人工智能处理复杂任务(如金融建模)时面临的问题。金融建模就像是为一家公司的未来构建一台精密的预测机器;它融合了硬性事实(如过去的销售额)与合理的推测(如公司的增长速度)。几十年来,我们通过将 AI 的预测与某一位专家的答案进行对比来测试它。但如果专家们本身对最佳预测也存在分歧,那么因为 AI 给出了一个不同但合理的答案就惩罚它,似乎并不公平。这篇论文提出了一个问题:当不存在唯一的“正确”答案时,我们该如何为 AI 打分?
这项名为 GAUGE 的研究背后的研究人员决定不再假装存在唯一的完美金融模型。他们构建了一个新的测试场,旨在观察 AI 智能体是否能够构建这些复杂的金融“预测机器”,更重要的是,它们能否做出人类专家所做的那种内部“判断”。
首先,他们测试了旧的评分方式。他们选取了针对同一家公司由不同人类专家构建的 108 对金融模型。当他们使用旧有的“单一完美答案”规则,将一位专家的模型与另一位专家的模型进行对比评分时,结果令人震惊。中位分仅为 0.33(总分 1.0)。事实上,92.6% 的配对得分低于 0.70。这意味着,即使是专业的专业人士,由于他们都是专家,也经常产生如此大的分歧,以至于如果你将其中一人视为“真理”,你就会判定另一人不及格。事实证明,在金融领域,“不同”并不意味着“错误”。
为了解决这个问题,团队创建了 GAUGE (无需“黄金答案”的智能体构建金融模型评分系统)。他们没有采用单一的食谱卡,而是根据现实中专家的实际行为创建了一个“安全包络线”。想象一个靶盘,其靶心不是一个点,而是一个宽阔的圆环。如果 AI 的预测落在那个“合理专家行为”的圆环内,它就能获得分数。该系统检查两件事:
机制(The Mechanics): 数学运算是否正确?电子表格是否平衡?(就像检查烤箱是否真的打开了一样)。
判断(The Judgment): AI 的预测是否落在现实中专家认为可辩护的范围内?(就像检查调味是否在优秀厨师的口味范围内一样)。
他们使用这个新系统测试了 24 个不同的 AI 智能体,以及一组由金融系学生到资深分析师组成的 55 名人类样本。以下是他们的发现:
AI 擅长数学,但不擅长直觉。 AI 智能体在机械部分表现出色。最优秀的 AI 通过了 93% 的机制检查(确保电子表格公式正确)。然而,在涉及判断的部分(即进行实际预测)时,最优秀的 AI 仅通过了 78%。
“差距”是真实存在的。 平均而言,AI 智能体在构建模型方面的表现比在进行估值判断方面高出 26 分。它们能造出汽车,但还不太擅长驾驶。
人类依然胜出。 最优秀的 AI 得分为 53.4。这优于平均水平的金融系学生(43.2),但逊于每一位资深分析师(其平均分为 88.3)以及大多数初级分析师。AI 足以聪明到完成作业,但还不够聪明到能够担任领导。
这项研究表明,虽然 AI 在构建复杂的金融模型方面正变得非常有能力,但最难的部分——即利用专家所使用的细致且可辩护的判断来评估一家公司的价值——仍然是一个重大的挑战。作者们不仅发现了一个分数,他们还证明了旧有的评分方式(寻找唯一完美答案)对人类和机器都是不公平的,并提供了一种新的衡量进步的方法,这种方法尊重了专家分歧这一混乱的现实。
技术摘要:GAUGE —— 在缺乏“标准答案”的情况下对构建的金融模型进行评分
1. 问题陈述
金融建模涉及将公开披露的数据与分析师假设相结合,以生成预测和估值。虽然这些模型的机械组成部分(例如,历史数据的准确性、会计恒等式的平衡)是具有客观可验证性的,但估值组成部分(例如,营收预测、折现率、目标价)本质上允许存在多种合理的答案。
现有的金融 AI 智能体基准测试通常根据单一专家编写的参考答案 (即“标准答案”)来对输出进行评分。作者认为,这种方法在处理估值任务时存在缺陷,因为它会惩罚那些与特定参考分析师意见不一致的智能体,即使该智能体的假设是合理的且符合专业实践。这种设计将“专业分歧”与“模型错误”混为一谈,未能考虑到开放式金融人工制品中固有的“评级不确定性”。
本文通过对独立构建的分析师模型进行相互评分,实证地展示了这一问题。在涵盖 65 家公司的 108 对定向配对中,使用单参考点容差法的中位分数为 0.33 ,且 92.6% 的配对得分低于 0.70。没有任何一对同年度的模型在隐含股价上达成 10% 以内的共识。这表明,标准的点容差评分法惩罚了即使在专业分析师之间也普遍存在的自然分歧。
2. 方法论:GAUGE 基准测试
为了解决单参考点评分的局限性,作者引入了 GAUGE ,这是一个旨在根据观察到的分析师实践 而非单一数值点来评估智能体构建的估值模型的基准测试。
2.1 语料库与任务设计
语料库: 该基准测试构建自 1,001 个经供应商分类的分析师工作簿 ,涵盖 922 个股票代码及 25 个 GICS 行业。
任务格式: 评估集包含 196 个任务 (其中包含用于智能体评估的 48 个核心任务)。智能体接收的是“Excel 输入 / 模型输出”型任务:它们会被提供原始的历史数据、细分结构框架和指导说明,但 共识预测值会被隐藏 。
交付物: 智能体必须生成一个由公式驱动的模型、估值、敏感性分析、假设文件以及一份备忘录。
数据完整性: 语料库经过脱敏处理,并保留了一个“暂存刷新池”(约 600 个工作簿)用于未来的纵向评估,以防止数据污染。
2.2 评分系统
GAUGE 采用了一个多层评分堆栈,将机械正确性与判断力分离:
三层防御包络线(Defensibility Envelope): 并非针对单一数值,而是针对从观察到的实践中推导出的范围对带有判断性质的数量进行评估。
E-method(方法论 E): 使用特定工作簿内多方法数值及其敏感性网格的最小值/最大值。
E-industry(行业 E): 使用行业内假设的 P10–P90 分布。
E-company(公司 E): 利用覆盖同一公司的多位分析师之间的离散度来校准区间。
评分方式: 数值位于紧凑区间内得 2 分;位于扩大的“近邻”区间内(由 P90 分歧度扩展)得 1 分;落在区间外得 0 分。
56 个维度(Facets): 系统评估 56 个特定维度,分为以下类别:
29 个确定性维度 (D): 结构性检查(如公式链接、会计恒等式)。
23 个 LLM 判定维度 (J): 对假设和逻辑的定性评估。
4 个直接规则维度 (R): 特定的基于规则的检查(如 WACC 区间成员身份)。
有效性门槛 (G1–G8): 八个确定性门槛用于检测结构性失败(例如,资产负债表不平衡、循环引用、前瞻性数据污染)。如果触发门槛,将实施 评分上限(Ceap) ,防止结构性失效的模型即便局部输出合理也能获得高分。
考虑失败情况的评分 (ϕ 0 \phi_0 ϕ 0 ): 主要指标会对未完成的任务或能力失败的情况赋予 0 分,确保智能体不会通过仅完成部分任务而获得高分。
3. 实验设置
智能体: 对来自 12 家供应商(包括 Claude、GPT-5 变体、Gemini、Kimi、Qwen 等)的 24 个智能体进行了评估,使用的是 48 个核心任务。
人类基准: 进行了一项针对 55 名参与者的已知组研究 ,分为三组:高级分析师(12 人)、初级分析师(18 人)和金融系学生(25 人)。参与者在相同的约束条件下工作(无网络访问、相同的输入),但没有严格的时间限制。
评估协议: 智能体使用标准化的工具调用框架。每个任务针对每个智能体仅运行一次,以避免最佳情况偏差。
4. 关键结果
4.1 智能体表现 vs. 人类
在考虑失败情况的评分 ϕ 0 \phi_0 ϕ 0 上:
高级分析师: 平均 88.3
初级分析师: 平均 66.0
金融系学生: 平均 43.2
最佳智能体 (Claude Fable 5): 得分为 53.4 。
该得分高于学生平均水平,但 低于所有高级分析师 ,且 低于 18 名初级分析师中的 15 名 。
55 名人类参与者中有 33 人得分高于该最佳智能体。
4.2 机械性 vs. 判断力的差距
一个关键发现是智能体在构建模型的能力与行使估值判断能力之间的差距:
机械性维度: 最佳智能体通过了 93% 的机械性维度(结构/公式正确性)。
判断力维度: 最佳智能体仅通过了 78% 的判断力维度。
全量中位数差距: 在 24 个智能体中,机械性通过率与判断力通过率之间的中位差距为 26 个百分点 。
结论: 当前的智能体在模型构建方面明显强于估值判断。
4.3 有效性与稳定性
已知组排序: 基准测试成功地按经验水平对人类进行了排序(高级 > 初级 > 学生),且具有高度统计显著性(p < 10 − 6 p < 10^{-6} p < 1 0 − 6 )。
门槛影响: 移除有效性门槛会导致 276 对模型排序中的 11 对发生逆转,证实了结构性检查对于防止损坏模型获得虚高分数是必要的。
评判稳定性: 单一冻结评判员(5 次抽样)的重复投票显示 Kendall's τ \tau τ 为 0.944,表明采样具有高度稳定性。
5. 重要性与主张
本文提出了三个主要贡献:
对单参考点假设的实证检验: 文中证明了针对单一专家参考点进行评分在估值任务中存在问题,因为即使在产生内部一致的模型时,专业分析师在关键输入(WACC、终值增长率、隐含股价)上也经常存在分歧。
引入 GAUGE: 它提供了一个将机械验证与判断评估解耦的基准,利用“观察到的实践包络线”来对合理的选择进行评分,而非寻找完全一致的答案。
识别智能体能力: 它确立了虽然智能体正变得能够实现金融模型构建的自动化,但估值所需的“判断力”仍然是一个重要的瓶颈。
作者强调,GAUGE 并不声称建立了估值的“地面真值”(Ground Truth,因为存在多个合理的答案),而是提供了一个框架,用于评估智能体的选择是否落在专业实践的观察范围内。该成果包含了方法论、分层的数据拆分以及版本化的纵向核心,以支持可复现且受控于污染评估的评估过程。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。