想象一下,你正在聘请一位财务顾问。你问他们一个问题,比如:“我应该买这只债券吗?”一位真正可靠的顾问不会仅仅猜测答案;他们会首先检查你是否提供了足够的信息。如果你忘记提及你的风险承受能力或当前的通货膨胀率,一位优秀的顾问会说:“我暂时无法回答这个问题;我需要更多细节。”
这篇论文《RealFin》就像是一场严谨的“陷阱测试”,旨在检验 AI 财务顾问(大型语言模型)是否具备同样的谨慎态度。
以下是研究人员所做工作和发现结果的拆解,使用了简单的类比:
1. 陷阱:“缺失配料”的食谱
大多数 AI 测试就像是用完美的食谱烹饪:“混合 2 杯面粉、1 个鸡蛋,烘烤 30 分钟。”AI 只需按步骤操作,然后回答:“蛋糕!”
RealFin 团队改变了游戏规则。他们选取了真实的金融考试题目,并秘密地移除了一个关键配料(例如温度或面粉种类),但让句子看起来依然正常。
- 旧方式:AI 看到了缺失的步骤,但仍试图猜测,说:“我假设是 350 度!”然后给出一个自信的答案。
- RealFin 方式:AI 应该意识到:“等等,如果不知道温度,我就无法烤这个蛋糕。我需要询问那个信息。”
2. 实验:谁掉进了陷阱?
研究人员测试了 15 种不同的 AI 模型,范围从通用的“聪明”AI 到专门的“金融专家”AI。他们向这些模型提出了三种类型的挑战:
- 完整食谱:包含所有信息的问题(简单测试)。
- 缺失配料:包含隐藏漏洞的问题(陷阱)。
- “以上皆非”测试:由于信息缺失,没有任何答案是正确的问题。
结果如下:
- “过度自信”的通才:那些大型通用 AI(即你日常聊天的那些)在承认自己不知道方面表现最差。它们表现得像是一个为了得分而在考试中胡乱猜测答案的学生,即使问题根本无法解决。即使问题本身是残缺的,它们也会自信地说:“答案是 B!”
- “专家”的失败:令人惊讶的是,专门在金融数据上训练的模型往往在识别缺失信息方面表现得更差。因为它们记住了太多的金融术语,一旦遇到“税务”或“审计”等词汇就会被触发,立即开始计算,而忽略了问题本身是不完整的。这就像一位机械师听到“引擎噪音”就立即开始修理化油器,却连检查这辆车是否有引擎都忘了。
- “推理”英雄:少数专为“逐步思考”而设计的新模型(推理增强型模型)表现稍好。它们更有可能停下来,查看缺失的部分,并说:“我无法回答这个问题。”然而,即使它们有时也会过于兴奋,转而开始猜测。
3. 语言转折:英语与中文
论文发现了一个有趣的语言差异:
- 在英语中:当缺失一个关键词时,句子听起来往往会“不对劲”或不完整,因此 AI 更有可能察觉到问题。
- 在中文中:语言非常灵活。你可以移除一个关键条件,而句子听起来依然完全自然且语法正确。AI 很容易被误导,认为问题没问题,从而导致它们胡乱猜测。这就像一句话听起来像是一个完整的故事,但主角却缺失了。
4. 核心结论
论文得出结论:仅仅擅长回答问题是不够的。
在现实的金融世界中,最危险的错误不是算错数学题;而是回答了那些本不该现在回答的问题。
- 当前的 AI 就像一位自信但鲁莽的司机,因为认为自己能冲过去,所以闯红灯加速通过。
- 可靠的 AI 需要像一位谨慎的司机,即使没人看着,也会在红灯前停下,因为他们知道规则。
作者认为,为了让 AI 在金融领域安全应用,它必须学会**“说不”**的技能。它需要知道何时停止推理并问道:“嘿,你忘记告诉我一些重要的事情了。”
简而言之:这篇论文表明,当前的 AI 模型过于急于取悦用户。即使问题本身是残缺的,它们也会猜测一个答案。要变得真正可靠,它们需要学会:有时,正确的答案是“我没有足够的信息”。
技术摘要:RealFin——当用户未言明时,大语言模型在金融推理方面的表现如何?
1. 问题陈述
当前的金融大语言模型(LLM)评估存在一个致命缺陷:它们基于封闭世界假设运行,即预设每个问题都是完全明确的,且仅存在一个正确答案。然而,在现实世界的金融实践中,问题往往是未充分明确的。关键前提(例如监管标准、时间跨度、会计准则或宏观经济假设)经常是隐含的或缺失的。
当面对此类“条件缺失”的问题时,当前的 LLM 倾向于:
- 过度承诺:它们自信地生成答案,通过静默地用学习到的默认值或训练数据偏差来填补缺失的空白。
- 未能拒绝回答:它们缺乏认识论层面的意识,无法识别一个问题在逻辑上是未确定的,且无法从提供的信息中推导出有效答案。
- 误读歧义:这种失败在中文中尤为明显,因为上下文相关的术语可能掩盖缺失的条件,导致模型产生看似合理但缺乏依据的幻觉结论。
该论文认为,可靠的金融 AI 不仅必须在信息充足时给出正确答案,还必须在问题无法回答时识别缺失条件并拒绝回答。
2. 方法论
A. REALFIN 基准测试
作者引入了 REALFIN,这是一个双语(英语/中文)基准测试,旨在评估信息不完整情况下的金融推理能力。
- 数据集构建:从 1,178 道专业的、表述完善的考试风格问题(英语为 CFA 风格,中文为 CPA 风格)出发,作者手动创建了配对的“条件缺失”版本。
- 条件移除:他们系统地移除了逻辑上必要的前提,同时确保剩余文本在语言上仍然合理。被移除的条件分为四类:
- 初始假设:(例如利率体制、通胀预期)。
- 中间链接条件:(例如特定的估值模型如 CAPM/DCF、对冲逻辑)。
- 约束定义信息:(例如财务契约、优先权属性)。
- 标准选择线索:(例如 IFRS 与 GAAP、监管框架)。
- 任务设定:该基准测试在三种不同的设置下评估模型:
- 原始(完整条件):信息完整的标准问答。
- 修订版(条件缺失):移除了前提的问题;模型必须澄清或认识到无法得出唯一答案。
- 以上皆非(NOTA):将修订版中的正确答案选项替换为“以上皆非”。这迫使模型明确识别缺失信息,而不是猜测“最可能”的选项。
B. 实验设置
- 评估模型:测试了 15 个 LLM,分为以下类别:
- 通用型:(例如 GPT-5.1-mini, Claude-3.5-Sonnet, DeepSeek-V3)。
- 金融专用型:(例如 XuanYuan3-70B, Fin-R1-7B, DISC-FinLLM)。
- 推理增强型:(例如 DeepSeek-R1, GPT-OSS 系列,DianJin-R1)。
- 评估协议:零样本设置,要求严格的 JSON 输出格式,包含
reason(推理)、answer(答案)和 confidence(置信度)。
- 指标:原始集与修订集上的准确率,以及一项新颖的推理准确率指标(检查模型的解释是否正确识别了缺失前提)与答案准确率(选择 NOTA)的对比。
3. 主要贡献
- RealFin 基准测试:首个系统评估未充分明确问题金融推理能力的数据集,弥合了学术基准与现实世界歧义之间的差距。
- 双语评估:涵盖英语(CFA)和中文(CPA)金融领域的综合数据集,揭示了模型行为中显著的跨语言差异。
- 新评估范式:超越单纯的答案准确率,评估认识论上的谨慎性——即检测缺失信息并在有正当理由时拒绝回答的能力。
- 综合模型分析:对通用型、专用型和推理增强型模型进行了严格比较,突显了领域特定的微调并不能自动解决过度承诺的问题。
4. 主要结果
A. 性能下降与过度承诺
- 通用模型:令人惊讶的是,通用模型(例如 GPT-5.1-mini, Claude-3.5)在修订版任务中往往优于金融专用模型。然而,这种“成功”很大程度上归因于隐含假设对齐——它们通过偶然猜测或依赖训练数据默认值猜对了缺失条件,而非识别出缺失信息。
- 金融专用模型:早期的金融模型(例如 DISC-FinLLM, FinGPT)表现不佳,往往无法识别缺失条件,并激进地检索领域知识以强行给出答案,导致在 NOTA 设置下的准确率接近零。
- 推理增强模型:像 Fin-R1-7B 这样的模型表现更优。它们更擅长识别缺失前提,并在适当时拒绝回答(选择 NOTA)。然而,它们有时会出现“过度推理”,即使在识别出缺失条件后,仍生成长篇的假设场景。
B. 中文 CPA 中的“死亡地带”
- 一个关键发现是中文特有的失败模式。在中文 CPA 任务中,模型(即使是大型模型)表现出一个“死亡地带”,即它们无法回答条件缺失的问题,在复杂计算中得分往往接近 0%。
- 原因:中文金融术语高度依赖上下文。当移除一个条件后,剩余文本往往仍能构成连贯的句子,误导模型做出激进且缺乏依据的推断。
C. 答案与推理之间的差距
- 答案准确率与推理准确率:在 NOTA 设置下,许多模型选择了正确的“以上皆非”选项,但未能解释原因(推理准确率低)。
- 示例:GPT-OSS-120B 在英文 NOTA 测试中达到了约 89% 的答案准确率,但推理准确率仅为约 20%。它选择 NOTA 是作为一种“安全”选项,而并未理解其中的逻辑缺口。
- 置信度不匹配:即使推理存在缺陷或在进行猜测时,模型也常常表现出高置信度(例如 >90%)。
D. 规模扩展无法解决问题
- 增加模型规模(例如从 200 亿参数增加到 1200 亿参数)提高了答案准确率,但加剧了推理差距。更大的模型对其缺乏依据的假设变得更加自信,导致更高的过度承诺率。
5. 意义与启示
- 重新定义可靠性:该论文认为,可靠的金融 LLM 必须满足三个标准:(1) 信息充足时回答正确;(2) 条件缺失时识别缺失条件;(3) 不存在有效答案时拒绝回答。
- 自动化风险:当前仅测量表述完善问题的答案准确率的基准测试,危险地高估了 LLM 在高风险金融决策中的可靠性。
- 未来方向:作者提出了一种结合专用监督微调(SFT)(用于专业知识)和逻辑驱动强化学习(RL)(用于惩罚猜测并奖励明确识别缺失信息)的训练流程。他们还建议从被动拒绝转向主动澄清,即模型向用户询问缺失的数据。
结论:RealFin 表明,当前的 LLM 无论规模大小或领域专业化程度如何,都难以区分“可解决”与“不可解决”的金融问题。金融领域的真正可靠性需要模型具备在必要信息缺失时说“我不知道”的谦逊,而不是自信地幻觉出一个解决方案。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。