想象你是一名金融侦探,试图揪出一家即将破产的公司。问题在于,发现破产就像大海捞针:破产事件极其罕见,而“干草堆”(关于健康公司的数据)却无比庞大。
长期以来,侦探们只能利用微小且过时的干草堆进行练习。本文介绍了一个全新且巨大的干草堆,名为V4FinBench。
以下是研究人员所做工作的简明拆解,使用了日常类比:
1. 新的“训练场”(数据集)
此前,试图预测企业失败的研究人员只能使用仅包含数千条记录的小数据集。这就像试图在微小、低分辨率的屏幕上学习如何玩一款复杂的电子游戏。
- 升级:作者构建了V4FinBench,这是一个包含来自四个中欧国家(波兰、匈牙利、捷克共和国和斯洛伐克)超过110 万条公司记录的庞大数据集,时间跨度达 15 年。
- 细节:他们不仅查看某一年,而是考察了公司从“当下”一直到“未来五年”的表现。
- 标签:他们制定了一项严格的“困境测试”。只有当一家公司同时出现三种困境时,才会被标记为“陷入麻烦”:资不抵债(偿付能力)、亏损(盈利能力)以及无法支付即时账单(流动性)。这确保了他们不会标记那些仅仅只是遭遇单月不佳的公司。
2. 参赛选手(模型)
研究人员让三种不同类型的“侦探”接受测试,看看谁能最准确地揪出捣乱者:
- 老牌专家(梯度提升):这些是经过高度调优的传统统计模型(如 XGBoost)。把它们想象成解决了数千起案件、确切知道该寻找哪些线索的资深侦探。
- 新型"TabPFN"(表格基础模型):这是一种专为电子表格设计的新型人工智能。想象一位侦探阅读了所有已出版的金融教科书,并能通过查看几个示例瞬间学会新案件。然而,由于破产极其罕见,这位侦探经常感到困惑,因为在其训练数据中很少见到“生病”的公司。
- "Llama-3"(大型语言模型):这是一种通常用于撰写故事或回答问题的大型人工智能。研究人员尝试通过将数字行转化为故事格式,教它阅读金融电子表格。这就像请一位才华横溢的文学教授,仅通过将病历当作小说阅读来诊断病人的病情。
3. 结果:谁赢了?
老牌专家 vs. 新型 TabPFN:
- 问题:由于破产极其罕见(数据中不到 1%),“TabPFN"侦探最初被健康公司的汪洋大海所淹没。这就像试图在一桶一百万颗蓝色弹珠中找到一颗红色弹珠;侦探看到的绝大多数都是蓝色。
- 对策:研究人员使用了一个巧妙的技巧,称为**“原型欠采样”**。他们不是向人工智能展示所有健康公司,而是展示经过精心挑选的、具有代表性的样本。这就像向侦探展示一张健康公司的“精选集”专辑,让他们在不会被海量数据搞得厌倦的情况下,学会什么是“正常”。
- 结果:借助这一技巧,TabPFN侦探在提前 2 到 5 年发现麻烦方面,变得与老牌专家一样出色,甚至更胜一筹。
文学教授(Llama-3)vs. 老牌专家:
- 结果:Llama-3模型表现挣扎显著。即使被教导如何阅读金融“故事”,它也无法匹敌老牌专家。它在预测一年以上的麻烦方面尤其糟糕。
- 教训:将电子表格转化为故事并没有帮助这个特定的人工智能。对于结构化的金融数据,“老牌专家”和专门的"TabPFN"仍然是更好的侦探。
4. “迁移”测试
为了验证 TabPFN 侦探究竟是学到了通用的金融规则,还是仅仅死记硬背了欧洲公司的特定怪癖,研究人员将其在一个完全不同的美国数据集上进行了测试。
- 结果:在欧洲数据上训练的 TabPFN 模型,在美国数据上的表现优于其未经训练的标准版本。这表明它学到了财务困境的一般原则,而不仅仅是局部模式。
总结
本文的核心观点是:
- 我们构建了一个巨大且逼真的练习场,用于预测公司破产。
- 如果教会新型人工智能模型(TabPFN)如何处理破产罕见这一事实,它们就能击败老派方法。
- 通用人工智能(Llama-3)尚未准备好取代专门工具来执行这项特定工作。
- 从这些数据中学到的技能似乎可以迁移到其他国家,表明该模型学到了真正的金融逻辑。
重要提示:作者强调,这是一个研究基准。它是供科学家测试和改进其方法的工具,而非供银行在没有人工监督的情况下直接用于做出即时贷款决策的工具。
技术摘要:V4FinBench
问题陈述
企业破产预测是一项高风险的金融任务,其特点是严重的类别不平衡以及多时间跨度预测的需求。尽管该任务对投资者、债权人和监管机构具有实际重要性,但用于研究该问题的公共资源仍然稀缺。广泛使用的免费基准(例如 UCI 波兰、台湾和美国股票市场数据集)通常包含 6,000 到 80,000 个公司 - 年度观测值,这不足以对现代基础模型进行有意义的微调。更大、更丰富的资源确实存在,但它们位于订阅付费墙之后,限制了可复现性,也限制了对需要大量数据进行适配的方法的评估。此外,现有的公共数据集往往缺乏多时间跨度标签或一致的困境定义,使得难以评估依赖于时间跨度的行为,或在现实金融条件下比较不同方法。
方法论与基准构建
为了弥补这些差距,作者引入了V4FinBench,这是一个公共基准,包含来自维谢格拉德集团(V4)经济体(捷克共和国、匈牙利、波兰和斯洛伐克)的1,106,879 个公司 - 年度观测值,时间跨度为 2006 年至 2021 年。
数据与特征
- 来源:数据提取自 EMIS 服务,涵盖 203,900 家独特公司。
- 特征:每个观测值由131 个特征描述,包括公司元数据、财务比率、增长指标、规模指标以及相对于行业的指标。
- 困境定义:与以往依赖正式法律破产申请的研究不同,V4FinBench 使用复合财务困境标准。一家公司仅在其最后报告年度同时满足以下三个条件时,才被标记为陷入困境:
- 偿付能力:权益对总资产为负(<0)。
- 盈利能力:息税折旧摊销前利润(EBITDA)对总资产为负(<0)。
- 流动性:流动比率低于 0.6(<0.6)。
- 多时间跨度任务:该基准定义了六个二元预测任务,对应于未来 h∈{0,1,…,5} 年的时间跨度。对于每个时间跨度,移除困境公司最后 h 年的数据,并将生成的观测值标记为正例。
- 不平衡性:生成的任务表现出严重的类别不平衡,正例比例范围从0.19% 到 0.36%。
评估协议
作者定义了一个固定且可复现的评估协议:
- 折叠:5 折分层交叉验证,在国家内部按公司级别进行分组,以防止数据泄露。
- 预处理:缺失值使用训练集的中位数进行插补;特征使用训练集统计数据进行标准化。
- 指标:鉴于不平衡性,F1 分数和ROC-AUC是主要指标。决策阈值通过在验证折上最大化精确率 - 召回率曲线上的 F1 分数进行校准。
评估方法
本文评估了三类方法:
- 经典表格基线:逻辑回归(LR)、多层感知机(MLP)、随机森林、XGBoost、CatBoost 和 LightGBM。
- 表格基础模型(TabPFN):一种经过微调的预训练上下文学习器,采用感知不平衡的上下文构建。作者比较了构建 10,000 样本上下文的三种策略:
- 无重采样:均匀采样(导致少数类代表性不足)。
- 随机欠采样:将多数类随机子采样至 0.3 的比例。
- 原型欠采样:通过 K-means 聚类选择多数类代表,以保留非困境群体的结构。
- 大型语言模型(LLM):Llama-3-8B,通过QLoRA在格式化为指令式对话的序列化财务记录上进行微调。
主要结果
1. TabPFN 与经典基线对比
- 上下文构建至关重要:原型欠采样为 TabPFN 带来了最佳结果,优于随机欠采样和无重采样。这表明,除了增加少数类的曝光度外,保留多数类的结构多样性至关重要。
- 性能:采用原型欠采样后,TabPFN 在所有时间跨度上的 ROC-AUC 均匹配或超过了梯度提升树(最强的经典基线)。在 F1 分数方面,TabPFN 在即时时间跨度(h=0)上与梯度提升相匹配,并从h=2 开始超越它。
2. LLM 性能(Llama-3-8B)
- 对比:经 QLoRA 微调的 Llama-3-8B 在所有时间跨度上的 ROC-AUC 均落后于梯度提升树(特别是 XGBoost),且在 F1 分数上通常较弱。
- 时间跨度依赖性:LLM 在即时时间跨度上表现最佳,但其排序能力在 h=0 之后急剧下降,在较长时间跨度上接近随机猜测。随着预测时间跨度的增加,LLM 与 XGBoost 之间的差距显著扩大。
3. 跨数据集迁移
- 外部验证:作者在美国破产数据集(不同的经济体、时期和特征集)上评估了经 V4FinBench 微调的 TabPFN 检查点。
- 结果:微调后的模型在 ROC-AUC(0.818 → 0.842)和 F1 分数(0.372 → 0.409)上均优于原始(预训练)TabPFN。这表明该适配过程捕捉到了可迁移的财务困境结构,而不仅仅是过拟合 V4 特有的模式。
意义与贡献
本文做出了三项主要贡献:
- V4FinBench 数据集:一个大规模、公开的财务困境基准,专门设计用于支持基础模型的微调。它涵盖四个国家、六个预测时间跨度和复合困境标准,共 110 万条观测值,解决了大型、免费可访问的金融数据集稀缺的问题。
- 可复现的评估协议:一个标准化框架,用于在现实类别不平衡和多时间跨度预测条件下,比较经典表格方法、表格基础模型和基于 LLM 的方法。
- 实证见解:
- 证明了感知不平衡的上下文构建(特别是原型欠采样)对于将表格基础模型适配到严重不平衡的财务数据至关重要,使其能够与强大的梯度提升基线竞争或超越它们。
- 表明,在这种结构化预测设置中,序列化记录 LLM 微调尚未能与强大的表格基线竞争,特别是在较长的预测时间跨度上。
- 提供了初步证据,表明像 V4FinBench 这样的基准可以支持适应外部分布的迁移,捕捉可复用的财务结构。
作者强调,V4FinBench 旨在用于基准测试和研究,而非直接自动化决策。他们指出了地理范围(中欧)的限制,以及使用复合财务困境标签而非正式法律破产申请的问题,并呼吁在部署前进行额外的验证和公平性分析。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。