当最终使用这种更严格的多运行方法进行分析时,AI 未能超越传统方法。它生成的合成数据在匹配真实市场历史形态方面,不如那些更古老、更简单的统计模型。事实上,一个经过训练专门识别真伪数据的程序,能够以百分之百的准确率识破该 AI 生成的伪造数据。该 AI 始终无法捕捉到对风险管理最重要的极端罕见事件,它创造的数据与混乱的现实市场相比过于平滑且过于可预测。最重要的是,AI 产生的风险评估极不稳定。完全取决于使用了哪种随机种子,该模型对奈拉潜在损失的预测差异幅度约为两倍半。一次运行可能表明损失仅略高于 1%,而另一次在完全相同数据上的运行则显示损失接近 3%。这个范围如此之宽,以至于涵盖了所有其他测试方法的预测值,从传统模型到简单的历史平均值。
研究结论认为,对于数据匮乏的前沿市场,这类先进的 AI 尚不足以作为独立的安全性检查工具。历史信息的缺乏导致模型处于“识别不足”的状态,这意味着数据中没有足够的证据让计算机确定一个单一且可靠的答案。它产生的不是清晰的未来图景,而是一个可能性迷雾,其结果取决于研究人员无法控制的随机数。研究人员认为,在这种技术能在现实世界的风险管理部门中获得信任之前,需要将其与其他方法相结合,在来自更稳定市场的更大规模数据集上进行训练,并且始终要在许多不同的随机起点上进行测试,以确保结果并非仅仅靠运气。在此之前,理解像奈拉这样货币风险最可靠的方法仍然是传统的统计方法,虽然这些方法更简单,但能提供当前一代 AI 还无法提供的稳定性。
监管启示: 研究结果支持巴塞尔委员会从 VaR 向预期不足(ES)的转变。因为 TimeGAN 会产生不稳定的尾部估计,依赖单一的 VaR 数值是危险的。同时报告 ES 与 VaR,并结合多个种子进行评估,可以提供一个更稳健(尽管仍不完美)的尾部风险视图。
未来方向: 本文建议,若要使 GAN 在前沿市场具有可行性,需要:
迁移学习: 在发达市场语料库上进行预训练,以引入结构先验。
结构先验: 引入基于特征或图结构的架构(例如 Sig-Graph GAN)来编码路径规律。
尾部感知目标: 显式针对峰度和尾部行为的损失函数。
标准化报告: 该领域必须采用多种子报告制度,以表征模型的方差,而不只是准确性。
结论 本文得出结论,对于前沿市场的风险函数而言,基于 GAN 的场景生成尚未准备好作为一种独立的工具。不应基于单次训练运行来部署它。相反,它只能被视为多个输入之一,在经过与经典基准进行三角测量并跨多个种子进行特征化处理后,其尾部风险输出才能被信任。其主要贡献在于通过一次批判性的、自我反思性的演示表明:在缺乏足够数据或结构约束的情况下,前沿市场的生成模型会产生不稳定且不可重现的风险估计。