← 最新论文
💰 quantitative finance

Beyond ESG Scores: Learning Dynamic Constraints for Sequential Portfolio Optimization

本文提出了 MACF 及其针对特定优化器的适配器 MACF-X,这是一个新颖的框架,能够从多模态证据中学习动态 ESG 约束,以在不改变底层金融政策的观测或奖励的情况下强制实施可持续投资组合偏好,从而在保持具有竞争力的财务表现的同时减轻尾部 ESG 预算压力。

原作者: Xin Li, Yan Ke, Longbing Cao

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Li, Yan Ke, Longbing Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在驾驶一辆高性能赛车。你唯一的工作就是尽可能快地驾驶以赢得比赛(这代表试图赚钱的金融投资组合)。

在过去,如果你想遵循“绿色”或道德准则(ESG),人们可能会建议你查看仪表盘上一个静态的贴纸,上面写着:“这辆车 70% 是绿色的。”但这个贴纸存在几个问题:

  1. 过时了(当新消息出现时,它不会更新)。
  2. 充满噪音(不同的人可能会给这辆车打出不同的分数)。
  3. 僵化(它无法告诉你,你即将采取的这一个具体转弯是否危险)。

该论文认为,对于一辆需要瞬间做出决策的赛车来说,将 ESG 视为静态贴纸是一个糟糕的主意。相反,作者提出了一种名为MACFMACF-X的新系统。

以下是其工作原理,使用简单的类比:

1. 问题所在:“静态贴纸”与“动态副驾”

目前大多数 AI 投资系统只是将 ESG 分数添加到赛车的仪表盘上。如果分数较低,AI 会尝试避开那辆车。但由于分数是静态且充满噪音的,AI 会感到困惑。它可能因为一个旧谣言而认为某辆车“糟糕”,或者可能忽略五分钟前刚刚发生的全新丑闻。

作者指出:不要改变驾驶员的视野。 让驾驶员(金融 AI)完全专注于速度和安全(利润和风险)。不要用令人困惑、过时的 ESG 分数去 clutter 他们的仪表盘。

2. 解决方案:“动态副驾”(MACF)

作者没有改变驾驶员的视野,而是引入了一位专门的副驾(称为MACF)。

  • 它的作用: 这位副驾注视着同一条道路,但拥有一套不同的视野。它通过审视实时新闻、政府报告和同行压力(多模态证据),为驾驶员正在考虑的每一个动作计算“风险成本”。
  • 三种风险类型: 副驾将风险分解为三个具体问题:
    1. 增持风险(Add-Risk): “如果我此刻买入更多这只股票,我是否正在踏入新的争议?”
    2. 持有风险(Hold-Risk): “如果我继续持有这只股票,我是否在忽视一个持续存在的问题?”
    3. 溢出风险(Spill-Risk): “如果我持有这只股票,是否会因为同一行业的竞争对手刚刚陷入麻烦而受到拖累?”
  • 神奇之处: 副驾并不告诉驾驶员该做什么。它只是向赛车的导航系统低语一个“成本估算”。

3. 适配器:“翻译器”(MACF-X)

现在,赛车的导航系统(优化器)需要知道如何利用这个低语。不同的赛车拥有不同的导航系统(有些使用 PPO,有些使用 CRPO,有些使用 TRPO)。

MACF-X 是一个通用翻译器。它将副驾的低语转换为赛车导航系统所能理解的具体语言。

  • 它不改变引擎(金融回报)。
  • 它不改变方向盘(观测值)。
  • 它只是添加了一个约束:“如果你尝试执行这个动作,‘成本’太高了,所以请减速或稍微转向。”

4. 结果:更快且更安全

作者在模拟市场中测试了该系统,包含 30 只美国主要股票(US30)和 30 只欧洲股票(EU30)。

  • 旧方法(静态分数): 赛车要么无视规则,要么被错误数据搞糊涂,导致“预算违规”(违反道德规则)或错失利润。
  • 新方法(MACF + MACF-X):
    • 赛车保持快速(财务表现依然具有竞争力)。
    • 赛车保持安全(极少违反道德预算)。
    • 关键在于,当他们在“打乱”数据(随机化分数使其失去意义)的情况下测试该系统时,系统失败了。这证明了该系统并非仅仅在猜测;它实际上是在从实时、动态的证据中学习。

核心启示

可以这样理解:

  • 旧方法: 你告诉厨师,“不要使用低评分的食材。”厨师使用去年的清单。由于清单未更新,他们可能会不小心使用腐烂的番茄。
  • 新方法: 你告诉厨师,“专注于做出最好的菜肴。”与此同时,一位质检员(MACF)站在炉灶旁。如果厨师伸手去拿腐烂的番茄,质检员会大喊:“停下!那要扣 50 分!”厨师不需要知道为什么番茄腐烂,也不需要阅读评分清单;他们只需对即时的“成本”信号做出反应。

该论文声称,这种方法使 AI 能够在不牺牲速度或不因混乱、过时的数据而困惑的情况下,尊重道德界限。它将 ESG 从“静态分数”转变为“动态安全约束”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →