Disagreement Is Not Debiasing: Human–AI Views in Portfolio Decisions
本文表明,虽然通过分歧来优化不确定性估计,将独立的 AI 预测与人类分析师预测相结合可以提高概率准确性,但若不针对已实现结果进行校准,则无法纠正共同的系统性偏差,也无法增强基于目标的投资组合决策。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在投资的高风险世界中,做出决策往往感觉就像是在移动的目标面前,站在一个摇晃的平台上进行射击。投资者依赖预测来猜测一家公司能赚多少钱,但这些猜测很少是完美的。几十年来,一种标准的方法是将人类专家的意见与计算机模型的计算相结合,希望其中一方的错误能抵消另一方的错误。这种被称为“预测组合”的思想认为,如果你将两个不完美的预测进行平均,结果应该比其中任何一个都更准确。然而,这个逻辑假设这两个来源产生的错误类型是不同的。如果人类和机器都在阅读同样的文档,并且受到同样的乐观情绪影响,它们可能会在同一时间犯下完全相同的错误。在这种情况下,仅仅平均它们的观点并不能解决问题;它只会强化误差。
这一现实构成了厦门大学陈嘉庚学院研究人员开展的一项新研究的背景,该研究旨在测试人工智能系统是否能够纠正人类金融分析师的系统性偏差。研究人员将重点放在中国股市,这是一个由数千家公司被专业分析师追踪的庞大且活跃的领域。他们收集了数十年的数据,观察人类专家做出的盈利预测,并将其与大型语言模型生成的预测进行对比——这是一种先进的人工智能,它阅读同样的公司报告,但被严格禁止查看分析师本人的预测。其目标是观察人工智能是否可以作为一个独立的第二意见来清理人类误差,或者这两个来源是否只是在同一个方向上存在偏差,从而使得它们的差异对于解决核心问题毫无用处。
研究首先承认了一个众所周知的事实:人类金融分析师始终过于乐观。在所检查的数据中,这些专家预测的收益高于实际情况的情况约占四分之三。随后,研究人员引入了人工智能,该人工智能被喂入相同的原始财务数据,但被设计为信息独立,这意味着它无法窥视人类的共识。一个自然的假设可能是,如果人工智能和人类产生分歧,那么这种差异就揭示了人类的偏差。如果人类说一家公司会赚很多钱,而人工智能说较少,人们可能会认为人类错了。然而,研究人员发现这种直觉是有缺陷的。因为人类和人工智能都在阅读相同的底层报告,它们共享一个共同的盲点。它们都在同一个方向上存在偏差,只是程度不同。
论文的核心发现是,两个有偏差的来源之间的分歧并不一定会自动纠正偏差。当两个预测者共享一个共同错误时,它们的分歧只能告诉你它们彼此之间有多大差异,而不能告诉你真相究竟在哪里。要找到真相,你需要观察过去实际发生了什么,而不仅仅是看这两个当前猜测之间的差异。研究人员建立了一个复杂的模型来进行测试。他们首先根据历史数据对人类和人工智能的预测进行了调整,本质上是教模型识别并减去每个来源中常见的过度乐观倾向。一旦完成这种校准,他们便结合了两种观点,以观察结果是否优于仅使用人类预测。
结果非常微妙,并挑战了“加入人工智能就能单纯提升一切”的期望。在纯粹的预测准确度层面,经过校准的人类与人工智能预测的组合改善了对不确定性的统计描述。该模型能够更好地描述可能结果的范围,很大程度上是因为两个来源之间的分歧有助于模型理解何时应当更加谨慎。当人类和人工智能产生分歧时,模型正确地将其解释为情况存在不确定性的信号,并扩大了其安全边际。这提高了预测的概率准确性,使其成为理解风险的更好工具。
然而,当研究人员测试这种改进后的预测是否能带来更好的投资决策时,情况发生了变化。他们模拟了一种需要特定绝对回报目标的投资组合策略。在这种情景下,加入人工智能预测相比仅使用经过校准的人类预测,并没有产生可检测到的收益。原因在于共享偏差的性质。虽然人工智能帮助模型理解了可能结果的“分布范围”,但它无法修复预测的“水平值”。因为人类和人工智能平均而言仍然都略显乐观,组合后的预测仍然偏高。对于一个取决于能否达到特定数字的决策来说,这种微小的剩余误差足以阻碍任何改进。两个来源之间的分歧无法替代针对现实结果进行严谨校准的艰巨工作。
研究还显示,人工智能预测本身并不是一个中立、无偏见的先知。与人类分析师一样,人工智能也存在向上偏差,即预测的收益高于实际发生的情况。这一发现至关重要,因为它拆穿了“人工智能会自动成为可以纠正人类错误的‘真相讲述者’”这一观念。相反,人工智能是另一个携带其自身系统性缺陷的信息源。研究人员发现,人工智能的偏差约为1个百分点,而分析师的偏差为1.45个百分点。这意味着,仅仅将人工智能加入其中,并不能神奇地消除困扰金融预测的乐观情绪。
最终,这篇论文表明,第二意见的价值完全取决于正在进行的决策类型。如果目标是对公司进行优劣排序,那么共享偏差并不重要,因为人类和人工智能很可能以相同的顺序进行排名。但如果目标是达到一个特定的目标(如最低回报率),那么这种共享偏差就会成为一个关键障碍。研究表明,你不能依靠两个预测之间的差异来修复共同的错误;你必须从过去的实际结果中学习。研究结论指出,虽然人工智能可以提高对不确定性的理解和对风险的描述,但它无法取代对历史现实进行严谨校准的需求。归根结底,协作式智能设计必须将“从结果中学习”的任务与“收集新信息”的任务分开,并认识到分歧是确定性的信号,而非偏差的解药。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。