← 最新论文
🤖 machine learning

Robust Human-AI Complementarity under Uncertainty

本文证明,当人工智能预测误差与人类误差呈负相关时,在不确定性条件下可以稳健地实现人机互补,从而使决策者能够构建出保证提高期望效用的策略,作者通过使用现实世界的预测基准测试对这一条件进行了实证验证。

原作者: Yewon Byun, Bryan Wilder

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yewon Byun, Bryan Wilder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:“双头”决策者

想象一下,你正在试图预测一个复杂事件的结果,比如一场体育比赛的胜负,或者一个科学实验的结果。你有自己的直觉和经验(人类)。同时,你还有一个超级聪明的计算机程序,它会给出它自己的预测(人工智能/AI)。

这篇论文的目标是研究:在什么时候,将你的大脑与计算机的大脑结合起来,真的能让你比单独使用大脑时更聪明?

作者发现,仅仅拥有一个聪明的计算机是不够的。事实上,如果你并不确切了解这个计算机到底有多好,听取它的建议有时反而会让你的表现变得更差。让这个团队协作成功的秘诀在于人类与 AI 如何犯错

核心问题:不确定性的“盲点”

通常,我们假设如果一个 AI 很聪明,我们就应该听它的。但在现实世界中,我们往往无法准确知道 AI 在处理一个任务时的表现如何。这就像雇佣了一位名厨,但你还没品尝过他的手艺。你知道他总体上很厉害,但不确定他今晚会不会把牛排烧焦。

这篇论文提出了一个问题:当你并不百分之百确定 AI 的质量时,你该如何信任它的建议?

黄金法则:“反向错误”策略

论文发现了一个特定的条件,在这种条件下,人机团队能够保证获胜。这取决于他们误差之间的关系。

把这想象成两个人在猜西瓜的重量:

  • 场景 A(糟糕的团队): 你和 AI 都猜西瓜很重。你们的误差都是 5 磅,而且 AI 的误差方向与你完全相同。如果你把你们的猜测结合起来,你只是在重复同一个错误的观点。
  • 场景 B(优秀的团队): 你猜西瓜太重了(高估);而 AI 猜西瓜太轻了(低估)。你们的错误互相抵消了!

论文的发现:
要让“人+AI”团队在面对不确定性时,稳健地优于单纯的人类,AI 的错误必须与人类的错误呈负相关

  • 负相关: 当你犯错的方向与 AI 错误的方向相反时,即当你错一方面时,AI 错在另一方面。
  • 正相关: 当你犯错时,AI 通常也会以同样的方式犯错。

如果 AI 犯了和你同样的错误(正相关),论文表明,在存在不确定性的情况下,你无法安全地利用 AI 来改进你的决策。在这种情况下,你最好忽略它。但如果 AI 犯的是相反的错误,你就可以制定一种在数学上保证能获得更好结果的策略,即使你并不确切知道 AI 到底有多好。

现实世界测试:目前的 AI 表现得友好吗?

研究人员利用真实的预测竞赛数据和社会科学实验测试了这个理论。他们将人类的预测与大语言模型(LLM)的预测进行了对比。

结果:
遗憾的是,目前的 AI 模型往往会犯与人类相同的错误

  • 当人类高估一个结果时,AI 也倾向于高估它。
  • 当人类低估时,AI 也会低估。

这造成了“正相关”。因此,“黄金法则”(反向错误)并未得到满足。论文发现,在这些现实场景中,仅仅通过询问 AI 的帮助并不能自动让决策者变得更聪明。

我们可以用提示词(Prompts)来修复它吗?

研究人员尝试使用特殊的指令(提示词)来“教导” AI 做出相反的错误。他们尝试了诸如:

  • “告诉人类错在哪里并予以修正。”
  • “做一个反向思考者;反驳人类的观点。”
  • “使用与人类不同的信息。”

结果:
这些技巧虽然有一点点帮助,但它们未能持续地扭转这种关系。AI 仍然大多会犯与人类类似的错误。论文得出结论:我们不能依赖简单的“提示工程”来解决这个问题。为了实现真正的协作,我们可能需要从底层开始改变这些 AI 模型的训练方式,使其专门去寻找人类知识的空白点,而不是仅仅模仿人类的模式。

总结类比

想象你正在雾中驾驶一艘船。

  • 是船长。
  • AI 是第二位领航员。

如果第二位领航员总是和你朝着同一个方向迷失方向(正相关),那么听从他的建议只会确认你们一起迷路了。你无法指望他来救你。

但如果第二位领航员在相反的方向迷失方向(负相关),你可以结合你们的路径来找到真正的中心点。

这篇论文的核心观点是: 我们目前的领航员(AI)会和我们朝着同一个方向迷失。在能够训练他们朝着与我们相反的方向迷失之前,我们无法完全信任他们来优化我们的决策,尤其是在我们并不确定他们表现如何的情况下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →