Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most
本文揭示,在涉及超线性增长和尾部风险的预测任务中,能力更强的语言大模型表现出逆向扩展现象,即因过度外推上尾而生成更差的分布预测;这一标准单阈值指标所遗漏的缺陷,可通过连续且包含尾部的评分方法予以揭示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对该论文的解读。
核心理念:“更聪明”并不总是意味着更擅长预测未来
想象一下,你请一群天气预报员预测下周的气温。你有一群初级预报员,也有一群经验丰富、超级聪明的专家。通常,你会指望专家更准确。
但这篇论文发现了一个令人惊讶的现象:在预测那些急剧增长随后突然崩溃的事物(如病毒爆发或房地产泡沫)时,“超级聪明”的专家实际上比能力较弱者做出更糟糕的预测。
事实上,模型越聪明,它在最坏情况下的预测就越自信,同时也越错误。
核心问题:“过度自信的乐观主义者”
研究人员发现,大型语言模型(LLM)存在一个特定的盲点。当它们看到某种趋势急剧上升(超线性增长)时,它们会确信这种趋势将永远持续下去。
- 更聪明的模型: 它们非常擅长识别模式,因此假设这种模式会延续。它们将“最坏情况”的预测值推得极高,直冲云霄。它们心想:“这增长得太快了,它必须继续增长!”
- 现实情况: 在现实世界中,像流行病或泡沫之类的事物最终会撞上墙壁(即“体制转变”)并崩溃。
- 结果: 由于智能模型如此确信上限是天空,它们的“最坏情况”猜测高得离谱。当崩溃发生时,它们的预测完全偏离了实际。而能力较弱的模型更为谨慎,没有将猜测推得那么高,因此最终更接近现实。
类比:过山车
想象一辆正在爬上陡峭山坡的过山车。
- 能力较弱的模型: 看到山坡后说:“它在上升,但也许很快就会停止。”它画出的线是上升一点然后变平。
- 能力较强的模型: 看到山坡,计算出速度后说:“这要直冲月球了!”它画出的线是笔直地射向太空。
- 崩溃: 过山车到达顶峰后俯冲而下。
- 得分: 画出冲向月球那条线的模型,现在与实际轨道非常遥远。而猜测它会变平的模型,则更接近过山车实际行驶的轨迹。
这篇论文将这种现象称为**“逆向缩放”**。通常,更大、更聪明的模型会在所有方面变得更好。但在这里,变得更聪明反而使它们在这种特定类型的预测上变得更差。
为什么我们之前没发现?(“单点”陷阱)
你可能会问:“如果智能模型错得这么离谱,为什么研究人员之前没发现这一点?”
答案在于我们如何评估这些模型。大多数基准测试使用的是**“通过/失败”测试,或者是“你是否猜对了数字?”**测试。
- 二元测试(通过/失败): 想象一个测试问:“数字会超过 100 吗?”
- 智能模型猜测数字将达到 1,000,000。
- 实际数字是 50。
- 评分: 智能模型在技术上“正确”地判断出它超过了 100(尽管它错得离谱)。它获得了通过的成绩。
- 连续测试(真实得分): 这衡量的是猜测偏离了多少。
- 智能模型猜了 1,000,000,但答案是 50。这是一个巨大的错误。
- 不太聪明的模型猜了 60。这是一个小错误。
- 评分: 智能模型惨败。
该论文认为,当前的人工智能基准测试主要使用“通过/失败”测试。它们忽略了在“尾部”(即极端的最坏结果)上过度自信所带来的巨大代价。当你使用一种惩罚“偏离太远”的评分系统时,“更聪明”的模型突然看起来像是最糟糕的预报员。
了解主题有帮助吗?
研究人员试图通过告诉模型它们具体在预测什么(例如,“这是麻疹病例的图表”或“这是房价的图表”)来解决这个问题。
- 有时有效: 对于像 COVID-19 这样的事情,告诉模型主题有助于让它冷静下来并做出更好的预测。
- 经常失效: 对于像恶性通货膨胀(货币价值迅速丧失)这样的事情,模型知道事实。它们甚至能告诉你:“哦,这是一场危机。”但当需要做出实际预测时,它们仍然无视事实,猜测数字会冲向月球。它们拥有知识,但无法将其转化为现实的预测。
结论
- 能力是有代价的: 非常擅长识别模式可能会使人工智能在那些模式即将破裂时变得过度自信。
- “尾部”至关重要: 在金融、疾病控制或气候等领域,“最坏情况”(即尾部)是最重要的部分。如果你错过了尾部,你就错过了灾难。
- 改变评分方式: 我们需要停止用简单的“是/否”问题来给人工智能评分。我们需要根据它们处理整个可能性范围(尤其是极端情况)的能力来评分。如果我们不这样做,我们可能会继续部署那些在高风险预测中实际上更危险的“更聪明”的模型。
简而言之: 这篇论文警告我们,当我们预测那些增长迅速且剧烈崩溃的事物时,我们“最聪明”的人工智能工具可能反而最危险,因为它们对增长过于自信,而对崩溃视而不见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。