Two AI Metrics Diverged: Will it Make All the Difference?
本文认为,前沿人工智能能力是继续集中在富有的参与者手中,还是扩散到规模较小的开发者手中,关键取决于用于衡量这些能力的特定性能指标相对于计算资源而言是数学上有界的还是无界的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于论文《两种 AI 指标的分歧:这会产生本质区别吗?》的解释,采用了简单的语言和日常类比。
核心问题:是强者恒强,还是人人都能赶上?
想象一下人工智能的世界就像一场巨大的赛跑。在一边,你拥有“前沿”选手:规模巨大的公司,拥有无限的资金,每年都在购买最昂贵的超级计算机,并用呈指数级增长的算力来训练他们的 AI 模型。在另一边,你拥有“平庸”选手:规模较小的开发者、开源爱好者和研究人员,他们拥有固定且有限的预算。他们无法购买新的超级计算机,但他们确实能从技术的普遍进步(比如更好的道路或更快的鞋子)中获益,这些进步对每个人都有帮助。
这篇论文提出的核心问题是:富有的选手最终会远远甩开领先位置,导致贫穷的选手永远无法追赶吗?还是说差距会缩小,直到每个人都跑得差不多快?
论文给出了一个令人惊讶的答案:这完全取决于你如何衡量这场比赛。
两种类型的“尺子”(指标)
作者认为,我们经常使用不同的“尺子”(指标)来观察 AI 的进展,而这些尺子讲述了两个完全不同的故事。他们将这些尺子分为两类:平庸指标(Meek Metrics)和强大指标(Mighty Metrics)。
1. 平庸指标: “天花板”效应
把平庸指标想象成一个电子游戏关卡,目标仅仅是到达终点线。
- 类比: 想象一场比赛,终点线在 100 米外。“前沿”选手带着喷气背包,10 秒钟就到了。“平庸”选手骑着自行车,用了 20 秒才到。
- 关键点: 一旦“前沿”选手到达了 100 米处,他们就会停止。他们不能跑过终点线。即使明年他们换了一个更好的喷气背包,他们也只是站在 100 米处。最终,骑自行车的人也会到达 100 米处。
- 结果: 从长远来看,喷气背包和自行车之间的差距消失了。两者都站在了终点线。
- 现实世界的例子:
- 测试分数(0-100%): 如果一个模型在测试中得了 99%,它不可能得到“更多”的正确率。一个更便宜的模型也可能得到 98% 或 99%。差距会缩小。
- 验证损失(Validation Loss): 这是一种衡量误差的方法,误差会越来越小,直到趋近于零。一旦接近零,拥有更多的钱并不会让它变得“更零”。
论文的观点: 如果你关注的事物是一个“平庸指标”,那么昂贵、强大的模型最终看起来会和廉价、微小的模型一样好。“平庸模型将继承地球。”
2. 强大指标: “无限阶梯”效应
把强大指标想象成爬一架向无限高处延伸的梯子。
- 类比: 想象一场比赛,目标不是到达终点线,而是尽可能爬得更高。“前沿”选手带着喷气背包,爬到了 1,000 英尺。“平庸”选手拿着梯子,爬到了 100 英尺。
- 关键点: 这里没有天花板。明年,“前沿”选手使用更好的喷气背包爬到了 10,000 英尺。即便“平庸”选手换了更好的鞋子,也只能爬到 200 英尺。差距不仅没有缩小,反而越来越大。
- 结果: 富有的选手永远保持领先。 “平庸”选手永远无法追赶。
- 现实世界的例子:
- 游戏排名(ELO): 在国际象棋中,你可以变得越来越强。超级计算机可以击败人类,但一个更强大的超级计算机可以击败第一个。这里没有“完美”的分数,你可以一直变强。
- 任务长度: AI 能完成多复杂的项目?如果一个便宜的模型能完成 1 小时的任务,而一个富有的模型能完成 10 小时的任务,那么富有的模型可以永远去做 100 小时、1,000 小时的任务。这种能力上的差距会不断扩大。
论文的观点: 如果你关注的事物是一个“强大指标”,那么富有的模型将永远保持领先。差距永远不会缩小。
转折点:关键在于你如何提问
这篇论文最重要的部分是:同一种技能,根据你提问方式的不同,可以被测量为“平庸”或“强大”。
作者用软件工程举了一个极好的例子:
- 场景 A(平庸): 你问:“AI 能写出没有 Bug 的代码吗?”
- 如果 AI 把 99% 的代码写对了,这通常已经“足够好”了。一个 99% 正确的模型和一个 99.9% 正确的模型之间的差距其实并不重要。这是一个平庸的视角。
- 场景 B(强大): 你问:“AI 在出错之前,能连续完美地编写多少行代码?”
- 在这里,富有的模型可能会完美编写 100 万行代码,而便宜的模型只能写 1 万行。富有的模型可以一直持续下去。这是一个强大的视角。
教训: 如果你通过“它是否通过了测试?”(平庸)来衡量 AI,未来是民主且开放的。如果你通过“它能解决多复杂的难题?”(强大)来衡量 AI,未来将被少数富有者所主导。
为什么这在现实世界中很重要
论文得出结论,我们在制定法律和政策时,需要非常谨慎地选择使用哪种“尺子”。
- 如果我们使用平庸指标: 我们可能会认为 AI 正在变得安全且触手可及。我们可能会放宽监管,因为“现在每个人都能做到了”。
- 如果我们使用强大指标: 我们可能会意识到,富有的公司在复杂性方面正远远甩开其他人,从而控制了科学、经济和安全的未来,让其他人掉队。
底线:
论文并没有说 AI 一定会变成垄断,或者一定会变成民主。它说答案取决于我们看重什么。
- 如果我们看重简单任务上的完美准确度,差距会缩小,小玩家也能赶上。
- 如果我们看重解决日益困难、复杂的难题,差距会扩大,只有富有的少数人才能拥有这些工具。
作者警告说,许多人正在使用“平庸”的尺子(如测试分数)来观察,并认为差距正在缩小;而“强大”的尺子(如解决艰深的科学问题)则显示出差距实际上正在变得巨大。要理解 AI 的未来,我们必须选择正确的尺子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。