Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems
本文认为,先进人工智能系统的真正前沿差异化因素在于输出精度(即重复请求之间的一致性)而非能力,并提出了一种低成本、非循环的指标来衡量这种“分组”现象,以区分可纠正的操作误差与根本的模型局限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,一场无声的革命正在改变专家们评判那些编写代码、解决问题和生成文本的机器的方式。多年来,业界一直专注于一个问题:模型有多聪明?研究人员通过观察机器能产生的最佳答案或其在测试中的平均得分来衡量这一点。这种方法假设,如果一个模型能答对一次,它就是成功的。然而,对于任何试图将这些工具用于实际工程工作的人来说,这一指标忽略了最关键的因素。一个成功率只有一半、另一半则表现糟糕的工具,即使其巅峰时刻非常出色,对于构建可靠系统而言也是毫无用处的。新的前沿领域不在于机器能跳多高,而在于它能否始终稳稳地落地。这种转变将重心从原始能力转向了精确度,不仅询问机器是否能胜任这项工作,还询问它是否能在每次被要求执行同一项任务时,都能以同样的方式完成。
乔治·安德里科普洛斯(George Andrikopoulos)是一位常驻伦敦的独立研究员,他认为目前比较人工智能系统的方式衡量错了对象。他指出,虽然最先进的模型已经变得极其准确——即它们的平均输出能够达到目标——但它们尚未变得精准。在这里,“精准”指的是当重复进行相同的请求时,结果的聚集程度如何。想象一下,要求一台机器解决一个特定的工程问题十次。一个精准的系统会给你九次或十次正确且合理的答案。而不精准的系统可能会给你五次正确的答案,但另外五次可能会产生一些怪异、破碎或完全无关的内容。业界目前在庆祝“最好的那一击”,但使用这些工具的人需要了解的是“整体情况”。如果射击点分布散乱,那么无论这组数据的中心点有多好,这个工具都是不可靠的。
为了解决这个问题,安德里科普洛斯开发了一种简单的方法,可以在不依赖复杂的循环评分系统的情况下衡量这种一致性。该方法并非通过要求另一个人工智能来评判工作(因为这会引入其自身的误差),而是使用具有明确二元结果的任务:代码是否能编译、测试是否通过,或者文件类型检查是否正确。这些都是可以通过计算机验证的事实,无需任何猜测。该过程涉及提取一小组此类可验证的任务,并在每次都在模型的全新实例上多次运行。通过计算模型成功与失败的次数,研究人员可以观察到结果的形态。如果模型每次都通过,或者每次都失败,那么它是精准的。如果它有时通过,有时失败,那么它是散乱且不可预测的。
该论文根据这些测量结果提出了一个清晰的决策规则。如果一个模型持续以同样的方式失败,那么它就是一个仅仅偏离中心的“紧密组”。这是一个值得拥有的问题,因为这意味着人类操作员可以编写一条特定的规则来修正错误,从而有效地“校准机器的瞄准镜”。然而,如果模型的失败方式多种多样,那么这个组就是散乱的。在这种情况下,无论编写多少规则都无济于事,因为错误是随机的。对于散乱的组,唯一的解决方案是更换模型本身,或者调整其生成答案的方式。这种区分至关重要,因为它告诉工程师,他们应该把时间花在为机器编写指令上,还是应该直接更换一台机器。
一个现实世界的测试说明了这种方法的威力。研究人员选取了一组特定的编码任务,在没有特殊指令的情况下,在领先的模型上运行了五次。该模型在每一次都未能通过一项特定的验证任务。由于它每次都以完全相同的方式失败,研究人员知道这是一个持续性的错误,而非随机的故障。他们分析了失败原因,发现机器在处理过大的数字时犯了一个特定的逻辑错误。他们编写了一条简单的规则来纠正这一逻辑。当他们带着新规则再次运行同样的五项任务时,模型通过了所有测试。成功率从零跃升到了百分之百。这证明了该机器具备足够的精准度来进行修复;它只是需要校准瞄准镜。
研究还揭示了我们利用书面规则改进这些系统的能力存在一个令人惊讶的极限。研究人员尝试基于他们编写的规则创建一套新的测试任务,希望能衡量出这些规则增加了多少价值。他们发现,最先进的模型已经如此强大,以至于它们在无需被告知的情况下就能自然地遵循这些良好的实践。即使没有额外的指令,这些模型也能完美通过这些“基于规则”的测试。这意味着,对于最常见的错误,机器已经自行学习并掌握了这些纪律。因此,规则手册的真正价值不在于教导机器它已经知道的东西,而在于寻找那些机器仍然散乱或持续失败的罕见且隐藏的缺口。这些缺口无法提前预测;必须通过测量机器的实际工作来发现。
最终,这项研究将关于人工智能的讨论从一场关于谁更聪明的竞赛,转变为一场关于谁更可靠的实际评估。业界多年来一直在构建排行榜,通过峰值性能来对模型进行排名,但这些排名并不能告诉用户,该工具是否适用于他们的特定项目。通过测量“组的紧密程度”,工程师可以做出明智的决定,决定使用哪些模型以及在哪里投入时间。如果一个模型很精准但目标偏移,人类可以用规则来修正它。如果它很散乱,任何规则都救不了它。未来与这些机器共事的关键,不在于寻找那个完美的答案,而在于理解答案的模式,并知道何时该调整瞄准镜,何时该更换步枪。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。