← 最新论文
🤖 machine learning

The geometry of AI validation: Exact certification limits for iid best-of-N search

本文通过将验证建模为可靠性曲面上的核几何,建立了独立同分布(iid)Best-of-N 搜索的精确认证极限,推导出了一个随 m2/Nm^2/N 缩放的精确歧义宽度公式,并提出了一种用于区分结构覆盖率与精度的双门审计规则。

原作者: Ricardo Fitas

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ricardo Fitas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能的发展已不再仅仅局限于用一个答案回答一个问题。如今的系统通常会生成大量的可能性,将它们相互比较,然后从中选出呈现给用户的最佳选项。这种被称为“搜索”的过程被用于解决复杂的数学问题、编写计算机代码或设计新的分子。由于系统是从许多备选项中进行选择,其最终输出的可靠性完全取决于这种选择是如何进行的。如果一个系统是从一百次尝试中挑选出最好的答案,那么这个答案的质量与从仅一次尝试中挑选出的答案质量是不同的。科学家面临的核心挑战在于,如何验证这些被选出的答案是否真正正确,尤其是当系统被训练为去挑选“最好”的一个而非“随机”的一个时。

这种验证问题非常棘手,因为选择的行为改变了所衡量的真理的本质。想象一位科学家在几个特定类型的问题上检查模型的性能,并发现其准确度很高。如果该模型随后被用于解决一种完全不同的问题,或者如果选择过程发生了变化,转而寻找另一种类型的“最佳”答案,那么之前的检查可能就不再适用。系统的可靠性并不是一个保持不变的固定数值;它与寻找答案的具体方法紧密相连。如果用于检查系统的方法与用于部署系统的方法并不覆盖相同的领域,那么系统可能会在表现出可靠的同时,实际上对其在新的语境下的错误视而不见。

里卡多·菲塔斯(Ricardo Fitas)是达姆施塔特工业大学的一位研究人员,他开发了一种精确的方法来衡量我们在验证这些人工智能系统时究竟还存在多少不确定性。他的工作聚焦于一个常见的场景:人工智能生成许多候选方案,并根据评分选出排名第一的一个。这项研究提出了一个基本问题:如果我们知道系统在从少量尝试中挑选最佳答案时的可靠性,我们能否确定它在从大量尝试中挑选最佳答案时的可靠性?根据研究结果,答案通常是否定的。如果不改变测试系统的方式,我们对系统了解的程度存在一个硬性限制。

研究表明,了解系统在小规模搜索规模下的表现,并不能保证对其在大规模搜索规模下表现的了解。即使一个系统在从十个尝试中选择最佳答案时表现完美,它在从一百个尝试中选择时理论上仍可能表现得非常糟糕,而这两种情况都与相同的测试数据相一致。这并不是因为测试做得不好,而是因为测试本身并没有看向正确的方向。研究证明,只要现实世界中的搜索规模大于测试时的搜索规模,就会存在一个特定的、无法逾越的知识鸿沟。这个鸿沟代表了一种结构性的盲目:系统可能完全符合测试所显示的情况,却仍会在测试无法预测的方式下失败。

为了理解这一点,可以将验证比作向黑暗的房间里照手电筒。如果你只在几个特定的点上照光,你可以确定那些点里的东西,但你无法知道黑暗角落里有什么。如果人工智能系统随后被部署到需要观察那些黑暗角落的任务中,你之前的检查将无法提供任何保障。研究人员计算出了这种不确定性的确切大小。对于一个在一百个候选方案中进行搜索的系统,如果你仅针对最多十六个候选方案的搜索进行了测试,那么对其真实性能的不确定性可能高达百分之八十三。这意味着两个完全不同的系统版本可以同时通过你的所有测试,但其中一个可能近乎完美,而另一个在面对更大的搜索规模时则几乎毫无用处。

研究还表明,仅仅重复同样的测试并不能解决这个问题。在相同的微小搜索规模上运行一千次测试只能减少随机噪声;它并不能照亮黑暗的角落。要减少不确定性,你必须改变测试本身,使其观察不同类型的搜索。研究提供了一个明确的规则,指导如何这样做:你必须扩大测试范围,以覆盖与现实世界部署相匹配的领域。如果你想认证一个搜索一百个候选方案的系统,你必须包含涉及搜索一百个(或至少是接近一百个)候选方案的测试。

论文通过来自两个不同领域的真实数据验证了这些发现:数学推理和计算机编程。在数学实验中,研究人员观察了人工智能模型在从数千个生成的解中选择最佳答案时表现如何。他们发现,虽然随着系统搜索候选方案数量的增加,平均性能有所提升,但某些特定问题实际上变得更差了。一些在小规模搜索中能被正确解决的问题,在系统进行更广泛搜索后反而变得不正确了。同样,在编程实验中,研究人员分析了代码生成任务。他们发现,即使整体成功率看起来很好,单个任务在搜索宽度发生变化时也可能出现剧烈失败。这些现实世界的例子证实,理论上的不确定性极限并非仅仅是数学抽象,而是存在于实际的人工智能行为之中。

此外,该研究还为如何设计更好的评估提供了实践方案。它建议采用两步走的方法。首先,研究人员必须确保他们的测试覆盖了现实世界任务的结构广度。这意味着要在与实际应用相同的搜索规模上测试系统。其次,一旦建立了这种结构性覆盖,他们就可以通过增加更多独立的任务来减少随机噪声并提高精度。研究表明,收集更多标签或数据只有在收集的方向正确时才是有效的。例如,在编程实验中,专门针对得分最高的候选方案收集标签,比收集随机候选方案的标签能更显著地降低错误率。这凸显了测试的方向比数据的纯粹数量更为重要。

这些发现是对“仅仅因为一个系统通过了一系列标准测试就认为它是安全”这一假设的警告。如果这些测试与系统将被使用的具体方式不匹配,系统可能会隐藏失效风险,而这些失效只会在部署时显现。这项研究并不是说人工智能搜索已经失效或无法改进;相反,它阐明了证明一个系统有效性的规则比此前认为的更加严格。它确立了验证不是一次性的检查,而是一个必须随着系统能力演进的持续过程。通过理解这些极限的几何特性,开发者可以设计出真正的审计程序,从而认证人工智能系统的可靠性,确保它们提供的答案不仅在实验室中可靠,在现实世界中同样值得信赖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →