When Error Mitigation Makes Things Worse: Budget-Aware Evaluation, Extrapolation Failure, and the Calibration Trust Boundary
本文表明,误差缓解技术(特别是无约束零噪声外推和神经校正器)在误校准或预算限制下可能会显著放大误差并无法检测尾部风险,从而揭示了近期量子学习流水线在校准完整性和评估方法论方面的关键脆弱性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在那些正在建造下一代计算机的、寂静且超低温的实验室里,科学家们正致力于解决一个根本性的问题:噪声。这些被称为量子计算机的机器,旨在通过操纵亚原子粒子的奇异状态来解决复杂问题。然而,其硬件极其脆弱。即使是极其微小的震动或温度变化,也会导致粒子行为变得不可预测,从而在数据被使用之前就将其损坏。为了解决这个问题,研究人员开发了一套称为“误差缓解”(error mitigation)的技术。其目标很简单:将机器输出的混乱、多噪的结果进行数学上的清理,以揭示其下方的真实答案。这好比是在暴风雪般的静电干扰中,从听不清声音到清晰地听到音乐之间的区别。为了让该领域向前发展,科学家必须相信这些清理方法确实有效,并且不会使信号变得更糟。
最近一项来自 Workday AI Research 的研究挑战了这种信任,揭示了最流行的清理方法有时反而会放大它本意要消除的误差。研究人员关注了一种被称为“零噪声外推法”(zero-noise extrapolation)的技术,其原理是通过有控制地增加计算机的噪声步骤,然后推测如果噪声为零时结果会是什么样。这有点像试图通过称量一个人在背着越来越重的背包时的重量,来推测这个人的实际体重。研究发现,当计算机的内部设置出现轻微偏差(即所谓的“失准”或“误校准”现象)时,这种推测游戏会彻底失败。在模拟实验中,在 38% 到 63% 的案例中,该方法产生的结果甚至比不做任何处理还要糟糕。更令人担忧的是,当它失败时,误差不仅仅是稍微偏离,而是极其严重,产生的数值比实际误差大了数百倍。
研究人员在 IBM 提供的一台小型真实量子计算机上测试了这些发现,模拟结果得到了验证。在这台真实的硬件上,这种误差缓解方法在 80% 到 88% 的试验中使结果变得更差。平均误差变成了原始未校正数据的三到四倍。这表明该方法非常脆弱。它依赖于一个假设,即机器的噪声是以平滑且可预测的方式运行的。当机器存在一种隐藏的、稳定的偏差时——就像一个秤总是固定偏重几克一样——该方法的数学推测就会完全偏离轨道。研究还指出,如果科学家只观察“中间”结果(即中位数),他们会完全忽略这些失败。平均误差看起来会很糟糕,但中间值看起来却很正常,从而掩盖了系统正在产生危险异常值的这一事实。
为了解决这些问题,团队探索了一种不同的方法,即使用一种人工智能(具体来说是神经网络)来学习如何纠正误差。他们利用成千上万个模拟示例来训练这个计算机程序,教它识别噪声模式并将其减去。至关重要的是,他们使用相同的计算次数限制(即“预算”)将这种新方法与旧方法进行了对比。这个“预算”是一个关键的约束条件,因为运行这些机器既昂贵又耗时。研究发现,一旦支付了训练 AI 的成本,神经网络在低预算下表现得非常好,性能优于传统方法。然而,AI 也有其自身的局限性。它无法将知识完美地转移到真实硬件上而无需进一步调整,并且它高度依赖于制造商提供的关于其当前状态的信息。
对制造商数据的这种依赖开启了一个潜在的安全风险大门。研究人员将来自云服务的校准数据视为一个“信任边界”,这意味着用户必须接受提供者的说法,而无法自行验证。他们证明,如果攻击者能够微妙地篡改这些校准数据——例如,通过更改一个描述机器控制设置的数字——AI 的纠正就会出错。在一项测试中,对元数据进行一次微小的、经过计算的修改,就会使误差增加八倍以上。AI 信任了错误的信息,导致数据不仅没有变好反而变得更糟。这凸显了当前系统的一个漏洞:计算的安全性取决于来自提供者的数据流的完整性,而目前该数据流并不受篡改保护。
研究结论指出,该领域需要一种更诚实的方式来评估这些误差校正工具。科学家必须观察全貌,包括运行该方法的成本、产生极端误差的风险以及数据输入的安全性。仅仅基于噪声缩放来猜测答案的传统方法并非万能灵药;它可能会发生无声且灾难性的失败。虽然基于学习的方法展现出了前景,但它们尚未成为一个已解决的问题,特别是在从模拟转向真实机器的过程中。未来的路径需要进行严格的测试,以考虑到这些机器是不完美的、它们的设置会发生漂移,以及它们的数据可以被操纵。在这些因素被完全理解并得到保障之前,必须以审慎怀疑的态度来看待这些强大新计算机所产出的数字。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。