Shot saturation and evidence limits in quantum-AI hardware benchmarks
本文通过重新分析存档的量子-人工智能硬件基准测试,旨在展示采样饱和与数据处理不完整如何显著影响误差重构与观测值解释,同时强调了当前报告标准在区分测量值与设定值方面的局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在构建能够思考的机器的竞赛中,一个新的前沿领域已经出现,在这里,物理世界的规则与人工智能的逻辑相遇。科学家们正在测试微小且脆弱的处理器,这些处理器基于量子力学的原理运行,希望它们能够解决当今超级计算机需要花费数个世纪才能破解的问题。为了知道这些机器是否正在正常工作,研究人员必须测量特定的量,例如两个数据模式之间的匹配程度,或者一个电路在寻找谜题最佳解决方案方面的表现。然而,这些测量并非只进行一次;而是要重复进行数千次,以建立一个可靠的图景,就像多次抛掷硬币以观察其是否公平一样。挑战在于,这些量子机器是多噪且不完美的,而研究人员统计其尝试次数(即“采样数/shots”)的方式会极大地改变数字所呈现出的样子。如果计数方法有缺陷,或者数据不完整,结果看起来可能很有前景,但实际上却具有误导性,使得人们难以分辨机器是真的在学习,还是仅仅在噪声中踉跄前行。
由 KarLex AI 的 Vikram Lex 进行的一项近期研究,对过去涉及这些量子处理器的实验集合进行了严厉且批判性的审视。研究人员并未在硬件本身上运行新测试。相反,他回溯了之前使用来自 Rigetti 和 IonQ 等供应商的云端量子计算机进行的某次活动的数字档案。他的目标是重新检查那些实验的原始摘要,以观察从中得出的结论在更严格、更透明的显微镜下是否依然成立。他专注于三类任务:测量向量之间的相似性、测试机器学习中使用的特定数学矩阵,以及运行一种旨在解决图论问题的算法。通过深入挖掘数据记录的细节,他发现实验的设置和报告方式往往掩盖了机器的真实性能。
调查的第一部分研究了增加测量尝试次数如何影响结果的准确性。在这些实验中,研究人员运行一个电路并记录结果数千次,然后对结果取平均值以得到一个数值。该研究重新分析了每批次尝试次数从 256 增加到 2,048 的数据。预期的结果是,仅仅增加采样数就会平滑误差,使结果更接近真实值。然而,重新分析揭示了一个不同的故事。虽然随着采样数的增加,数据的随机波动略有下降,但整体误差仍然顽固地维持在高位。错误的根源不在于缺乏数据,而在于平均值本身存在持续性的偏差。即使在使用 2,048 次采样后,平均结果仍然与理想的完美机器所应产生的数值显著不同。这表明,仅仅要求机器更加努力或增加尝试次数并不能解决问题;问题在于测量本身的根本设置或硬件的行为,无论测试重复多少次,这些因素都保持不变。
研究关注的第二个领域是一个被称为“核”(kernel)的数学结构,它本质上是一个代表不同数据点之间关系的数字表。在一个完整且有用的表中,每一对可能的数据点都应该有一个被测量的数值。在来自其中一家供应商 Rigetti 的存档数据中,所有 45 个可能的配对都得到了测量。然而,在来自另一家供应商 IonQ 的数据中,在实验耗尽计算额度之前,仅成功测量了 18 个配对。其余的 27 个配对则留白了。研究强调了处理这种不完整数据时的一个关键缺陷。当缺失的条目被视为零时,整个表的平均值大幅下降,从大约 0.22 降至 0.09。这种巨大的转变表明,最终结论完全取决于缺失数字是如何填充的。此外,研究发现这两家供应商测试的并不是完全相同的数据输入,这使得公平比较其硬件性能变得不可能。如果不知道具体使用了哪些数据点并确保每个条目都被测量,那么对这两台机器之间的任何比较在科学上都是无效的。
最后一部分检查了名为 QAOA 的算法的结果,该算法旨在找到将网络连接划分为两组的最佳方式。研究人员曾将他们的成功率报告为一个比例,即将他们找到的划分质量与网络中的总连接数进行比较。重新分析发现,不同的供应商对该比例的分母使用了不同的定义。一家供应商将结果除以图中的总边数,而另一家则除以理论上的最佳得分。这意味着,一台机器的 0.5 分并不一定意味着另一台机器的 0.6 分更好;它们只是在使用不同的尺子来衡量同一件事。此外,数据缺乏详细记录,无法验证机器是否真的如预期那样在解决问题,或者结果仅仅是数据处理过程的副产品。研究得出结论,如果没有标准化的数字报告方式和对原始数据的完全访问权限,就无法确定哪种硬件真正优越。
最终,这次重新分析为量子人工智能领域敲响了警钟。它表明,拥有大量数据或高次数的测量尝试并不保证能得到正确答案,如果底层的定义不明确或数据不完整。研究发现,这些实验中的主要错误并非可以通过增加测试次数来修复的随机噪声,而是与实验设计和报告方式相关的系统性问题。研究人员强调,为了向前迈进,业界需要建立严格的标准,规定必须记录哪些数据、如何处理缺失信息以及如何比较结果。在这些基础问题得到解决之前,关于量子硬件性能的说法将难以验证,而这些机器的真正潜力仍将隐藏在不完整证据的迷雾之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。