在量子计算这一新兴领域,科学家们正在学习如何构建运行在亚原子世界奇特规则之上的机器。为了让这些机器发挥作用,研究人员必须编写软件——即被称为“量子线路”的程序——通过操纵微小的信息单元来达到特定的、预期的结果。可以将量子线路想象成一套指令,引导一个粒子从起点到达精确的终点。挑战在于,这些指令极其脆弱;哪怕是一个错误的步骤,都可能将粒子送往错误的地方,导致整个计算变得毫无意义。多年来,计算机科学家一直试图教会人工智能自动编写这些线路,希望机器能够学会设计量子实验所需的复杂逻辑。然而,一个主要的障碍始终存在:人工智能生成的代码往往在表面上看起来完全正确,遵循了编程语言的所有语法规则,甚至能正常运行而不崩溃,但仍然无法准备出所需的精确量子态。代码是有效的,但结果却是错误的。
一项新的研究针对这一特定问题展开了探讨,重点研究一种被称为“克利福德线路”(Clifford circuit)的特定量子线路类型。这些线路之所以特殊,是因为它们功能强大,足以用于纠错和其他关键任务,同时又具有一种独特的数学属性,使其可以在标准计算机上进行完美的精确校验。与大多数需要追踪几乎无限种可能性的量子模拟不同,这类线路可以被快速且精确地验证。研究人员利用这一优势为大语言模型创建了一个训练系统。他们并没有简单地要求人工智能猜测最终的代码,而是教会它“展示其推导过程”。该系统要求人工智能在编写最终程序之前,先生成一个逐步的逻辑追踪——即一条解释如何将初始状态转化为目标状态的推理链。随后,这个追踪过程会由一个严格的验证器(一个数字裁判)进行检查,以确认逻辑是否严密,以及生成的线路是否确实准备出了正确的量子态。只有那些人工智能逻辑正确且最终结果也正确的示例才会被保留,用于进一步教导模型。
研究结果令人瞩目。当研究人员在数千个不同的量子目标上测试人工智能时,通过这些经过验证的、逐步追踪的学习的模型,其表现比仅接受最终代码训练的模型要出色得多。对于其中一个受试模型,正确解的数量从仅仅寥寥数个跃升到了两百多个(基于同一组问题)。在另一个模型家族中,成功率从不到百分之二提高到了接近百分之九。研究发现,仅仅向人工智能展示最终答案是不够的;人工智能需要理解变换的中间步骤才能做到正确。此外,研究人员发现,即使人工智能生成的代码语法完美且物理上有效,它往往仍然无法准备出正确的量子态。这种“有效的程序”与“正确的结果”之间的差距是一个关键洞察,证明了仅检查代码的语法对于量子任务而言是不够的。最成功的模型是那些通过经过验证的追踪进行学习,并随后通过仅在自身成功的尝试上进行训练而得到进一步优化的模型,从而形成了一个由精确验证驱动的改进循环。
研究人员还探索了这种方法是否可以扩展到更大、更强大的人工智能模型。他们发现,虽然这些大型模型几乎可以完美地编写遵循规则且属于有效量子线路家族的代码,但在没有逐步追踪训练的特定引导下,它们仍然难以击中精确的目标态。即使是使用最先进的模型,准备精确量子态的成功率仍然相对较低,单次尝试的成功率仅在百分之六左右徘徊。然而,当研究人员允许模型针对每个问题生成许多不同的候选方案,并使用验证器挑选出最佳方案时,正确解的覆盖率显著提高了。这表明,尽管人工智能在编写量子代码的机械操作方面正变得越来越熟练,但真正的难点在于确保代码确实按预期执行所需的深层语义理解。这项研究得出结论:若要使人工智能成为设计量子实验的可靠伙伴,它不仅需要被训练去生成代码,更需要被训练去生成经过严格验证、确保结果正确的代码,从而弥合“程序可运行”与“程序有效”之间的鸿沟。
技术摘要:AG-COT:用于 Clifford 电路 LLM 程序合成的已验证算法轨迹
1. 问题陈述
本文解决了科学代码生成中的一个关键差距:即大型语言模型(LLM)能够生成语法正确且可执行的程序,但这些程序却无法计算出预期的科学对象。虽然基于执行的基准测试已将评估重点转向行为正确性,但量子程序合成提出了一个独特的挑战:一个电路可以解析成功、执行成功且保持物理有效性(例如,符合 Clifford 规则),但却准备了错误的量子态。
作者的研究重点是 Clifford 电路,这类电路由 Hadamard、Phase 和 CNOT 门构建。这些电路具有重要意义,因为它们:
- 准备 稳定子态(Stabilizer States),这对于量子纠错和基于测量的量子计算至关重要。
- 可以通过 Aaronson–Gottesman 算法进行精确经典验证,从而实现高效模拟,而无需追踪 2n 个振幅。
- 作为一个受控环境,用于测试通过监督推导过程(算法轨迹)和在已验证输出上进行训练,是否能比单纯的代码生成提升语义正确性。
先前的基准测试(如 QCircuitBench)表明,即使是顶尖的模型(包括 GPT-4o),在使用标准提示词的情况下,在 Clifford 态准备任务上的保真度也接近于零,这凸显了该任务的难度。
2. 方法论
提出的框架 AG-COT 通过两种主要机制将精确验证集成到训练循环中:算法轨迹监督(Algorithmic Trace Supervision) 和 验证器过滤式续接(Verifier-Filtered Continuation)。
2.1 目标表示与验证
不同于使用完整的态矢量(其规模呈指数级增长),目标被表示为 紧凑的有符号稳定子生成器(compact signed stabilizer generators)。这显著减少了提示词长度(例如,从 12 个比特态矢量的 ~16K 字符减少到 Tableau 的 ~800 字符)。
- 验证器: 一个有序的决策链检查:
- 语法有效性 (P(y)): 输出是否符合 OpenQASM 解析规则?
- Clifford 有效性 (K(y)): 解析后的电路是否可以转换为 Qiskit Clifford 对象?
- 精确匹配:
- 严格标签匹配(Strict Label Match): 检查生成的稳定子标签是否与目标标签完全一致。
- 状态等价性 ($StateEq$): 检查生成的量子态是否与目标态等价,忽略生成器基底的差异。
2.2 训练流水线
训练过程包含两个截然不同的阶段:
AG-CoT 监督(算法轨迹):
- 我们不仅对最终的 OpenQASM 电路进行训练,还对 Aaronson–Gottesman (AG) 思维链(CoT)轨迹 进行监督。
- 这些轨迹由确定性的 Tableau 约简步骤组成,通过这些步骤的反向操作,可以得到正确的准备电路。
- 训练数据将目标提示词与包含还原轨迹的
<think> 模块以及最终的 OpenQASM 程序进行配对。
- 构建方式: 对于 32B 的研究,轨迹源自参考电路。对于 3B/7B 的研究,直接从有符号稳定子生成器出发,通过完成 Tableau、应用约简、反转步骤并编译为允许的门集来构建轨迹。
- 只有当验证器接受最终电路的样本才会被纳入训练集。
验证器过滤式续接(拒绝采样微调 - RFT):
- 在初始 AG-CoT 训练之后,模型生成其自身的输出。
- 验证器对这些生成结果进行过滤,仅保留通过“状态等价性”检查的结果。
- 模型利用这部分经过筛选的成功生成数据进行进一步的监督微调。
2.3 实验设置
- 模型: 实验在 Qwen2.5-3B-Instruct、Mistral-7B-Instruct-v0.3 和 Qwen2.5-Coder-32B-Instruct 上进行。
- 基准线: 与直接 SFT(仅电路监督)和 Zero-shot 基准线进行对比。
- 指标: 在语法有效性、Clifford 有效性、严格标签匹配、状态等价性和 Pass@N(搜索覆盖率)方面进行评估。
3. 核心贡献
- 算法轨迹监督: 本文证明,通过监督带有验证器检查的 AG-CoT 轨迹,可以显著提高模型的语义正确性。这种方法将生成的电路与产生该电路的具体约简步骤相结合,教会模型的是合成程序本身,而非仅仅是输出格式。
- 验证器过滤式续接: 作者展示了在模型自身的验证通过的输出上进行持续训练,相比于轨迹监督基准线,可以获得稳定(尽管较小)的增益。
- 紧凑的目标表示: 本研究建立了一个通过有符号稳定子生成器指定目标的流水线,实现了精确验证并降低了提示词开销,同时保持了完整的语义精度。
- 综合评估: 研究区分了语法有效性、Clifford 有效性和状态等价性,以证明有效的量子代码往往无法准备正确的态,从而证实了精确验证的必要性。
4. 结果
4.1 受控对比(3B 和 7B 模型)
在 3,661 个留出目标集上:
- Qwen2.5-3B:
- 直接 SFT 的任务成功率为 0.90% (33/3,661)。
- AG-CoT SFT 将成功率提升至 5.49% (201/3,661),增加了 4.59 个百分点。
- 验证器过滤后的 RFT 版本达到了 5.74%–5.87% (210–215 次成功)。
- Mistral-7B:
- 直接 SFT 的成功率为 1.94% (71/3,661)。
- AG-CoT SFT 将成功率提升至 8.63% (316/3,661),增加了 6.69 个百分点。
- RFT 达到了 8.80% (322/3,661)。
- 统计显著性: McNemar 测试确认,AG-CoT 监督相对于直接 SFT 的增益具有高度统计学显著性(Qwen 为 p<10−48,Mistral 为 p<10−72)。RFT 的增益相对较小,且显著性并不统一。
4.2 32B 研究
- 语法与有效性: 经过监督的模型实现了近乎完美的语法和 Clifford 有效性(~99.9%),而 Zero-shot 模型表现不佳(<40%)。
- 状态等价性: 尽管有效性很高,但最强的直接模型(RFT-v1)仅实现了 6.14% 的状态等效性。
- 搜索覆盖率: 使用验证器引导的选择机制(每个目标 64 个候选者,即 Best-of-64),基础 AG-CoT 在状态等价性下的覆盖率上升至 10.07%,这表明搜索可以找回比单次输出生成更多的正确电路。
- 错误分析: 轨迹训练的模型产生的错误具有更低的“约束缺失”(missing constraints,即缺失的独立目标约束数量较少),这表明即使在失败时,它们也能保留更多的目标信息。
5. 重要性与结论
本文声称,算法轨迹监督和验证器过滤式续接是提高 LLM 在科学代码合成中语义正确性的有效且互补的策略。
- 精确验证的必要性: Clifford 有效性(语法/物理有效)与状态等价性(语义正确)之间持续存在的差距,证实了语法有效性是不够的。一个电路可以是物理有效的,但准备了错误的态;因此,精确验证对于提供训练信号至关重要。
- 推导过程的价值: 监督推导过程(AG-CoT 轨迹)与监督最终输出相比,能带来显著的收益。这表明 LLM 能从学习合成算法的中间推理步骤中获益。
- 可扩展性: 这些方法在不同模型家族(3B, 7B, 32B)中显示出一致的改进,尽管绝对成功率仍然较低(个位数),这表明虽然该方法有效,但量子电路合成对当前的 LLM 而言仍然是一项极具挑战性的任务。
作者总结道,这些结果支持了使用算法监督和验证器过滤数据作为实现更可靠科学代码生成的路径,特别是在精确验证在计算上可行的情况下。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。