← 最新论文
⚛️ quantum physics

Quantum Optical Reinforcement Learning via Spectrum-Resolved Hong-Ou-Mandel Interference

本文介绍了一种光谱解析型霍恩-奥-曼德(SR-HOM)光学架构,该架构利用光子的光谱自由度进行连续动作强化学习,在展示出优于神经网络基准的样本效率和性能的同时,成功实现了漂移量子门的高保真度恢复。

原作者: Shaojun Wu, Jiahua Xu, Shan Jin, Zhen Yang, Yifang Xu, Chenglong You, Guangwei Deng, Luyan Sun, Chang-Ling Zou, Xiaoting Wang

发布于 2026-07-30
📖 1 分钟阅读🧠 深度阅读

原作者: Shaojun Wu, Jiahua Xu, Shan Jin, Zhen Yang, Yifang Xu, Chenglong You, Guangwei Deng, Luyan Sun, Chang-Ling Zou, Xiaoting Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是用硅芯片进行数字运算,而是与光共舞的世界。这就是量子光学的领域,科学家们在这个领域利用被称为光子的微小光粒子来处理信息。这个世界中最著名的技巧之一是洪欧-曼德尔(Hong-Ou-Mandel, HOM)效应。想象两个完全相同的光子在同一时间到达一个神奇的十字路口(分束器)。它们并没有各奔东西,而是变得害羞并粘在一起,成对地从十字路口穿出。通过计算它们粘在一起的频率,科学家可以测量这两个光子的相似程度。这种“相似性检查”已被用于构建简单的光学大脑,但直到现在,它们都有些像戴着眼罩的裁判:它们能告诉你两个事物是否相似,但无法告诉你它们有多相似,也无法提供详细的报告。

当你想教这些光学大脑复杂的技能,比如强化学习时,这种局限性就会成为问题。把强化学习想象成训练一只狗:狗尝试一个动作,得到奖励(零食)或惩罚(责骂),然后学习下次做得更好。要训练一只狗走钢丝(一项复杂的任务),你需要的不仅仅是一个简单的“做得好”或“做得不好”。你需要一位教练,能够给出具体的、连续的指令,比如“向左再倾斜一点”或“加快你的步伐”。旧的光学大脑只能给出一个单一的“是/否”评分,这对于这些棘手的连续性任务来说是不够的。它们受困于一个只有简单选择的世界,无法处理现实世界控制中的细微差别。

由 Wu、Xu 及其团队开展的一项新研究,为这些光学大脑戴上了一副高清眼镜。他们引入了一种名为光谱解析 HOM(SR-HOM)的新架构。与其仅仅询问“光子是否粘在一起了?”并得到一个数字,不如询问“它们是否在这个特定颜色下粘在一起了?”以及“那么那个颜色呢?”通过将光分解为不同的颜色(频率)并统计每种颜色的光子对,他们将一个单一的数字变成了一张丰富且色彩斑斓的信息图。

研究人员利用这张色彩斑斓的图谱构建了一个紧凑的“演员-评论家”(actor-critic)智能体。在训练的世界里,**演员(Actor)是决定做什么的人(动作),而评论家(Critic)**是判断该决策好坏的人(价值)。在这种新的光学设置中,演员观察色彩图谱的对角线以生成平滑、连续的动作,而评论家则观察图中更复杂的模式,以评估智能体的表现如何。这就像是从一个只能说“通行”或“停止”的红绿灯,升级到了一个智能导航系统,它可以说:“200 英尺后左转,然后减速,因为前面有坑洼。”

当团队将这个新的光学大脑应用于五个不同的类视频游戏挑战(从着陆飞船到平衡双杆机器人)时,结果令人印象深刻。在这些模拟中,SR-HOM 智能体的学习速度更快、更可靠,其表现优于具有相同数量“旋钮”的标准化数字计算机程序(多层感知器)。例如,在“月球着陆器”(LunarLander)任务中,光学智能体仅用了 666 次尝试就达到了目标,而数字程序则需要 2,935 次——效率提升了惊人的 4.4 倍。光学智能体也保持了稳定性,在达到目标后很少发生崩溃。

团队并没有止步于视频游戏;他们还模拟了使用该系统来修复现实世界的量子计算机。他们测试了利用该系统来校准控制两个量子比特(qubits)如何相互通信的“旋钮”。随着时间的推移,由于环境噪声,这些机器会偏离调谐状态,就像吉他弦跑调一样。SR-HOM 智能体能够聆听这些带有噪声的信号,并对控制脉冲进行微小的、连续的调整。在模拟中,它成功地将量子门的性能恢复到了接近 99.2% 和 99.5% 的准确度,几乎找回了因漂移而损失的所有性能。

虽然这些结果目前基于模拟和数值实验,但它们预示了一个充满希望的未来,即基于光的系统可以作为复杂任务的高效、紧凑的教练。通过将一个简单的“相似性检查”转变为一场详细的、多色彩的对话,这项工作表明,量子光学平台可能已经准备好承担起连续控制的重任,为训练未来的智能体提供一种全新的、高能效的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →