想象一个计算机不再仅仅利用电能进行数字运算,而是与光共舞的世界。这是光学神经网络(ONNs)的领域——一个充满未来感的科学分支,在这里,光束取代了电子,携带信息来解决诸如人脸识别或疾病诊断等复杂问题。这种技术中最具前景的版本是衍射光学神经网络(DONN)。你可以把 DONN 想象成一个巨大的、隐形的万花筒:你将一张图片投射进去,光线会在一系列特殊的镜子和过滤器上反射,通过自身的弯曲和干涉,产生一个新的图案来代表答案。
然而,这里有一个难点。大多数这类基于光的计算机被设计为只能在“完全相干”的光线下工作——就像激光束一样,每一颗光子都像阅兵式中的士兵那样步调一致地前进。但在现实世界中,光很少是那么完美的。阳光、灯光,甚至电脑屏幕发出的光都是“部分相干”的,这意味着光子的运动更加混乱,就像在繁忙市场中穿行的拥挤人群,而不是整齐划一的军事方阵。多年来,科学家们一直苦于如何让这些光计算器在如此杂乱的现实光环境下正常工作。他们还面临着第二个障碍:光天生倾向于进行直线式的(线性)数学运算,但智能计算机需要进行复杂的曲线式(非线性)数学运算才能学习复杂的知识。通常,要让光实现这种“曲线数学”,需要使用危险的高功率激光器或难以制造的特殊材料。
这正是这项新研究发挥作用的地方。一组科学家提出了一种巧妙的解决方法,称之为部分相干高阶光学神经网络(HONN)。他们并没有试图对抗现实世界中杂乱的光线,也没有使用危险的激光,而是发现了一种方法,可以利用光本身的混沌特性,结合一种聪明的编码技巧,让计算机实现“非线性思考”。他们称之为“伪非线性编码”。这就像是通过调整人群进入房间的方式,教给一群混乱的人群如何跳出特定的复杂舞步,而不是强迫他们排成纵队行进。
该团队利用可见光装置和空间光调制器(本质上是高科技的可编程镜子)构建了一个物理模型来验证这一想法,并在著名的图像数据集(如手写数字 Digit MNIST 和服装项目 Fashion MNIST)上进行了测试。他们还尝试了对现实世界中的面部表情数据和医学图像进行处理。结果令人振奋:他们的新系统能够成功利用部分相干光识别图像;而且,随着他们增加系统的“非线性”程度(通过调整镜层),其表现也随之提升。事实上,在某些测试中,这种基于光的计算机表现得与传统的电子计算机一样出色,但消耗的计算功率却不到 10%。
至关重要的是,研究人员发现该系统具有惊人的鲁棒性(稳健性)。即使现实世界中的光照条件与计算机训练时的条件并不完全匹配,它依然能良好运行。这项研究表明,通过将光的“杂乱性”视为一种特性而非缺陷,我们可以构建出能够应对现实世界的光学计算机。虽然目前的实验是在实验室模拟的光照条件下完成以证明概念,但研究结果为利用光来驱动下一代机器视觉和成像技术指明了一条切实可行的路径,这有望使智能摄像头和传感器变得比以往任何时候都更快、更节能。
技术摘要:通过伪非线性编码实现的偏相干高阶光学神经网络
问题陈述
衍射光学神经网络(DONNs)为高速、高能效计算提供了一条路径,但面临着一个根本性的限制:缺乏通用的非线性激活框架。大多数现有的 DONN 在理想相干照明下运行,主要实现线性映射,这限制了其表示能力以及在具有部分相干光源的现实环境中的适用性。虽然存在物理非线性效应(如饱和吸收、二倍频),但它们通常需要高光强和专门的材料。相比之下,“伪非线性”(在线性系统中进行的编码策略)避免了高强度需求,但尚未与部分相干光的物理特性充分结合。所解决的核心挑战是如何以物理一致的方式,在部分相干光学神经网络中引入有效的、可控的非线性。
方法论
作者提出了一个在部分相干照明下运行的**高阶光学神经网络(HONN)**框架。该框架统一了两个非线性来源:
- 相干相关检测非线性: 源于部分相干光下光学检测的强度响应。
- 系统级伪非线性: 通过光学系统内优化的编码策略实现。
理论框架
该模型通过引入输入变量之间的高阶相互作用,扩展了传统的线性权重架构。输出 y 由高阶多项式展开描述,其中非线性项源于输入振幅、相位调制与相干矩阵 (Γ) 之间的相互作用。
- 伪非线性: 通过将输入数据编码到具有相位调制参数 (Φi=aiX+Bi) 的衍射层中来实现。通过将特定系数 (ai) 设置为零,系统可以被调节以运行在不同的非线性阶数(1阶至4阶)。
- 部分相干模拟: 系统采用高斯-谢尔模型(Gaussian-Schell model)。为了高效模拟部分相干传播,作者采用了具有随机谱的相干光场叠加(M=20 个叠加层),并定义了相干长度 (lc)。
- 实验平台: 使用可见光空间光调制器(SLM)设置(波长 660 nm)实现了一个四层 DONN。该系统使用两个 SLM:一个用于输入振幅/相位编码,第二个用于加载调制相位以实现特定的非线性阶数。
训练与验证
模型使用瑞利-索末菲(Rayleigh–Sommerfeld)衍射理论和角谱法进行训练,并通过 Adam 优化器结合交叉熵损失进行优化。验证工作在以下数据集上进行:
- Digit MNIST 和 Fashion MNIST: 用于分析性能随不同相干长度 (lc) 和非线性阶数变化的趋势。
- RAF(真实世界情感面部)和 MedMNIST: 用于展示其在复杂、真实世界数据集上的实际应用能力。
- 鲁棒性测试: 评估当测试相干长度 (lc−test) 偏离训练相干长度 (lc−train) 时的性能表现。
核心贡献
- 统一的 HONN 框架: 本文建立了一个用于高阶光学推理的通用框架,整合了伪非线性与部分相干性。文章指出,物理非线性和伪非线性是统一数学形式的两种替代实现方式。
- 实验验证: 作者在可见光谱范围内对 HONN 模型进行了实验验证,证明分类准确率随相干长度和非线性阶数的增加而提高。
- 相干鲁棒性: 研究表明,高阶调制能增强有效的非线性响应,从而补偿由相干性降低引起的性能下降。这表明在峰值准确率与对抗相干性失配的鲁棒性之间存在权衡。
- 效率: 所提出的 HONN 实现了与传统电子神经网络相当的性能,而计算复杂度不到后者的 10%。
结果
- 性能趋势: 在 Digit MNIST 上,随着相干长度从 8Δx 移动到完全相干,模拟准确率从 79.25% 提升至 94.83%(1 阶)以及从 83.23% 提升至 95.55%(3 阶)。实验结果遵循类似的趋势,最高达到 90.25% 的准确率。
- 真实世界数据集: 在 RAF 数据集上,部分相干 HONN 实现了 72.68% 的准确率;在 MedMNIST 上实现了 97.17%。当与电子读取层(光电混合系统)集成时,准确率分别提升至 75.86% 和 98.39%。
- 缩放行为: 观察到模型容量与相干性之间存在强耦合。在低相干度下,过参数化模型会遭受过拟合和优化困难,而高相干度则有助于训练高容量网络。
- 鲁棒性: 与在高度相干条件下训练的模型相比,在较低相干度水平(lc−train=8Δx)下训练的模型在更广泛的测试相干条件下保持了稳定的性能,而高相干度训练的模型在 lc−test 降低时性能下降迅速。
意义与主张
作者声称,这项工作通过为部分相干照明下的高阶光学神经计算提供一个统一框架,填补了研究空白。他们断言,部分相干性不仅是一个限制因素,更是一个“具有物理意义的自由度”,能够塑造推理行为。
该工作的意义在于:
- 实际部署: 为机器视觉、计算成像以及自然光(本质上是部分相干的)条件下的传感提供了光学计算的途径。
- 泛用性: 建立了一个超越传统衍射模型的框架,可能适用于基于超表面的系统和低阈值非线性器件。
- 效率: 证明了光学推理可以在大幅降低计算复杂度的同时,在准确率上与电子网络相媲美。
论文得出结论,在部分相干光学系统中,应将相干性、非线性阶数和模型容量进行协同设计,以优化性能与鲁棒性。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。