想象一下,一家半导体工厂(即“晶圆厂”)就像一个极其庞大且混乱的厨房,成千上万种不同的食谱正在同时进行烹饪。食材是硅片,而厨师则是数百台不同的机器。问题在于这个厨房极其复杂:有些食谱需要烹饪数小时,有些机器会发生故障,有些食材需要保持特定的顺序,而且这些“厨师”(机器)经常不得不互相等待。
传统上,工厂管理者使用简单的规则来决定下一片硅片应该送往哪台机器(例如“先到先得”或“最短作业优先”)。但在这样一个混乱的厨房里,简单的规则往往会导致交通拥堵、时间浪费和烹饪速度变慢。
本文提出了一种利用人工智能(AI)来运行这个厨房的新方法,这种方法通过试错来学习,被称为强化学习(RL)。以下是他们的方法及其研究结果的详细说明:
核心问题:“漫长的等待”
在普通的电子游戏中,你按下按钮就会立即获得分数。但在半导体工厂中,如果你今天做了一个决定(比如将一片硅片送往机器 A),你可能要过几天才能看到结果(比如成品)。这种奖励是延迟的。
- 类比: 想象你在玩一局国际象棋,但只有在比赛结束时才会得到评分。如果你在第一分钟走了一步错棋,直到整局比赛结束你才会知道这一步导致了胜负。标准的 AI 在处理这个问题时会很吃力,因为它无法知道究竟是哪一个具体的动作导致了最终的胜利或失败。
解决方案:一个“事件驱动型”指挥家
研究人员构建了一个框架,让 AI 充当整个机器管弦乐团的中央指挥家,而不仅仅是一个独奏者。
- 以“事件”而非“秒”为思考单位: AI 并不每秒钟检查一次工厂,而是在发生“事件”(如一台机器完成工作或变为空闲状态)时才被唤醒。这符合工厂实际运作的方式。
- 对混乱进行分组: 由于结果是延迟的,AI 不会对单个决策进行孤立的判断。相反,它会观察一段时间内发生的一组事件(例如一个 6 小时的班次)。它会问:“这组决策是否让整个厨房的整体情况变得更好?”
- 奖励机制: AI 获得两种类型的反馈:
- 即时反馈: “你让机器 A 等待了 5 分钟;这是一个小惩罚。”
- 大局反馈: “在过去的 6 小时里,我们多生产了 20% 的硅片;这是一个巨大的奖励。”
通过结合这两者,AI 学会了如何通过做出微小的决策来换取未来的巨大成功。
他们是如何测试的
他们并没有凭空猜测,而是构建了一个数字孪生(一个高度精确的真实世界工厂模拟视频游戏)。他们在两种方式下测试了该 AI:
- 离线学习: AI 研究了一份过去的工厂日志库(就像阅读历史书),而不会触碰真实的机器。这样做很安全,因为 AI 在学习过程中不会意外损坏任何东西。
- 在线学习: 随后,AI 在模拟器中进行练习,做出实时决策并从结果中学习,类似于飞行员在飞行模拟器中进行训练。
结果:更顺畅的厨房
当他们将该 AI 与目前工厂中使用的标准规则进行比较时:
- 吞吐量(烹饪速度): 与随机方法相比,该 AI 将成品硅片的数量提升了高达 39%,并且显著优于标准规则。
- 利用率(厨师效率): 机器保持忙碌和高效生产的时间更长,减少了闲置时间。
- 一致性: 该 AI 在 31 种不同的工厂场景下都表现出色,这表明它并非仅仅是在特定情况下运气好。
为什么这很重要
论文声称,通过改变 AI 学习的方式(专注于事件组和延迟奖励),而不仅仅是改变 AI 的“大脑”,我们可以解决大规模系统中复杂的长期问题。
简而言之: 他们教会了一个 AI 如何成为一个混乱的工厂管弦乐团的顶级指挥家。通过倾听一段时间内的完整交响乐,而不仅仅是捕捉单个音符,AI 学会了如何让音乐流畅地演奏下去,从而实现了更高的产量和更少的浪费。
技术摘要:面向半导体制造长时程控制的事件驱动强化学习
1. 问题陈述
半导体制造设施(晶圆厂)代表了复杂的自适应系统,其特征是随机的处理时间、重入式工艺流程、异构设备以及严格的技术约束。该领域的决策(特别是调度层面)涉及序列化选择,其中动作的后果往往是延迟的,并与后续数千次交互相互交织。
传统的强化学习(RL)方法在此类场景中面临显著挑战:
- 长时程信用分配(Long-Horizon Credit Assignment): 标准的一步转移模型由于无法对齐时间信用分配,导致了时间上的错位,因为系统级的关键绩效指标(KPI)如吞吐量和利用率是许多相互依赖决策的累积结果,而非单个动作的直接后果。
- 延迟反馈: 奖励是稀疏的,仅在长的时间段内被观察到,这使得学习过程变得不稳定。
- 可扩展性与泛化能力: 现有许多研究将问题简化为局部控制,或依赖于小规模测试平台,未能解决真实工业复杂度下的系统级策略问题。此外,目前缺乏针对不同算法在离线和在线机制下关于泛化性和迁移性的系统性比较。
2. 方法论
作者提出了一种模块化、事件驱动的深度强化学习框架,旨在为连续、无限时程的环境进行集中式策略优化。
核心架构
- 集中式智能体(Centralized Agent): 单个智能体在调度层面控制整个系统,为可用设备选择候选晶圆批次(wafer lots)。与需要显式协调的多智能体分解相比,这种方法利用参数共享来提高可扩展性。
- 事件驱动动力学: 系统被建模为一系列离散事件(例如,设备变为空闲状态)的序列,而非固定时间步。动作会触发具有时间延伸性和重叠性的事件。
- 状态与动作编码:
- 状态: 编码工作负载统计数据、设备状态以及跨工艺流程部门和产品类别的在制品(WIP)分布(固定大小的表示维度 >5000)。
- 动作: 编码候选批次特征(产品类型、处理时间、约束条件)。策略使用基于评分的 softmax 机制来处理可变大小的动作集(高达数千个候选对象)。
- 约束策略: 通过掩码处理不可行的动作,利用硬感应偏置(hard inductive bias)强制执行领域特定约束(例如避免腐蚀),同时奖励函数鼓励符合约束的行为。
奖励构建
为了解决反馈稀疏问题,奖励被分解为两个部分:
- 事件级奖励 (re): 一种稠密的、塑造过的奖励,根据处理时间、空闲时间和约束违规情况提供即时的局部反馈。
- 系统级奖励 (rg): 在有限时间窗口 (ts) 内计算的延迟奖励,基于 KPI,如累计晶圆移动量(生产率)和平均设备利用率。
总奖励为 r=re+rg。
事件组时序差分(TD)学习
本文引入了一种尊重重叠事件时间结构的创新 TD 公式:
- 组聚合(Group Aggregation): 该框架不是独立更新每个事件,而是采样一个时间段 Ih,并将其中所有的事件视为一个单一的组 G。
- 组级目标: 学习目标是最小化聚合后的事件级 TD 误差与该段内系统级奖励之间的差异。这使得全局奖励信号能够跨越相互依赖的事件进行端到端的传播。
- 聚合策略: 作者比较了均值聚合(平滑处理)和加权聚合(考虑事件持续时间)以稳定优化过程。
算法集成
该框架是算法无关的,可与各种无模型(model-free)骨干网络集成:
- 离线训练: 利用历史数据(随机策略)并结合保守方法(CQL, IQL)来减轻分布偏移和高估问题。
- 在线训练: 采用离策(Off-policy,如 DQL, SAC)和在策(On-policy,如 PPO)方法进行微调。SAC 利用熵正则化进行探索,而 PPO 使用组相对优势函数(group-relative surrogate advantage)以与分组 TD 结构保持一致。
3. 主要贡献
- 模块化事件驱动 RL 框架: 一种用于复杂自适应系统中策略交互与优化的可扩展架构,并以半导体制造作为代表性的现实世界案例。
- 集中式表述: 一个统一的基于事件驱动动力学的策略优化问题,能够在无需多智能体协调的复杂情况下实现系统级决策。
- 多阶段优化: 支持既能进行离线预训练(数据高效、保守型),又能进行在线微调(自适应、受约束探索)的定制化公式。
- 侧重泛化的评估: 通过 31 个多样化的工业场景进行全面评估,明确了不同 RL 公式和算法在长时程设置下的相对优劣。
4. 实验结果
实验使用基于 STMicroelectronics 真实工业数据的高保真模拟器进行,涵盖了 31 种具有不同在制品(WIP)和运行配置的场景。
- 基准测试: 将性能与先进先出(FIFO)、最短处理时间(SPT)和随机(Random)策略进行了对比。
- 离线性能: 在随机策略数据上训练的智能体相比随机基准实现了显著提升(吞吐量提升约 39%,饱和度提升约 28%),并优于 FIFO。在离线算法中,双 Q 学习(DQL)和保守 Q 学习(CQL)变体表现出了稳健的性能。
- 在线性能: 在线微调进一步提升了性能,相比于无控制(随机)设置,实现了高达约 42% 的吞吐量增益和约 30% 的饱和度增益。具有高目标熵的软行为者-评论家算法(SAC)和 DQL 在样本效率方面表现出色。
- 消融研究:
- TD 公式: 提出的事件聚合 TD 目标函数显著优于标准的截断折扣序列和堆叠事件级目标,证实了组级信用分配的重要性。
- 奖励设计: 仅使用系统级段间奖励进行训练也被证明是有效的,但在某些情况下,结合事件级塑造奖励可以加速收敛。
- 算法比较: 离线方法需要保守性(CQL/IQL)以避免高估,而在线方法则受益于熵正则化(SAC)和稳定的策略梯度(PPO)。
5. 重要性与主张
本文声称,所提出的框架成功解决了将强化学习应用于具有延迟反馈的大规模事件驱动系统的核心挑战。通过将环境交互与策略优化解耦,并引入定制的时序差分层,该框架使智能体能够学习优化多个 KPI 的系统级策略。
作者强调:
- 可扩展性: 基于特征的集中式方法可以扩展到高维设置,而不会产生多智能体系统的协调开销。
- 可迁移性: 该框架在多种运行场景下表现出一致的性能提升,表明其对 WIP 和产品组合的变化具有鲁棒性。
- 实用性: 能够利用历史数据进行离线预训练并在有限交互下进行在线微调,使得该方法在探索成本高昂且风险较大的工业部署中具有可行性。
研究结论指出,在复杂自适应系统中实现有效控制,问题的精心构建(特别是时间结构与奖励传播的对齐)与底层 RL 算法的选择同样至关重要。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。