← 최신 논문
⚡ electrical engineering

Event-Driven Reinforcement Learning Enables Long-Horizon Control in Semiconductor Fabrication

본 논문은 복잡한 반도체 제조 시스템에서 장기적 다목적 제어를 효과적으로 최적화하는 확장 가능한 이벤트 기반 심층 강화 학습 프레임워크를 제안하며, 다양한 산업 실무 시나리오 전반에 걸쳐 처리량과 가동률의 유의미한 개선을 입증한다.

원저자: Yavar Yeganeh, Mahsa Shekari, Nicla Frigerio, Daniele Pagano, Andrea Matta

게시일 2026-06-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yavar Yeganeh, Mahsa Shekari, Nicla Frigerio, Daniele Pagano, Andrea Matta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

반도체 공장(fab)을 수천 가지의 서로 다른 레시피가 동시에 조리되고 있는 거대하고 혼란스러운 주방이라고 상상해 보십시오. 재료는 실리콘 웨이퍼이며, 요리사들은 수백 대의 서로 다른 기계들입니다. 문제는 이 주방이 믿을 수 없을 정도로 복잡하다는 점입니다. 어떤 레시피는 몇 시간이 걸리고, 어떤 기계는 고장이 나며, 어떤 재료는 특정 순서를 엄격히 지켜야 하고, "요리사들"(기계들)은 서로를 기다려야 하는 경우가 빈번합니다.

전통적으로 공장 관리자들은 다음에 어떤 웨이퍼를 어떤 기계로 보낼지 결정하기 위해 단순한 규칙(예: "선입선출" 또는 "최단 작업 우선")을 사용합니다. 하지만 이 혼란스러운 주방에서 단순한 규칙은 교통 체증, 시간 낭비, 그리고 느린 조리 속도로 이어지기 쉽습니다.

이 논문은 **인공지능(AI)**을 사용하여 이 주방을 운영하는 새로운 방법을 제안하며, 이는 시행착오를 통해 학습하는 **강화 학습(Reinforcement Learning, RL)**이라는 방법입니다. 다음은 그들의 접근 방식과 연구 결과에 대한 요약입니다.

핵심 문제: "긴 기다림"

일반적인 비디오 게임에서는 버튼을 누르면 즉시 점수를 얻습니다. 하지만 반도체 공장에서는 오늘 내린 결정(예: 웨이侧를 A 기계로 보내는 것)의 결과(예: 완성된 제품)를 확인하기까지 며칠이 걸릴 수도 있습니다. 즉, 보상이 **지연(delayed)**됩니다.

  • 비유: 체스 게임을 하고 있는데, 경기 맨 마지막에만 점수를 받는다고 상상해 보십시오. 만약 첫 1분에 잘못된 수를 두었다면, 경기가 끝날 때까지 그 수가 승패에 어떤 영향을 미쳤는지 알 수 없습니다. 표준적인 AI는 이 문제를 어려워하는데, 왜냐하면 어떤 구체적인 움직임이 승리나 패배를 초래했는지 알 수 없기 때문입니다.

해결책: "이벤트 기반" 지휘자

연구진은 AI가 단순히 독주자가 아니라, 전체 기계 오케스트라를 위한 중앙 집중형 지휘자 역할을 수행하는 프레임워크를 구축했습니다.

  1. 초 단위가 아닌 "이벤트" 단위로 사고하기: AI는 매 초마다 공장을 체크하는 대신, 기계가 작업을 마치거나 자유 상태가 되는 것과 같은 "이벤트"가 발생할 때만 깨어납니다. 이는 실제 공장이 작동하는 방식과 일치합니다.
  2. 혼돈을 그룹화하기: 결과가 지연되기 때문에, AI는 단일 결정을 고립시켜 판단하지 않습니다. 대신, 일정 시간 동안 발생한 이벤트의 집합(예: 6시간 교대 근무 시간)을 살펴봅니다. AI는 다음과 같이 질문합니다: "이 결정들의 집합이 전반적인 주방의 상태를 더 낫게 만들었는가?"
  3. 보상 시스템: AI는 두 가지 유형의 피드백을 받습니다.
    • 즉각적인 피드백: "A 기계를 5분간 대기하게 만들었습니다. 이는 작은 페널티입니다."
    • 거시적 피드백: "지난 6시간 동안 웨이퍼 생산량이 20% 증가했습니다. 이는 거대한 보상입니다."
      이들을 결합함으로써, AI는 나중에 큰 승리를 이끌어낼 수 있는 작은 결정들을 내리는 법을 배웁니다.

테스트 방법

그들은 단순히 추측하는 대신, 실제 세계의 반도체 공장을 매우 정확하게 모사한 디지털 트윈(초정밀 비디오 게임 시뮬레이션)을 구축했습니다. 그들은 두 가지 방식으로 AI를 테스트했습니다.

  • 오프라인 학습: AI는 실제 기계에 손을 대지 않고 과거의 공장 로그(역사책을 읽는 것과 같음)를 공부했습니다. 이는 AI가 학습하는 동안 실수로 무언가를 망가뜨릴 위험이 없으므로 안전합니다.
  • 온라인 학습: 그 후 AI는 시뮬레이션 안에서 연습하며 실시간 결정을 내리고 그 결과를 통해 학습했습니다. 이는 조종사가 비행 시뮬레이터에서 훈련하는 것과 유사합니다.

결과: 더 매끄러운 주방

그들이 이 AI를 현재 공장에서 사용되는 표준 규칙들과 비교했을 때 다음과 같은 결과가 나타났습니다.

  • 처리량 (조리 속도): AI는 무작위 방식보다 완성된 웨이퍼 수를 최대 39% 증가시켰으며, 표준 규칙보다 훨씬 뛰어난 성과를 보였습니다.
  • 가동률 (요리사 효율성): 기계들이 훨씬 더 자주 바쁘고 생산적으로 가동되어 유휴 시간을 줄였습니다.
  • 일관성: AI는 31가지의 서로 다른 공장 시나리오에서 우수한 성능을 보여주었으며, 이는 특정 상황에서 운이 좋았던 것이 아님을 증명합니다.

이것이 중요한 이유

이 논문은 AI의 '두뇌'를 바꾸는 것보다 AI가 '학습하는 방식'(이벤트 그룹과 지연된 보상에 집중하는 방식)을 바꾸는 것이 거대한 시스템의 복잡하고 장기적인 문제를 해결할 수 있다고 주장합니다.

요약하자면: 그들은 AI에게 혼란스러운 공장 오케스트라를 위한 마스터 지휘자가 되는 법을 가르쳤습니다. 단 하나의 음표가 아니라 시간의 흐름에 따른 전체 교향곡을 경청함으로써, AI는 음악이 끊이지 않고 매끄럽게 연주되도록 학습했으며, 그 결과 더 많은 제품을 더 빠르게, 낭비 없이 만들어낼 수 있었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →