← 최신 논문
🤖 machine learning

DOPPLER: Dual-Policy Learning for Device Assignment in Asynchronous Dataflow Graphs

이 논문은 연산 선택 및 배치 정책을 결합하여 실행 시간을 단축하고 훈련 효율성을 개선함으로써 기존의 학습 기반 및 휴리스틱 방법들을 능가하는 비동기 데이터플로우 그래프를 위한 장치 할당 최적화 3단계 이중 정책 학습 프레임워크인 Doppler를 소개한다.

원저자: Xinyu Yao, Daniel Bourgeois, Abhinav Jain, Yuxin Tang, Jiawen Yao, Zhimin Ding, Arlei Silva, Chris Jermaine

게시일 2026-06-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinyu Yao, Daniel Bourgeois, Abhinav Jain, Yuxin Tang, Jiawen Yao, Zhimin Ding, Arlei Silva, Chris Jermaine

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 여덟 명의 요리사(GPU)가 함께 거대하고 복잡한 식사(머신러닝 태스크)를 준비하는 거대하고 빠른 주방의 매니저라고 상상해 보십시오.

문제점: "모두가 기다려야 하는" 규칙

현재 대부분의 주방(표준 AI 시스템과 같은)에서는 요리사들이 엄격하게 동기화된 단계에 따라 작업합니다.

  • 1단계: 여덟 명의 요리사가 모두 채소를 다집니다.
  • 2단계: 그들은 가장 느린 요리사가 다질 때까지 모두 멈춰서 기다려야 합니다.
  • 3단계: 그 후에야 비로소 다음 조리 과정을 시작할 수 있습니다.

이것은 비효요적입니다. 만약 7번 요리사가 느리다면, 나머지 일곱 명의 요리사는 아무것도 하지 못한 채 서서 시간을 허비하게 됩니다. 이것을 "동기식(synchronous)" 시스템이라고 부릅니다.

목표: "업무 보존형(Work-Conserving)" 주방

이 논문은 더 나은 방식인 업무 보존형(WC) 시스템을 제안합니다. 이 주방에서는 요리사가 한 가지 작업을 마치는 즉시, 가능한 다음 작업을 바로 잡습니다. 그들은 그룹을 기다리지 않고 계속해서 일을 수행합니다.

  • 도전 과제: 엄격한 일정 없이 운영하면 혼란이 발생할 수 있습니다. 요리사들이 같은 재료를 두고 싸우거나, 어떤 요리사는 업무에 파묻히고 다른 요리사는 노는 상황이 생길 수 있습니다. 이처럼 빠르고 혼란스러운 환경에서 누가, 무엇을, 언제 할지 결정하는 것은 매우 어렵습니다.

해결책: DOPPLER

저자들은 이 할당 문제를 해결하기 위해 DOPPLER라는 스마트한 AI 매니저를 만들었습니다. DOPPLER는 전체 퍼즐을 한 번에 풀려고 하는 대신, "이중 정책(dual-policy)" 접근 방식을 사용하는데, 이는 마치 두 명의 전문 보조원을 두는 것과 같습니다.

  1. 선택자 (Selector, SEL): 이 보조원은 레시피(데이터플로우 그래프)를 살펴보고 어떤 작업을 다음에 선택할지 결정합니다. 마치 지휘자가 재즈 즉흥 연주에서 다음에 연주할 악기를 결정하듯, 어떤 순서로 작업을 가져올지 결정합니다.
  2. 배치자 (Placer, PLC): 작업이 선택되면, 이 보조원은 그 작업을 어느 요리사에게 맡길지 결정합니다. 이 보조원은 누가 현재 바쁜지, 누가 한가한지, 그리고 이동 시간을 최소화하기 위해 어느 요리사가 재료와 가장 가까이 있는지 확인합니다(통신 최우려).

DOPPLER의 학습 방식 (3단계 훈련)

새로운 매니저를 주방에 바로 투입한다고 해서 즉시 완벽해질 수는 없습니다. DOPPLER는 세 단계를 통해 학습합니다.

  • 1단계: 인턴십 (모방 학습 - Imitation Learning): DOPPLER는 숙련된 인간 매니저(표준 규칙 기반 알고리즘)를 관찰하고 그들의 움직임을 복제합니다. 이를 통해 값비싼 실수를 저지르지 않으면서 "좋은 행동"의 기초를 배웁니다.
  • 2단계: 시뮬레이션 (시뮬레이션 기반 강화학습 - Simulation-Based RL): DOPPLER는 가상 주방(컴퓨터 시뮬레이터)에서 연습합니다. 다양한 전략을 시도하고, 그 결과를 확인하며, 실수로부터 배웁니다. 만약 시뮬레이션에서 교통 정체를 유발한다면, 다시는 그런 일이 일어나지 않도록 배웁니다.
  • 3단계: 실전 투입 (실제 시스템 강화학습 - Real-System RL): 마지막으로, DOPPLER는 실제 주방에 배치됩니다. 이곳에서도 실시간으로 계속 학습합니다. 특정 요리사가 예상보다 느리거나 특정 재료 준비가 오래 걸린다면, DOPPLER는 실시간으로 전략을 조정하여 흐름을 빠르게 유지합니다.

결과

논문은 다양한 복잡한 "레시피"(행렬 곱셈 및 대규모 언어 모델 등)에 대해 DOPPLER를 테스트했습니다.

  • 속도: DOPPLER는 주방을 훨씬 더 빠르게 운영했습니다. 어떤 경우에는 기존의 가장 뛰어난 방법들과 비교했을 때 총 조리 시간을 **52.7%**나 단축했습니다.
  • 효율성: 요리사들이 기다리거나 왔다 갔다 하며 낭비하는 시간을 줄여, 요리사들이 업무에 몰입하는 시간을 훨씬 더 높였습니다.
  • 적응력: 주방 설정이 변경되어도(요리사 수나 작업 유형이 달라져도), DOPPLER는 매우 적은 추가 연습만으로도 충분히 잘 수행하며 빠르게 적응할 수 있었습니다.

요약하자면, DOPPLER는 전문가를 모방하고, 시뮬레이터에서 연습하며, 실전에서 미세 조정을 거쳐, 혼란스럽고 빠른 컴퓨팅 환경을 관리하는 법을 배우는 똑똑한 이중 구조의 AI 시스템입니다. 이를 통해 엄청난 양의 시간과 컴퓨팅 자원을 절약합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →