← 최신 논문
🤖 machine learning

Cost-aware Duration Prediction for Software Upgrades in Datacenters

본 논문은 비대칭적인 오예측 비용과 지연 효과를 해결함으로써 데이터센터의 소프트웨어 업그레이드 일정을 최적화하는 비용 인식형 지속 시간 예측 프레임워크인 Acela 를 소개하며, 이를 통해 메타의 생산 시스템에서 효율성, 처리량 및 취소율 감소를 크게 개선했습니다.

원저자: Yi Ding, Aijia Gao, Thibaud Ryden, Michal Sedlak, Essam Ewaisha, Igor Marnat, Henry Hoffmann

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yi Ding, Aijia Gao, Thibaud Ryden, Michal Sedlak, Essam Ewaisha, Igor Marnat, Henry Hoffmann

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 데이터 센터를 수백만 대의 서버로 이루어진 활기찬 거대한 도시라고 상상해 보세요. 이 서버들은 여러분이 좋아하는 앱, 영상, 검색을 구동하는 일꾼들입니다. 하지만 어떤 기계든 마찬가지로 안전하고 빠르게 유지되기 위해서는 정기적인 유지보수와 소프트웨어 업데이트가 필요합니다.

문제는 이러한 서버를 업데이트하는 것이 까다롭다는 점입니다. 모두를 한 번에 업데이트하려고 하면 도시 전체가 마비됩니다. 너무 느리게 업데이트하면 시간이 영원히 걸립니다. 메타 (페이스북, 인스타그램 등을 운영하는 회사) 의 데이터 센터 운영자들은 매우 안전한 방식을 취해 왔습니다. 즉, 모든 업데이트가 가능한 가장 긴 시간이 걸릴 것이라고 가정하는 것입니다.

문제: "최악의 경우" 교통 체증
이를 마치 대부분의 승객이 30 초만 걸려 탑승하는데도, 버스 운전사가 모든 승객이 탑승하는 데 10 분씩 걸릴 것이라고 가정하는 것과 같다고 생각하세요. 운전자가 너무 조심스러워서 버스는 몇 시간 동안 방치되어 시간과 연료를 낭비합니다.

데이터 센터에서 이러한 "최악의 경우" 사고방식은 "업그레이드 창" (업데이트를 위해 할당된 특정 시간대) 이 실제로 20~40% 만 활용되게 만들었습니다. 그들은 많은 잠재적 작업을 놓치고 있었고, 모든 서버를 업데이트하는 데 훨씬 더 많은 사이클이 필요했습니다.

해결책: 스마트 교통 관제사 아셀라 (Acela)
이 논문은 아셀라 (Acela) 라는 새로운 시스템을 소개합니다. 아셀라는 단순히 추측하는 것이 아니라, 각 특정 서버의 각 특정 업데이트가 정확히 얼마나 걸릴지 예측하는 초지능 교통 관제사라고 생각하세요.

하지만 여기서 주의할 점이 있습니다. 아셀라는 수학 수업에서 의미하는 "정확한" 것을 목표로 하는 것이 아니라 비용을 고려한 목표를 가지고 있습니다.

  • 과소 예측 (업데이트에 10 분이 걸릴 것이라고 추측했는데 실제로는 20 분이 걸리는 경우) 은 위험합니다. 서버가 기한을 놓치고 업데이트가 실패하며 전체 일정이 무너집니다.
  • 과대 예측 (10 분이 걸릴 때 20 분이 걸릴 것이라고 추측하는 경우) 은 안전합니다. 서버는 일찍 완료되지만, 창구가 잠시 방치됩니다.

아셀라는 약간 "안전한" (과대 예측) 편이 "위험한" (과소 예측) 것보다 낫다는 것을 알고 있습니다. 이는 양분 회귀 (Quantile Regression) 라는 특별한 수학적 기법을 사용하여 평균보다 약간 더 길게 의도적으로 추측함으로써, 충돌 없이 작업이 제시간에 완료되도록 보장합니다.

아셀라의 작동 원리 (비밀 재료)

  1. 과거에서 배웁니다: 아셀라는 수백만 건의 과거 업데이트를 분석하여 패턴을 파악합니다.
  2. "이상한 경우"를 무시합니다: 때로는 서버에 하드웨어 결함이 있어 업데이트에 영원히 걸리는 경우 ("지체자") 가 있습니다. 아셀라가 이러한 결함들로부터 학습한다면, 모든 업데이트가 영원히 걸릴 것이라고 추측하게 될 것입니다. 따라서 아셀라는 학습하기 전에 이러한 극단적인 이상치를 지능적으로 필터링하여 지나치게 보수적으로 변하는 것을 방지합니다.
  3. 최고의 추측을 선택합니다: 다양한 예측 전략을 시도하면서 실패율을 낮게 유지하는 동시에 가장 많은 업데이트를 완료하는 방식을 선택합니다.

결과: 더 빠르고 매끄러운 도시
연구진이 메타의 실제 데이터 센터에서 아셀라를 테스트했을 때 결과는 인상적이었습니다.

  • 더 나은 시간 활용: 동일한 시간 동안 1.25 배 더 많은 작업을 처리했습니다. 업그레이드 창이 마침내 효율적으로 활용되기 시작했습니다.
  • 더 많은 업데이트: 업데이트 일정을 33% 더 잡을 수 있었고, 성공적으로 완료된 업데이트도 41% 더 늘렸습니다.
  • 더 적은 실패: 더 많은 작업을 수행했음에도 불구하고 실패하거나 취소된 업데이트의 수는 2.4 배 감소했습니다. 안전 목표 (업데이트의 95% 가 제시간에 완료됨) 를 훨씬 더 신뢰성 있게 달성했습니다.

한 마디로 요약하자면
아셀라 이전에는 데이터 센터가 지연을 두려워하여 천천히 움직이는 신중한 운전자가 교통 체증에 갇힌 것과 같았습니다. 아셀라는 모든 도로 여행의 소요 시간을 정확히 아는 GPS 와 같아, 운전자가 하루에 더 많은 여행을 하더라도 시간이 부족하지 않도록 해줍니다. 이는 속도와 안전 사이의 필요성을 균형 있게 조율하여 전체 시스템이 훨씬 더 매끄럽게 작동하도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →