← 최신 논문
🤖 machine learning

Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training

이 논문은 최적화기 상태를 이종 메모리 계층 구조에 걸쳐 동적으로 분배하고 비싼 전구조건부 계산들을 중요한 GPU 훈련 경로에서 분리하여 오버헤드를 줄이고 수렴을 가속화함으로써 대규모 언어 모델을 위한 실용적이고 확장 가능한 2 차 최적화를 가능하게 하는 런타임 시스템인 Asteria 를 소개합니다.

원저자: Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 초지능적인 로봇(대형 언어 모델)에게 이야기 쓰기를 가르치려 한다고 상상해 보세요. 이를 위해 로봇의 실수를 보고 개선 방법을 알려주는 '교사'(최적화기) 가 필요합니다.

현재 대부분의 교사는 AdamW라는 간단한 방법을 사용합니다. 이는 숙제를 확인하고 몇 가지 틀린 답을 발견한 뒤 작고 빠른 수정을 가하는 학생과 같습니다. 빠르고 효과적이지만, 정말 잘하기 위해서는 (수백만 개의 예시와 같은) 엄청난 연습이 필요합니다.

2 차 최적화 (Second-Order Optimization) (SOAP 또는 Shampoo 와 같은) 라는 더 지능적이고 고급스러운 교사 방법이 있습니다. 이 교사는 단순히 무엇이 잘못되었는지 보는 것을 넘어, 실수의 형태를 분석하여 문제를 깊이 있게 이해합니다. 훨씬 더 빠르게 학습하며 더 적은 예시만으로도 충분합니다. 하지만 엄청난 단점이 있습니다. 이 똑똑한 교사는 압도적으로 무겁습니다. 복잡한 수학을 수행하기 위해 막대한 양의 메모리와 연산 능력이 필요하여, 종종 컴퓨터가 충돌하거나 너무 느려져 단순한 교사가 먼저 작업을 끝내기도 합니다.

Asteria 등장: '지능형 물류 관리자'

옥스퍼드 연구팀이 Asteria라는 새로운 시스템을 개발했습니다. Asteria 는 새로운 교사가 아니라, 똑똑한 교사가 학교를 망치지 않고 제 역할을 할 수 있도록 교실 전체를 재편성하는 천재적인 물류 관리자로 생각하세요.

Asteria 가 세 가지 가장 큰 문제를 어떻게 해결하는지 간단한 비유로 설명해 드리겠습니다.

1. "작은 방에 있는 가구" 문제 (메모리)

문제: 똑똑한 교사는 거대하고 복잡한 차트 (행렬) 를 머릿속 (GPU 메모리) 에 보관해야 합니다. 표준 컴퓨터에는 공간이 부족합니다. 스튜디오 아파트에 킹사이즈 침대, 식탁, 옷장을 모두 넣으려 하는 것과 같습니다. 방이 꽉 차면 교사는 일을 그만두어야 합니다.
Asteria 의 해결책: Asteria 는 접이식 가구 전문가처럼 행동합니다. 교사가 한 번에 모든 것을 손에 들고 있을 필요가 없다는 것을 깨닫습니다.

  • 가장 활발하게 사용되는 차트 부분은 GPU (책상) 에 보관합니다.
  • 무겁고 덜 자주 사용되는 부분은 CPU (복도) 나 심지어 하드 드라이브 (차고) 로 이동시킵니다.
  • 결정적으로, 무거운 부분들은 정확히 필요할 때만 책상으로 다시 가져옵니다. 이를 통해 똑똑한 교사는 슈퍼컴퓨터뿐만 아니라 작은 노트북에서도 똑같이 잘 일할 수 있습니다.

2. "교통 체증" 문제 (속도)

문제: 몇 단계마다 똑똑한 교사는 차트를 업데이트하기 위해 거대하고 복잡한 계산 (거대한 퍼즐을 푸는 것과 같은) 을 수행해야 합니다. 이는 시간이 오래 걸려 전체 클래스의 작업을 멈추게 합니다. 단일 택배 상자를 내리기 위해 고속도로 전체를 막는 배송 트럭과 같습니다. GPU (컴퓨터의 두뇌) 는 계산을 기다리며 유휴 상태로 앉아 있습니다.
Asteria 의 해결책: Asteria 는 병렬 조립 라인을 도입합니다.

  • 무거운 계산을 위해 메인 클래스를 멈추는 대신, Asteria 는 '무거운 작업'을 뒷사무실 (CPU) 에 있는 작업 팀에게 보냅니다.
  • 메인 클래스 (GPU) 가 로봇을 가르치는 동안, 뒷사무실 작업자들은 조용히 배경에서 복잡한 퍼즐을 풉니다.
  • 클래스가 새로운 차트가 필요할 때쯤이면, 뒷사무실은 이미 작업을 마치고 차트를 밀어 넣은 상태입니다. 메인 클래스는 멈출 필요가 없습니다. '교통 체증'이 사라집니다.

3. "그룹 채팅" 문제 (분산 학습)

문제: 여러 컴퓨터로 동시에 학습할 때, 모든 사람이 다음 단계로 넘어가기 전에 반드시 동일한 정보를 정확히 합의할 때까지 멈춰야 합니다. 이는 가장 느린 사람이 답장할 때까지 기다려야 모든 사람이 다시 타이핑할 수 있는 그룹 채팅과 같습니다.
Asteria 의 해결책: Asteria 는 "충분히 좋은" 정책을 사용합니다.

  • 모든 사람이 완벽하게 동기화될 때까지 기다리는 대신, 컴퓨터들이 잠시 동안 약간 '오래된 (stale)' 정보를 가지고 작업할 수 있도록 허용합니다.
  • 정말 필요할 때만 업데이트를 전송합니다.
  • 이는 전체 프로젝트를 5 분마다 멈추는 대신, 서로를 신뢰하며 작업을 계속하다가 나중에 업데이트를 받아보는 팀처럼 그룹이 빠르게 움직이게 합니다.

결과: 그들은 무엇을 발견했나?

연구팀은 Nvidia DGX Spark 와 같은 강력한 단일 컴퓨터와 Nvidia GH200 과 같은 대규모 컴퓨터 클러스터를 포함한 실제 하드웨어에서 Asteria 를 테스트했습니다.

  • 작은 기계에서도 작동합니다: 이전에는 이 똑똑한 교사의 메모리 요구 사항을 처리하지 못했던 단일 기계에서도 10 억 개의 파라미터를 가진 대형 언어 모델을 학습시킬 수 있었습니다.
  • 실시간으로 더 빠릅니다: '교통 체증'을 숨기기 때문에, 수학이 더 어렵더라도 실제 시계 시간은 더 단축되어 학습이 완료됩니다.
  • 에너지를 절약합니다: 컴퓨터의 두뇌 (GPU) 를 유휴 상태로 두지 않고 바쁘게 유지함으로써, Asteria 는 이전의 둔한 방법들보다 동일한 결과를 얻는 데 실제로 더 적은 총 에너지를 사용합니다.
  • 품질이 떨어지지 않습니다: 모델은 '네이티브'(최적화되지 않은) 똑똑한 교사와 똑같이 잘 학습하지만, 훨씬 더 빠르고 저렴하게 도달합니다.

요약:
Asteria 는 새로운 수학 공식을 발명하지 않습니다. 대신 컴퓨터가 그 수학을 어떻게 실행하는지 재고합니다. 무거운 작업을 메인 작업과 분리하고, 사용 가능한 모든 저장 공간을 현명하게 활용하며, 컴퓨터들이 비동기적으로 작업하도록 합니다. 이는 이론적으로는 훌륭하지만 실제로는 불가능한 방법을 차세대 AI 학습을 위한 실용적인 도구로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →