← 최신 논문
🤖 machine learning

Gefen: Optimized Stochastic Optimizer

이 논문은 자동화된 2차 모멘트 공유와 학습된 1차 모멘트 양자화를 통해 AdamW의 메모리 사용량을 약 8배 줄임으로써, 성능을 동등하게 유지하면서도 더 큰 배치 크기와 향상된 처리량을 가능하게 하는 메모리 효율적인 옵티마이저인 Gefen을 소개한다.

원저자: Nadav Benedek, Tomer Koren, Ohad Fried

게시일 2026-06-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nadav Benedek, Tomer Koren, Ohad Fried

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 로봇(딥러닝 모델)에게 새로운 기술을 가르치기 위해 훈련시키고 있다고 상상해 보세요. 이를 위해 로봇은 매 연습 세션이 끝날 때마다 내부 설정을 어떻게 조정해야 할지 알려주는 '코치'(옵티마이저)가 필요합니다. 현재 가장 인기 있는 코치는 AdamW라고 불립니다.

AdamW는 훌륭한 코치이지만, 무거운 배낭을 메고 있습니다. 로봇의 모든 설정 하나하나에 대해, AdamW는 과거의 실수와 변화의 속도를 기억하기 위한 두 개의 추가적인 노트(이를 '1차 및 2차 모멘트 상태'라고 부릅니다)를 들고 다닙니다. 만약 당신의 로봇에게 10억 개의 설정이 있다면, AdamW의 배낭은 20억 개의 설정만큼의 무게를 더 추가합니다. 이 배낭이 너무 무거워서 표준 훈련용 컴퓨터에는 거대한 로봇을 실을 수 없거나, 로봇이 아주 작고 느린 단계로만 연습하게 만들어야 합니다.

이 논문은 Geben이라는 새로운 코치를 소개합니다. Gefen은 '메모리 효율적인' 옵티마이저로, 학습 속도와 품질을 AdamW와 똑같이 유지하면서도 그 무거운 배낭을 8배나 줄여줍니다.

Geben이 이 일을 어떻게 해내는지, 몇 가지 간단한 비유를 통해 설명하겠습니다.

1. "그룹 포옹" 전략 (노트 공유하기)

문제점: AdamW는 로봇의 뇌에 있는 모든 숫자 하나하나에 대해 별도의 노트를 작성합니다.
Geben의 해결책: Gefen은 이러한 숫자들 중 상당수가 사실 "단짝 친구"라는 사실을 깨달았습니다. 이들은 세상에 반응하는 방식이 매우 유사합니다. Gefen은 이 모든 친구에게 각각 고유한 노트를 쓰는 대신, 이들을 팀(블록)으로 묶고 팀 전체에 하나의 공유된 노트를 부여합니다.

  • 누가 그룹이 될지 어떻게 알까요? 보통은 누가 친구인지 확인하기 위해 매우 복잡한 지도(헤시안 행렬이라 불리는 것)가 필요하지만, 이 지도는 거대 로봇을 위해 그리기에 너무 큽니다.
  • Geben의 비법: Gefen은 로봇의 아주 첫 번째 연습 세션을 살펴봅니다. 어떤 숫자들이 비슷한 패턴으로 함께 움직였는지 관찰하죠. 그리고 이렇게 가정합니다. "시작할 때 함께 움직였다면, 나중에도 아마 함께 움직일 것이다." 그런 다음 이 숫자들을 자동으로 그룹화합니다. 사람이 어떤 그룹을 만들지 알려줄 필요 없이, 스스로 알아서 찾아냅니다.

2. "스케치 아티스트" 전략 (양자화)

문제점: 공유된 노트를 사용하더라도, 그 안의 숫자들은 여전히 높은 정밀도(예: 소수점 10자리)로 기록되어 있어 공간을 많이 차지합니다.
Geben의 해결책: Gefen은 "스케치 아티스트" 접근 방식을 사용합니다. 숫자를 정확하게 적는 대신(예: 0.123456789), 미리 만들어진 목록(코드북)에서 가장 가까운 "표준 값"으로 반올림하여 기록합니다.

  • 스마트한 목록: 대부분의 옵티마이저는 고정된 일반적인 목록(예: 일정한 눈금이 있는 자)을 사용합니다. 하지만 Gefen은 자신이 코칭하는 특정 로봇을 살펴보고, 오직 그 로봇만을 위한 완벽한 눈금 목록을 학습합니다. 데이터에 완벽하게 들어맞는 맞춤형 자를 만들기 위해 스마트한 수학적 방법(동적 계획법)을 사용하며, 이를 통해 오차를 최소나합니다.
  • 안정성: 시작 단계에서 이 목록을 학습하고 나면, 전체 과정 동안 동일한 목록을 계속 사용합니다. 매일 자를 새로 그릴 필요가 없으므로 시간이 절약되고 안정성을 유지할 수 있습니다.

결과: 더 가벼운 배낭, 동일한 성능

저자들은 작은 이미지 분류기부터 대규모 언어 모델(Llama 3와 같은)에 이르기까지 다양한 모델에 대해 Gefen을 테스트했습니다.

  • 메모리: Gefen은 AdamW에 비해 옵티마이저에 필요한 메모리를 약 8배 줄였습니다. 130억 개의 파라미터를 가진 모델의 경우, 97GB의 메모리를 단 1.5GB로 절감합니다.
  • 속도: 배낭이 가볍기 때문에 로봇은 한 번에 더 큰 "마이크로 배치"(연습 그룹)를 운반할 수 있습니다. 여러 대의 컴퓨터를 사용하는 테스트(FSDP 및 DDP)에서, 컴퓨터들이 메모리가 확보되기를 기다리지 않아도 되었기 때문에 훈련 속도가 56% 더 빨라졌습니다.
  • 품질: 강력한 압축과 공유에도 불구하고, 로봇은 무거운 AdamW 배낭을 졌을 때와 똑같이 잘 학습되었습니다. 최종 성능(정확도 또는 손실값)은 동일했습니다.

이것이 왜 중요한가

이것은 여행을 위해 짐을 싸는 것과 같습니다. AdamW는 모든 양말 하나하나에 개별 상자를 넣어 짐을 싸는 것과 같습니다. Gefen은 모든 양말을 하나의 단단한 뭉치로 말아서 작은 주머니 하나에 넣는 것이 훨씬 효율적이라는 사실을 깨닫는 것과 같습니다. 공간은 엄청나게 절약되지만, 여전히 모든 양말을 가지고 있으며 목적지까지 똑같이 빠르게 도착할 수 있습니다.

논문은 Gefen이 "드롭인 교체(drop-in replacement)"가 가능하다고 주장합니다. 즉, 기존 훈련 코드의 설정을 변경할 필요 없이 바로 교체하여 사용할 수 있으며, 즉시 메모리를 절약하고 훈련 속도를 높일 수 있다는 뜻입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →