← 최신 논문
🤖 machine learning

HORST: Composing Optimizer Geometries for Sparse Transformer Training

본 논문은 쌍곡 거울 사역을 통해 L1L_1 희소성 편향을 결합하면서 적응형 방법의 안정성을 통합하기 위해 비가환 연산자 단계를 구성하는 모듈형 최적화 알고리즘인 HORST 를 소개하며, 이는 비전 및 언어 작업 전반에 걸쳐 희소 트랜스포머 훈련에서 AdamW 를 크게 능가합니다.

원저자: Tom Jacobs, Rohan Jain, Rebekka Burkholz

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tom Jacobs, Rohan Jain, Rebekka Burkholz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"HORST: Composing Optimizer Geometries for Sparse Transformer Training"이라는 논문에 대한 설명을 간단한 언어와 창의적인 비유로 번역한 것입니다.

큰 문제: "무거운" AI

거대하고 엄청나게 똑똑한 로봇 (Transformer) 을 만들었다고 상상해 보세요. 이 로봇은 이야기를 쓰고, 언어를 번역하며, 이미지를 인식할 수 있습니다. 하지만 이 로봇은 너무 무겁고 덩치가 커서 작동시키기만 해도 거대한 창고 (엄청난 메모리) 와 거대한 발전소 (엄청난 연산 비용) 가 필요합니다.

이 로봇을 실용적으로 만들기 위해 우리는 "불필요한 지방"을 잘라내야 합니다. 불필요한 근육과 기어 (가중치) 를 제거하여 가볍고 빠르게 만들고자 하는 것입니다. 이를 희소화 (sparsification) 라고 합니다.

문제는 이 특정 유형의 로봇을 잘라내려 할 때, 로봇이 종종 무너진다는 것입니다. 지능을 잃어버리는 것이죠. 왜일까요? 로봇을 가르치는 "훈련자" (옵티마이저) 가 실수로 로봇에게 너무 균형 잡힌 상태를 만들도록 가르치기 때문입니다.

두 명의 훈련자: "균형 조정자" 대 "선택자"

이 논문은 이러한 로봇을 훈련시키는 방식이 숨겨진 편향을 만든다고 주장합니다. 마치 두 명의 다른 코치가 운동 선수를 가르치는 것과 같다고 생각해 보세요.

  1. "균형 조정자" 코치 (AdamW 와 같은 표준 옵티마이저):

    • 작동 방식: 이 코치는 안정적이고 안전하기 위해서는 모든 근육이 대략 같은 크기여야 한다고 믿습니다. 한 근육이 너무 커지면 줄이고, 다른 근육이 너무 작아지면 키웁니다.
    • 결과: 로봇은 모든 부분이 약간씩 활동하는 몸매를 갖게 됩니다. 매우 안정적이지만 무겁습니다. "영 (zero)"인 근육이 없습니다. 모든 것이 조금씩 일을 하고 있기 때문에 무언가를 쉽게 잘라낼 수 없습니다.
    • 논문의 용어: 이는 LL_\infty 편향 (모든 것이 균등화됨) 입니다.
  2. "선택자" 코치 (Mirror Descent / 희소성 편향):

    • 작동 방식: 이 코치는 전문화를 믿습니다. 로봇이 몇 개의 초강력 근육을 선택하고 나머지는 완전히 끄기를 원합니다. 로봇이 에너지를 아주 적은 부분에만 집중하도록 강요합니다.
    • 결과: 로봇은 매우 가볍고 희소해집니다. 하지만 오직 이 코치만 사용하면 로봇이 너무 공격적이어서 훈련 중 불안정해지거나 충돌할 수 있습니다.
    • 논문의 용어: 이는 L1L_1 편향 (질량 집중) 입니다.

갈등: 표준 AI 훈련은 안정적이기 때문에 "균형 조정자"를 사용합니다. 하지만 AI 를 작게 (희소하게) 만들려면 "선택자"가 필요합니다. 단순히 코치를 바꾸는 것은 불가능합니다. "선택자"는 복잡한 로봇에게는 너무 위험하고, "균형 조정자"는 지방을 잘라내게 허용하지 않기 때문입니다.

해결책: "조합된" 코치 (HORST)

토미 야콥스 (Tom Jacobs) 와 그의 팀은 하나의 코치만 선택할 필요가 없다는 것을 깨달았습니다. 매우 구체적인 순서로 두 가지를 모두 사용하는 하이브리드 훈련 루틴을 만들 수 있습니다.

그들은 새로운 방법을 HORST(Robust Sparse Training 을 위한 Hyperbolic Operator) 라고 부릅니다.

비유: 조각가와 도끼
거대한 대리석 덩어리 (신경망) 에서 조각상을 조각한다고 상상해 보세요.

  • 1 단계 (균형 조정자/Adam): 먼저, 넓은 평평한 도구를 사용하여 거친 가장자리를 다듬고 조각상이 흔들리지 않고 똑바로 서 있도록 합니다. 이는 구조를 안정적으로 유지합니다.
  • 2 단계 (선택자/쌍곡선 거울): 다듬은 직후, 날카롭고 정밀한 도끼를 사용하여 과도한 돌을 조각해 내고 모양이 얇고 희소해지도록 강제합니다.

비밀 재료: 순서가 중요합니다!

  • 먼저 도끼로 깎고 그다음에 다듬으면, 다듬는 도구가 방금 만든 구멍을 메워버립니다. 희소성이 사라집니다.
  • 먼저 다듬고 그다음에 도끼로 깎으면, 도끼는 안정된 모양을 다듬어 추가 무게를 성공적으로 제거합니다.

이 논문은 수학적으로 이 특정 순서 (안정 단계 \rightarrow 희소성 단계) 가 로봇이 안정성을 유지하면서도 극도로 가벼워질 수 있음을 증명합니다.

그들이 발견한 것 (결과)

팀은 이 새로운 "조합된 코치" (HORST) 를 두 가지 유형의 로봇에서 테스트했습니다.

  1. 비전 트랜스포머: 이미지를 보는 로봇 (고양이나 자동차를 식별하는 등).
  2. 언어 트랜스포머: 텍스트를 이해하는 로봇 (이 요약을 작성하는 것 같은).

결과:

  • 로봇의 가중치 80%~90% 를 잘라내려 할 때 (매우 희소하게 만들 때), 표준 코치 (AdamW) 는 로봇의 성능을 극도로 떨어뜨렸습니다. 로봇은 보거나 말하는 법을 잊어버렸습니다.
  • HORST 코치는 대부분의 가중치를 잘라낸 후에도 로봇이 전체 무거운 버전과 거의 비슷하게 작동하도록 유지했습니다.
  • 간단히 말해: HORST는 로봇의 뇌를 망가뜨리지 않고 로봇을 작게 만드는 방법을 찾았습니다.

요약

이 논문은 "AI 모델을 작게 만들면서 어리석게 만들지 않는 방법은 무엇인가?"라는 퍼즐을 해결합니다.

  • 옛 방법: 안정적인 훈련자를 사용하지만, 모델을 작게 만들지 못하게 합니다.
  • 새 방법 (HORST): 올바른 순서로 안정적인 훈련자와 희소성 훈련자를 결합합니다.
  • 결과: 구성 요소의 90% 를 제거하더라도 여전히 완벽하게 작동하는 가볍고 효율적인 AI 를 얻게 됩니다.

저자들은 가중치를 "잘라내는" 새로운 방법 (가지치기 등) 을 발명한 것이 아니라, 모델이 무너지지 않으면서 가중치가 자연스럽게 잘려지기를 원하도록 모델을 "훈련"시키는 새로운 방법을 발명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →