← 최신 논문
🤖 machine learning

Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs

이 논문은 효율적인 섭동 전략을 자동으로 학습하는 메모리 효율적 설계를 통해 모델당 1회 학습을 가능하게 하며, 기존의 정적 제로 차수 방법들과 비교하여 다양한 다운스트림 태스크에서 우수한 성능을 구현하는 학습 기반 제로 차수 옵티마이저인 ZO-Finetuner를 소개한다.

원저자: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 글을 쓰고, 추론하고, 대화할 줄 아는 거대하고 믿기지 않을 정도로 복잡한 도서관(거대 언어 모델, 즉 LLM)을 가지고 있다고 상상해 보세요. 당신은 이 도서관에 법률 계약서를 작성하거나 수학 문제를 푸는 것과 같은 새롭고 특정한 기술을 가르치고 싶습니다. 이 과정을 "파인튜닝(fine-tuning)"이라고 부릅니다.

보통 이 도서관을 가르치는 일은 "역전파(backpropagation)"라는 매우 비싼 방법을 수반합니다. 이것은 마치 선생님이 학생이 문장을 쓸 때마다 도서관 전체를 돌아다니며 모든 책을 확인하고, 학생의 뇌를 어떻게 조정해야 할지 정확하게 계산해야 하는 것과 같습니다. 이는 정확하지만, 엄청난 양의 메모리와 에너지를 필요로 하기 때문에 일반적인 컴퓨터로는 불가능한 경우가 많습니다.

이를 해결하기 위해 연구자들은 "제로 차수(Zeroth-Order)" 방식(MeZO와 같은)을 개발했습니다. 역전파가 전체 그림을 보는 방식이라면, 이 방식은 눈을 가린 탐험가와 같습니다. 탐험가는 작은 추측(섭동, perturbation)을 하고, 그 결과가 좋아졌는지 나빠졌는지를 확인한 뒤, 반대 방향으로 또 다른 작은 추측을 합니다. 이 두 결과를 비교함으로써, 전체 그림을 전혀 보지 않고도 어느 방향으로 가야 할지 알아낼 수 있습니다. 이 방식은 메모리를 엄청나게 절약해 줍니다.

문제점: "일률적인" 지도
기존의 눈 가린 탐험가들은 고정된 무작위 전략을 사용합니다. 그들은 표준적이고 지루한 규칙(예: 공정한 주사위 던지기)에 기반하여 방향을 추측합니다. 이것이 비효율적이라는 것이 이 논문의 주장입니다. 때때로 도서관에는 매우 정밀해야 하는 "방(매개변수 블록)"이 있는 반가, 더 과감하게 움직여도 되는 방이 있습니다. 고정된 전략은 이를 알지 못합니다. 모든 부분을 똑같이 취급하기 때문입니다.

해결책: ZO Fine-tuner (스마트한 탐험가)
저자들은 "학습하는 법을 배우는(learning-to-learn)" 시스템인 ZO Fine-tuner를 만들었습니다. 고정된 규칙을 사용하는 대신, 이들은 아주 작고 효율적인 "코치(작은 신경망)"를 훈련시켜 탐험가가 더 잘 추측할 수 있도록 가르치게 했습니다.

작동 방식은 다음과 같은 비유를 통해 설명할 수 있습니다:

  1. 코치 (ZO Fine-tuner): 코치가 탐험가를 지켜보는 상황을 상상해 보세요. 코치는 도서관 전체를 볼 필요가 없습니다. 대신 코치는 몇 가지 간단한 통계치를 봅니다: "지금 이 방은 얼마나 어지러운가?" 그리고 "지난번 추측이 도움이 되었는가, 아니면 해가 되었는가?" 이를 바탕으로 코치는 탐험가에게 이렇게 말합니다. "이 특정 방에서는 크고 대담한 발걸음을 떼세요. 저 다른 방에서는 작고 조심스러운 발걸음을 떼세요."
  2. 블록 전략: 도서관은 거대합니다(수십억 개의 매개변수). 만약 코치가 모든 책 하나하나에 대해 지침을 내리려 한다면, 너무 느리고 메모리가 많이 들 것입니다. 하지만 연구자들은 도서관이 "블록(책의 구역들)" 단위로 구성되어 있다는 점에 주목했습니다. 코치는 블록당 하나의 지침을 내리는 법을 배웁니다. 이것은 코치가 개별 플레이어 한 명 한 명에게 소리치는 대신, 팀 전체가 어떻게 움직여야 하는지 팀원들에게 알려주는 것과 같습니다. 이 방식은 메모리 사용량을 아주 작게 유지해 줍니다.
  3. "한 번 훈련하여 널리 재사용하는" 마법: 보통 새로운 작업을 할 때마다 새로운 코치를 훈련시켜야 합니다. 하지만 저자들은 놀라운 사실을 발견했습니다. 도서관의 "형태"는 수학을 가르치든 이야기를 쓰든 크게 변하지 않는다는 것입니다. 그래서 그들은 단 하나의 데이터셋(COPA)으로 코치를 단 한 번 훈련시켰습니다. 그러고 나서 그 동일한 코치를 가져가서 감성 분석이나 독해력과 같은 완전히 다른 작업, 심지어 다른 버전의 도서관을 가르치는 데 사용했습니다.
    • 결과: 한 가지 작업으로 훈련된 코치가 다른 모든 작업에서도 놀라울 정도로 잘 작동했습니다. 이는 마치 운전자를 특정 트랙에서 훈련시킨 뒤, 새로운 연습 없이도 완전히 다른 고속도로에서 완벽하게 운전하게 만드는 것과 같습니다.

결과
이 논문은 네 가지 거대 언어 모델과 일곱 가지 작업에 대해 테스트를 진행했습니다.

  • 성능: 약 **82%**의 경우에서, 이 새로운 "스마트 탐험가"는 기존의 "고정 규칙" 탐험가들보다 더 빠르게 더 나은 결과에 도달했습니다.
  • 효율성: 추가적인 메모리를 거의 요구하지 않았습니다. "코치" 자체는 매우 작아서(300억 개의 매개변수를 가진 모델에 대해 2MB 미만), 마치 60GB짜리 백과사전에 노트 한 페이지를 추가하는 것과 같습니다.
  • 안정성: 이 새로운 방식은 "학습률(learning rate, 단계의 크기)"에도 덜 민감했습니다. 설령 당신이 더 큰 발걸음을 떼라고 명령하더라도, 기존 방식들처럼 쉽게 무너지지 않았습니다.

요약
이 논문은 슈퍼컴퓨터 없이도 거대 AI 모델에 새로운 기술을 가르치는 방법을 소개합니다. 그들은 경직되고 무작위적인 추측 전략을 대신하여, 모델의 각 부분에 대해 더 나은 방향을 추측하도록 학습하는 작고 스마트한 코치를 도입했습니다. 일단 이 코치를 훈련시키면, 다른 많은 작업을 효율적으로 가르치기 위해 재사용할 수 있으며, 이를 통해 시간과 컴퓨터 메모리를 모두 절약할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →