← 최신 논문
🤖 machine learning

On Adaptivity in Zeroth-Order Optimization

본 논문은 고차원에서의 좌표별 기울기 이질성이 부재하기 때문에 메모리 제약이 있는 LLM 미세 조정 시 ZO-Adam 과 같은 표준 적응형 영차수 최적화 기법이 ZO-SGD 보다 수렴 측면에서 이점을 제공하지 않음을 입증하고, 이에 따라 전역 단계 크기 적응을 위해 단일 스칼라 값만 추적하면서도 성능은 유지하고 견고성은 향상시키는 메모리 효율적 대안인 MEAZO 를 제안합니다.

원저자: Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser, Christos Louizos

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser, Christos Louizos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Zeroth-Order Optimization 에서의 적응성"이라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어보겠습니다.

큰 그림: 매뉴얼 없이 거대한 라디오를 튜닝하기

수백만 개의 노브가 있는 거대하고 복잡한 라디오를 상상해 보세요. 이 노브들은 대규모 언어 모델 (LLM) 의 '파라미터'입니다. 이 라디오를 특정 노래를 완벽하게 재생하도록 튜닝하고 싶다면 (모델을 파인튜닝하는 것), 보통 각 노브를 어느 방향으로 얼마나 돌려야 하는지 알려주는 매뉴얼이 필요합니다. AI 에서는 이 매뉴얼을 **기울기 (gradient)**라고 부릅니다. 이 매뉴얼을 계산하려면 많은 메모리와 연산 능력이 필요하여 비용이 많이 들고 느립니다.

Zeroth-Order (ZO) 최적화는 영리한 트릭입니다. 매뉴얼을 읽는 대신 노브를 무작위로 살짝 밀어보고, 그 결과를 들어보며 음악이 나아졌는지 나빠졌는지 확인하는 것입니다. 노브를 앞뒤로 밀어 방향을 추정하는 방식으로 작동합니다. 메모리 사용량은 훨씬 적지만, 추측에 기반하기 때문에 '노이즈'가 많습니다.

문제: "과도하게 설계된" 나침반

오랫동안 연구자들은 이 추측 게임이 노이즈가 많기 때문에, 이를 도와줄 초지능적이고 메모리를 많이 쓰는 나침반이 필요하다고 생각했습니다. 이것이 **적응형 옵티마이저 (ZO-Adam 등)**가 하는 일입니다. 그들은 각 노브를 얼마나 빠르게 돌려야 할지 결정하기 위해 수백만 개의 노브 각각의 이력을 기억하려 합니다. 수백만 개의 노브 각각을 위한 별도의 '기억 로그'를 유지합니다.

이 논문의 큰 발견:
저자들은 고차원 환경 (거대 AI 모델과 같은) 에서 이 초지능 나침반이 실제로 쓸모없다는 것을 발견했습니다.

  • 비유: 안개 낀 들판에서 계곡의 바닥을 찾으려 한다고 상상해 보세요.
    • First-Order (표준 AI): 왼쪽으로는 땅이 가파르게 내려가고 오른쪽으로는 평평하다는 것을 보여주는 명확한 지도가 있습니다. 각 방향마다 다른 전략이 필요합니다.
    • Zeroth-Order (추측 게임): 거대하고 안개 낀 공간에서 무작위로 노브를 밀어 추측하기 때문에, 추측의 '노이즈'가 너무 커서 지형의 세부 사항을 덮어버립니다. 신호는 모든 방향에서 동일하게 보입니다. 안개가 너무 짙어서 땅이 모든 곳에서 완벽하게 평평하고 균일하게 보이는 것과 같습니다.
  • 결과: '지형'이 모든 방향에서 동일하게 보이므로, 각 노브마다 별도의 기억 로그를 유지하는 것은 시간과 메모리의 낭비입니다. 정교한 '적응형' 방법 (ZO-Adam) 은 단순한 방법 (ZO-SGD) 보다 계곡 바닥에 더 빨리 도달하는 데 실제로 도움이 되지 않습니다. 오히려 등짐만 무겁게 만들 뿐입니다.

해결책: MEAZO (최소한의 나침반)

정교한 나침반이 불필요하므로, 저자들은 MEAZO라는 새로운 도구를 만들었습니다.

  • 작동 원리: 각 노브에 대한 수백만 개의 개별 로그를 추적하는 대신, MEAZO 는 전체 그룹에 대해 단 하나의 숫자만 추적합니다. "전체를 살짝 밀었을 때 음악이 평균적으로 얼마나 변했는가?"를 묻는 것입니다.
  • 장점: 적응형 방법의 '지능적인' 부분 (지형이 얼마나 거친지에 따라 밀기의 속도를 조정) 은 유지하되, 무거운 짐은 버립니다.
  • 비유: 등산을 한다고 상상해 보세요.
    • ZO-Adam: 매 한 걸음마다 GPS, 기압계, 나침반, 상세 지도를 모두 들고 갑니다. 무겁고 지칩니다.
    • ZO-SGD: 그냥 앞으로 걷기만 합니다. 가볍지만, 길이 울퉁불퉁하면 넘어질 수 있습니다.
    • MEAZO: 경로의 평균 경사도를 알려주는 간단한 보폭계를 들고 갑니다. 길이 울퉁불퉁하면 속도를 늦추고, 평탄하면 속도를 높입니다. 돌 하나하나마다 지도가 필요하지 않습니다. 단지 길의 전반적인 분위기를 알면 됩니다.

실험 결과

팀원은 실제 대규모 언어 모델 (Llama 와 Qwen 등) 과 합성 수학 문제로 이를 테스트했습니다.

  1. 성능: 설정을 올바르게 조정했을 때, 단순한 방법 (ZO-SGD) 은 정교한 방법 (ZO-Adam) 과 마찬가지로 잘 작동했습니다.
  2. 메모리: MEAZO 는 단순한 방법과 마찬가지로 아주 적은 양의 메모리를 사용하는 반면, 정교한 방법은 훨씬 더 많은 메모리를 사용했습니다.
  3. 견고성 (안전망): 이것이 가장 중요한 발견입니다. 단순한 방법은 완벽한 걷기 속도를 선택하면 훌륭하게 작동하지만, 속도가 너무 빠르거나 너무 느리면 무너집니다. 정교한 방법 (및 MEAZO) 은 훨씬 더 관대합니다. '나쁜' 속도를 선택하더라도 MEAZO 는 충돌 없이 목적지까지 데려다줍니다. 언덕에 자동으로 적응하는 크루즈 컨트롤이 달린 차와 같고, 단순한 차는 고정된 속도로 계속 달려서 요철에 부딪힐 수 있는 것과 같습니다.

요약

  • 신화: "Zeroth-Order AI 학습을 잘 작동하게 하려면 복잡하고 메모리를 많이 쓰는 적응형 도구가 필요하다."
  • 현실: 고차원 AI 모델에서는 노이즈가 지형을 균일하게 보이게 하므로, 복잡한 도구는 메모리 낭비일 뿐입니다.
  • 해결책: MEAZO는 수백만 개 대신 단 하나의 전역 숫자만 추적하는 새로운 도구입니다. 단순한 방법처럼 메모리를 매우 적게 사용하면서도, 복잡한 방법처럼 설정에 대해 훨씬 더 안정적이고 관대합니다.

이를 통해 연구자들은 슈퍼컴퓨터 없이도 메모리가 제한된 장치 (엣지 장치 등) 에서 대규모 AI 모델을 파인튜닝하면서도 안정적이고 고품질의 결과를 얻을 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →