The Loss Does Not See the Basis, but Adam Does
이 논문은 Adam이 인수 분해된 모델에서 저계수 해(low-rank solutions)를 회복하지 못하는 원인이 저계수 보간치에 대한 암묵적 편향을 보존하는 성질인 게이지 등변성(gauge equivariance)의 결여에 있음을 입증하며, 이 성질은 경사 하강법 및 기타 공유 스칼라 최적화 알고리즘들이 보유하고 있는 특성이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 숫자들이 격자 형태로 배열된 거대하고 지저한 퍼즐을 풀으려고 노력하고 있다고 상상해 보세요. 인공지능의 세계에서 이것은 "행렬 분해(matrix factorization)"라고 불립니다. 당신은 거대하고 복잡한 그림(데이터)을 가지고 있으며, 이 그림을 재현하기 위해 곱했을 때 원래의 그림을 만들어내는 두 개의 더 작고 단순한 카드 더미로 분해하고 싶어 합니다. 목표는 그림에 완벽하게 들어맞으면서도 가능한 가장 '단순한' 카드 더미를 찾는 것입니다. 이는 더 단순한 해결책이 패턴을 학습하는 대신 노이즈를 암기하는 함정을 피하게 해주어, 실제 세상에서 더 잘 작동하기 때문입니다.
이 퍼즐을 풀기 위해 컴퓨터는 "경사 하강법(gradient descent)"이라는 방법을 사용하는데, 이는 마치 등산객이 항상 내리막길로 발을 내디디며 골짜기의 바닥을 찾아가는 것과 같습니다. 오랫동안 과학자들은 만약 아주 작은 카드들로부터 시작한다면, 이 등산객이 자연스럽게 가장 단순한 해결책을 찾아낸다는 사실을 발견했습니다. 하지만, "Adam"(인기 있는 AI 도구)이라 불리는 더 빠른 새로운 등산객은 종종 길을 잃고, 단순한 해결책이 존재함에도 불구하고 복잡하고 지저분한 해결책을 찾아내곤 합니다. 큰 의문은 이것이었습니다: 왜 빠른 등산객은 단순한 경로를 찾지 못하며, 이를 느려지게 만들지 않고 어떻게 고칠 수 있을까?
"손실 함수는 기저를 보지 못하지만, Adam은 본다(The Loss Does Not See the Basis, But Adam Does)"라는 제목의 이 논문은 왜 이런 일이 발생하는지를 조사합니다. 저자는 문제가 단순히 속도에 관한 것이 아니라, 등산객이 세상을 어떻게 보느냐에 관한 것임을 발견했습니다. 이 퍼즐에는 숨겨진 대칭성이 있습니다: 당신은 카드 더미를 여러 방식으로 회전시킬 수 있으며, 그렇게 해도 최종 그림은 정확히 동일하게 유지됩니다. 지구본을 돌리는 것과 비슷합니다. 대륙은 움직이지만 지도는 여전히 같습니다. 전통적인 등산객(경사 하강법)은 특정 회전을 무시하고 단순히 골짜기의 모양만을 바라보며 자연스럽게 가장 단순한 해결책을 찾아냅니다. 하지만 빠른 등산객(Adam)은 카드의 특정 회전에 정신이 팔립니다. 그것은 수학적으로 동일함에도 불구하고, 한 방향은 "특별"하고 다른 방향은 "다르다"고 취급합니다. 이러한 주의 산만함이 단순한 저계수(low-rank) 해결책 대신 복잡한 고계수(high-rank) 해결책을 선택하게 만듭니다.
저자는 이 회전 대칭성을 존중하는 모든 옵티마이저(퍼즐을 푸는 도구)는 자연스럽게 단순한 해결책을 찾아내는 반면, 대칭성을 깨뜨리는 옵티마이저는 복잡한 해결책에 갇히게 된다는 것을 증명했습니다. 그들은 9가지 서로 다른 옵티마이저를 테스트했고 명확한 차이를 발견했습니다: "대칭을 존중하는" 것들(경사 하강법, Muon, 그리고 변형된 Adam)은 0.000006만큼 낮은 오류를 가진 해결책을 찾아낸 반면, "대칭을 깨뜨리는" 것들(표준 Adam 및 RMSProp)은 0.42 이상의 오류를 보였습니다—이는 엄청난 차이입니다.
이것이 단지 우연이 아님을 증명하기 위해, 그들은 Adam을 혼란스럽고 회전을 싫어하는 모드에서 회전에 친화적인 모드로 부드럽게 변화시키는 "다이얼"을 만들었습니다. 그들이 다이얼을 돌림에 따라 해결책은 더 단순하고 정확해졌으며, 이는 Adam이 데이터를 바라보는 특정한 방식이 바로 문제의 원인임을 보여주었습니다. 그들은 심지어 지구의 초분광 이미지와 같은 실제 데이터에서도 테스트를 진행했고, 회전에 친화적인 방법들이 표준 Adam에 비해 오류를 약 44% 줄였다는 것을 발견했습니다.
흥미롭게도, 이 논문은 "회전 친화적"인 것이 항상 마법 같은 해결책은 아니라는 점도 발견했습니다. 만약 퍼즐 자체가 무작위 노이즈(스펙트럼 꼬리)가 많은 지저분한 상태라면, 매우 빠르고 회전에 친화적인 등산객인 Muon은 때때로 너무 의욕이 앞서 노이즈까지 학습해 버리는 반면, 느리고 꾸준한 등산객(경사 하강법)이 더 나은 성과를 냅니다. 따라서 최적의 도구는 퍼즐의 구체적인 성격에 따라 달라집니다.
마지막으로, 저자는 이것이 트랜스포머(Transformer)라고 불리는 현대 AI 모델(챗봇의 두뇌)에 어떤 영향을 미치는지 살펴보았습니다. 그들은 만약 두 개의 동일한 AI 모델을 같은 수학적 구조를 가졌지만 내부 카드를 다르게 회전시킨 상태로 시작한다면, 표준 Adam 옵티마이저가 단 한 걸음 만에 두 모델을 완전히 다르게 행동하게 만든다는 것을 발견했습니다. 비록 동일한 함수로서 시작했음에도 불구하고, 그들은 완전히 다른 내부 구조를 갖게 됩니다. 이는 옵티마이저의 선택이 단순한 튜닝 세부 사항이 아니라, AI가 배우는 해결책의 버전을 근본적으로 결정한다는 것을 의미합니다. 이 논문은 최상의 단순한 결과를 얻기 위해서는 숫자를 배치하는 특정한 방식에 현혹되는 것이 아니라, 수학의 숨겨진 대칭성을 존중하는 옵티마이저가 필요하다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.