← 최신 논문
💻 computer science

Exclusive Self-Attention Beyond AdamW: Stability and Generalization under Muon Optimization

이 논문은 자기 참조적 행동을 줄이기 위해 설계된 메커니즘인 독점적 셀프 어텐션(Exclusive Self-Attention, XSA)이 Muon 최적화 하에서도 안정적으로 유지되며, 모델 규모가 12개 층에서 24개 층으로 증가함에 따라 성능 향상이 더욱 일관되게 나타나면서 언어 모델의 완만한 일반화 개선을 이끌어낸다는 것을 입증한다.

원저자: Chandana Dayapule

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chandana Dayapule

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 읽는 법을 가르치려 한다고 상상해 보세요. 로봇은 단어를 이해하기 위해 "트랜스포머(Transformer)"라는 특별한 도구를 사용합니다. 이 도구를 지금까지 읽은 모든 단어들을 되돌아보며 그 의미를 파악하는 아주 똑똑한 사서라고 생각하면 됩니다. 보통 사서가 단어를 볼 때는 그 단어 자체도 함께 봅니다. 마치 "cat"이라는 단어를 읽으면서 "오, 이건 'cat'이라는 단어를 보고 있으니까 고양이야"라고 즉시 생각하는 것과 같습니다.

이 방식은 잘 작동하지만, 때로는 단어 자체에 너무 의존하거나 그 단어가 이야기 속에서 어떻게 어우러지는지에 충분히 주목하지 못할 때가 있습니다. 연구자 Zhai는 이 점을 발견하고 "배타적 셀프 어텐션(Exclusive Self-Attention, XSA)"이라는 규칙을 발명했습니다. 이 규칙은 사서에게 이렇게 말하는 것과 같습니다: "단어를 볼 때, 그 단어의 정의를 보는 것은 엄격히 금지한다. 오직 주변의 다른 단어들만을 보고 그 의미를 파악해야 한다." 이는 로봇이 단어 자체보다는 문맥, 즉 이야기에 더 집중하도록 강제합니다.

원래의 연구는 이 규칙이 "AdamW"라는 특정 방식으로 로봇을 훈련할 때 매우 잘 작동한다는 것을 보여주었습니다. 하지만 큰 질문표가 하나 붙었습니다. 만약 우리가 로봇의 훈련 방식을 더 새롭고 강력한 "Muon"이라는 방식으로 바꾼다면, 이 규칙이 여전히 작동할 것인가 하는 점입니다. Muon은 로봇의 뇌 속에 있는 거대한 수학 표(math tables)를 다루는 방식에서 조금 다르게 가르치는, 일종의 다른 종류의 코치와 같습니다. 만약 XSA 규칙이 이 새로운 코치를 만났을 때 망가진다면, 현대적인 로봇들에게는 별로 유용하지 않을 것입니다. 이것이 바로 Chandana Dayapule의 논문이 해결하고자 하는 퍼즐입니다.

실험: 새로운 코치, 같은 규칙

조지아 공대의 Chandana Dayapule는 "배타적 셀프 어텐션" 규칙이 코칭 스타일의 변화에서도 살아남을 수 있는지 테스트하기로 했습니다. 그들은 무거운 작업을 위해 Muon 코치를 사용하고 나머지 부분에는 기존의 AdamW 코치를 사용하는 "nanochat"이라는 현대적이고 압축적인 훈련 시스템을 사용했습니다. 그들은 두 가지 버전의 언어 모델을 구축했습니다. 하나는 기존의 규칙을 따르는 모델(베이스라인)이고, 다른 하나는 새로운 XSA 규칙을 따르는 모델("배타적" 버전)입니다.

그들은 이 모델들을 두 가지 크기로 테스트했습니다: 12개의 사고 계층(layer)을 가진 작은 모델(d12)과 24개의 계층을 가진 더 큰 모델(d24)입니다. 목표는 XSA 규칙이 훈련을 무너뜨리거나 너무 느리게 만들지 않으면서, 모델이 언어를 이해하는 능력을 향상시키는지 확인하는 것이었습니다.

결과: 희비가 엇갈린 소식

결과는 흥aland스러운 성공과 미묘함의 혼합이었습니다. 먼저, 좋은 소식은 XSA 규칙이 훈련을 망가뜨리지 않았다는 것입니다. 모델들은 새로운 Muon 코치를 사용하더라도 규칙이 없는 모델들만큼이나 매끄럽고 안정적으로 학습했습니다. 이는 이 규칙이 현대적인 훈련 방식과 호환된다는 것을 증명합니다.

모델이 언어를 얼마나 잘 이해하는지(정보 압축 효율성을 나타내는 "bits-per-byte"라는 점수로 측정)에 관해서는, XSA 모델들이 두 크기 모두에서 승리했습니다.

  • 작은 크기(d12)에서, XSA 모델은 점수를 0.8484에서 0.8457로 개선했습니다.
  • 큰 크기(d24)에서, 점수는 0.7193에서 0.7171로 개선되었습니다.

하지만 모델이 특정 다운스트림 작업(downstream tasks)에서 얼마나 잘 수행하는지를 나타내는 "Base CORE" 및 "ChatCORE" 점수를 살펴보면 이야기는 더 흥미로워집니다.

  • **더 큰 모델(d24)**의 경우, XSA 규칙이 명확한 승자였습니다. Base CORE 점수를 0.2593에서 0.2606으로 높였고, ChatCORE 점수를 0.3638에서 0.3682로 끌어올렸습니다. 이는 더 크고 복잡한 모델일수록, 자신의 정의를 무시하도록 강제하는 것이 이야기를 더 잘 이해하는 데 정말 도움이 된다는 것을 시사합니다.
  • **작은 모델(d12)**의 경우, 결과는 다소 실망스러웠습니다. 압축 점수는 좋아졌지만, Base CORE 점수는 오히려 0.1602에서 0.1508로 떨어졌습니다.

결론: 크기에 따라 다르다

논문은 "배타적 셀프 어텐션" 규칙이 현대 AI 훈련에 안전하고 안정적인 추가 요소이지만, 모든 곳에서 완벽하게 작동하는 마법의 탄환은 아니라고 결론짓습니다. 이 규칙은 더 크고 깊은 모델(d24 버전처럼)에서 가장 빛을 발하는 도구인 것 같습니다. 작은 모델에서는 이점이 불분명하며, 특정 작업의 성능을 오히려 저하시킬 수도 있습니다.

연구진은 새로운 규칙이 로봇을 느리게 만드는지도 확인했습니다. 그들은 약 5% 정도의 미미한 속도 저하를 발견했지만, 이 차이가 컴퓨터 성능의 일반적인 변동 폭에 비해 너무 작아서 정확히 측정하기 어렵다고 언급했습니다.

요약하자면, 이 연구는 당신이 이 "자기 자신에 대한 어텐션을 하지 않는" 규칙을 새로운 Muon 코치와 함께 사용할 수 있으며, 큰 모델에는 효과적이라는 것을 보여줍니다. 하지만 작은 모델의 경우에는 혜택이 트레이드오프(trade-off)를 감수할 만큼 가치가 있는지 주의해야 합니다. 이는 거대한 뇌에 작동하는 것이 항상 작은 뇌에도 작동하는 것은 아니며, 최고의 도구는 작업의 크기에 달려 있다는 사실을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →