← 최신 논문
🤖 machine learning

A Controlled Study of Attention-Only Transformers

이 연구는 어텐션 전용 모델(SAN)이 파라미터, 연산량 및 깊이를 맞추었을 때 표준 트랜스포머와 거의 동일한 손실을 달一种하므로 피드 포워드 네트워크가 트랜스포머의 성능을 위해 엄격하게 필수적인 것은 아님을 입증하며, 남은 미세한 격차는 구조적 한계가 아니라 오로지 파라미터 기반 회상 능력의 차이에 기인한다.

원저자: Henry Ndubuaku, Karen Mosoyan, Jakub Mroz, Noah Cylich, Satyajit Kumar, Parkirat Sandhu, Roman Shemet, Justin H Lee

게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Henry Ndubuaku, Karen Mosoyan, Jakub Mroz, Noah Cylich, Satyajit Kumar, Parkirat Sandhu, Roman Shemet, Justin H Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇을 위한 궁극의 두뇌를 만들려고 노력하고 있다고 상상해 보세요. 수년 동안 과학자들은 로봇을 더 똑똑하게 만들기 위해 두 종류의 '뉴런'을 서로 위에 쌓아 올렸습니다. 첫 번째 유형은 현재 일어나고 있는 일을 관찰하고 어디에 주의를 기울일지 결정하는 **전령(messenger)**과 같습니다. 두 번째 유형은 과거로부터 배운 사실과 규칙을 저장하는 **노트(notebook)**와 같습니다. 로봇의 두뇌는 전령, 그다음 노트, 그다음 전령, 그다음 노트가 반복되는 패턴으로 구축됩니다.

인공지능의 세계에서 이 '전령'들은 **어텐션 메커니즘(attention mechanisms)**이라 불리며, '노트'는 **피드포워드 네트워크(feed-forward networks, FFNs)**라고 불립니다. 오랫동안 모두는 이 노트가 필수적이라고 가정해 왔습니다. 실제로 현대의 로봇 두뇌에서 이 노트들은 전체 공간(파라미터)의 약 3분의 2를 차지합니다. 거대한 질문은 이것이었습니다: 노트가 정말 필요한가? 아니면 우리가 충분한 공간을 준다면 전령이 모든 일을 다 할 수 있을까요? 이 논문은 노트를 전혀 없이, 오직 전령만으로 초지능적인 로봇을 만들 수 있는지 알아보기 위한 거대하고 통제된 실험입니다.


위대한 뇌 수술 실험

Cactus Compute, Inc.의 연구진은 표준 AI 모델에 대해 매우 정밀한 "뇌 수술"을 수행하기로 했습니다. 그들은 표준 모델을 가져와서, 층(layer) 단위로 "노트"(피드포워드 네트워크)를 완전히 들어내어 오직 "전령"(어텐션 메커니획)만을 남겼습니다. 그들은 이렇게 단순화된 새로운 모델을 **단순 어텐션 네트워크(Simple Attention Network, SAN)**라고 불렀습니다.

하지만 까다로운 점이 있습니다. 뇌의 거대한 부분을 그냥 삭제한다고 해서 똑같이 작동할 것이라고 기대할 수는 없습니다. 만약 노트를 제거하면, 갑자기 많은 빈 공간이 생기게 됩니다. 그래서 연구진은 무엇이 정말 중요한지 알아보기 위해 세 가지 다른 버전의 실험을 실행했습니다:

  1. 동일한 깊이(Same Depth): 층의 개수는 동일하게 유지하되 노트를 삭제했습니다. (이 방식은 SAN을 훨씬 작고 약하게 만들었습니다.)
  2. 동일한 연산량(Same Compute): 두 모델이 생각하는 데 사용하는 정확한 양의 전기(FLOPs)를 사용하도록 크기를 조정했습니다.
  3. 동일한 크기(Same Size): 노트를 삭제하여 생긴 빈 공간을 활용해 더 많은 층의 전령을 추가했습니다. 이것이 가장 공정한 테스트입니다: "만약 전령에게 노트와 같은 총 뇌력을 준다면, 그것이 그 일을 해낼 수 있을까?"

충격적인 결과: 노트는 마법이 아니다

결과는 놀라웠습니다. 단순히 노트를 삭제하고 전령에게 더 많은 공간을 주지 않았을 때는 로봇이 현저히 멍청해졌습니다. 하지만 그 "삭제된" 뇌력을 사용하여 더 깊은 전령 스택을 구축했을 때는, 그 격차가 거의 완전히 사라졌습니다.

가장 공정한 테스트(총 크기를 일치시킨 경우)에서, 노트가 있는 표준 모델과 새로운 "전령 전용" 모델은 거의 동일했습니다. 그 차이는 고작 0.006 nats(예측이 얼마나 틀렸는지를 측정하는 단위)였습니다. 이를 설명하자면, 성능 면에서 단 **0.27%**의 차이에 불 불과합니다. 이는 실험을 다른 무작위 시드로 다시 실행하더라도 만 분의 일까지 재현 가능한 수준의 미미한 차이입니다.

논문은 사용된 데이터 유형(추론 중심의 합성 코퍼스)에 대해, "노트"는 마법 같고 대체 불가능한 구성 요소가 아니라고 결론짓습니다. 그것은 단지 정보를 저장하는 방법일 뿐입니다. 만약 전령에게 충분한 깊이를 준다면, 전령 스스로 그 정보를 저장할 수 있습니다.

미세한 격차가 숨어 있는 곳

그렇다면 두 모델이 거의 동일하다면, 왜 차이가 정확히 제로가 아닌 걸까요? 연구진은 "전령 전용" 모델이 어디에서 어려움을 겪는지 알아내기 위해 깊이 파고들었습니다. 그들은 문제가 모든 곳에서 발생하는 것이 아니라 매우 구체적이라는 것을 발견했습니다.

전령 전용 모델은 컨텍스트(제공된 이야기나 텍스트)가 자신에게 아무것도 제공하지 않을 때 질문에 답하는 능력이 약간 떨어졌습니다.

  • "컨텍스트 기반(Context-Grounded)"의 승리: 답이 제공된 텍스트 어딘가에 숨겨져 있을 때(예: 위키피디아 기사에서 사실을 찾는 것), 전령 전용 모델은 실제로 더 뛰어나거나 대등했습니다.
  • "기억(Memory)"의 상실: 미세한 격차는 모델이 텍스트에서 아무런 단서도 얻지 못한 채 순수하게 기억력만으로 사실을 끌어내야 할 때만 나타났습니다.

이것을 다음과 같이 생각해 보세요: 전령은 "헤이, 텍 я에 단서가 보이니 저기를 보자!"라고 말하는 데 탁월합니다. 하지만 노트는 "텍스트에 단서가 없더라도, 나는 이 사실을 훈련 과정에서 기억하고 있어"라고 말하는 데 약간 더 뛰어났습니다. 연구진은 전령 전용 모델이 여전히 무언가를 암기할 수 있지만, 그 사실들을 전용 "노트" 층 대신 자신의 "어텐션" 층에 저장하기 위해 조금 더 힘들게 노력해야 한다는 것을 발견했습니다.

두뇌가 실제로 작동하는 방식

논문은 또한 이 모델들이 어떻게 학습하는지 내부를 들여다보았습니다. 그들은 두뇌가 성장하는 방식에서 매혹적인 리듬을 발견했습니다:

  1. 라우팅(Routing)은 조기에 결정됨: 어디를 볼지 결정하는 부분(라우팅)은 훈련의 첫 4분의 1 시기에 매우 빠르게 설정되며, 그 후에는 고정된 상태를 유지합니다.
  2. 콘텐츠(Content)는 천천히 성장함: 실제로 정보를 저장하는 부분은 훈련 과정 내내 계속해서 성장하고 더 복잡해집니다.

노트를 제거했을 때, "저장" 작업이 사라진 것이 아니라 위치가 이동했습니다. 전령의 출력 층이 사실을 저장하는 업무를 넘겨받았습니다. 이것은 마치 사무실에서 파일 캐비닛을 치우면, 직원들(전령)이 파일을 주머니에 넣고 다니기 시작하는 것과 같습니다. 작동은 하지만, 정보를 조직하는 방식이 약간 달라지는 것입니다.

핵심 비결: 정규화(Normalization)

가장 실용적인 발견 중 하나는 이 깊은 "전령 전용" 두뇌가 무너지는 것을 막는 법에 관한 것이었습니다. 연구진은 **QK-정규화(QK-normalization)**라고 불리는 특정 기술이 절대적으로 중요하다는 것을 발견했습니다. 이것 없이는 깊은 전령 전용 모델들이 제대로 학습하지 못하고 붕괴될 것이었습니다. 결국, 두뇌를 안정적으로 유지해 준 것은 "노트"가 아니라 바로 이 특정 정규화 기술이었습니다.

결론

이 논문은 노트가 쓸모없다고 말하는 것이 아닙니다. 그들이 테스트한 추론 중심의 데이터 유형에 대해서는, "노트"가 지능을 위한 근본적인 필수 요건이 아니라는 점을 말합니다. 만약 두뇌 크기에 대한 예산이 한정되어 있다면, 노트를 더 많은 층의 전령으로 교체하여 거의 동일한 결과를 얻을 수 있습니다.

오직 모델이 현재 텍스트와 전혀 관련 없는 사실을 기억해내야 할 때만 노트가 빛을 발합니다. 하지만 그 경우에도 차이는 미미합니다. 주요 시사점은 "전령"은 믿을 수 없을 정도로 강력하고 유연하며, 충분한 깊이만 주어진다면 "노트"의 역할까지 수행할 수 있다는 것입니다. 둘 사이의 격차는 매우 작아서 거의 무시할 수 있는 수준이며, 이는 트랜스포머의 구조가 우리가 생각했던 것보다 훨씬 더 유연하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →