← 최신 논문
🤖 machine learning

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

이 논문은 트랜스포머 모델의 창발적 능력(emergent capabilities)이 훈련 과정 중 작업 관련 희소 어텐션 패턴(task-relevant, sparse attention patterns)의 급격한 학습 결과로서 확률적으로 발생하며, 더 큰 모델일수록 개선된 학습 효율성 덕분에 이러한 패턴을 더 일찍 습득한다는 것을 입증한다.

원저자: Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

게시일 2026-06-25✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 매우 똑똑한 로봇에게 읽기와 쓰기를 가르치고 있다고 상상해 보세요. 당신은 로bot이 한 학기 동안 성적이 서서히 오르는 학생처럼 점진적으로 발전할 것이라고 기대합니다. 하지만 현대의 AI에서는 이상한 일이 일어납니다. 로봇이 갑자기 "깨달음"을 얻는 것입니다. 어떤 순간에는 과제를 수행하지 못하다가, 다음 순간에는 그것을 완벽하게 해결해 버립니다. 이것을 **창발적 능력(emergent capability)**이라고 부릅니다.

이 논문은 왜 이러한 갑작스러운 돌파구가 발생하는지를 조사합니다. 저자들은 이것이 완만하고 꾸준한 상승 곡선이 아니라고 주장합니다. 대신, 이것은 마치 로봇이 어두운 방 안에서 특정한 숨겨진 스위치를 찾아 헤매는 것과 같습니다. 일단 그 스위치를 올리고 나면, 모든 것이 즉시 변합니다.

다음은 이들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.

1. "전등 스위치"의 순간

AI의 뇌를 수많은 전등 스위치(이것들은 **어텐션 헤드(attention heads)**라고 불립니다)로 가득 찬 거대한 방이라고 생각해 보세요. 대부분의 시간 동안 로봇은 그저 어둠 속에서 더듬거리고 있습니다. 로봇은 "문장 복사하기"나 "누가 음료를 주었는지 파악하기"와 같은 특정 과제를 제어하는 스치치가 무엇인지 알지 못합니다.

논문에 따르면 이러한 능력들은 천천히 나타나지 않습니다. 그것들은 갑작스럽게 나타납니다.

  • 무작위성(Randomness): 만약 당신이 시작점이 약간씩 다른 열 개의 동일한 로봇을 훈련시킨다면, 어떤 로봇은 10일째에 맞는 스위치를 찾을 수도 있고, 어떤 로봇은 100일째에 찾을 수도 있으며, 어떤 로봇은 영영 찾지 못할 수도 있습니다.
  • 거대한 도약(The Big Jump): 일단 로봇이 올바른 스위치를 찾으면, 성능은 조금씩 올라가는 것이 아니라 급격히 치솟습니다. 그것은 마치 스위치를 올려 순식간에 밝은 조명을 켜는 것과 같습니다.

2. 비밀은 "시선"에 있다

로봇은 어떻게 무엇을 해야 할지 알까요? 로봇은 올바른 것을 바라보는 법을 배웁니다.
AI 용어로, 이것은 "어텐션 패턴을 학습하는 것"이라고 합니다. 당신이 이야기를 읽으며 다음 단어를 추측하려고 노력한다고 상명해 보세요. 똑똑한 독자는 이전 문장을 다시 쳐다볼 줄 압니다. 혼란스러워하는 독자는 무작위로 단어들을 쳐다봅니다.

저자들은 이 "갑작스러운 돌파구"가 로봇이 미래를 예측하기 위해 과거의 올바른 단어들을 응시하는 법을 배우는 바로 그 시점에 발생한다는 것을 발견했습니다.

  • 증거: 그들은 로봇이 아직 학습하지 못한 상태에서, "패칭(patching)"이라는 기술을 사용하여 로봇의 "눈"이 올바른 단어들을 보도록 수동으로 강제하는 테스트를 진행했습니다. 그러자 로봇은 자연스럽게 "학습"하지 않았음에도 불구하고 과제를 완벽하게 해결할 수 있었습니다. 이는 **올바른 것을 보는 법을 배우는 것이 병목 현상(bottleneck)**임을 증명합니다.

3. "탐색"의 어려움

왜 스위치를 찾는 데 그렇게 오래 걸릴까요? 저자들은 이를 테스트하기 위해 두 가지 "훈련 게임(synthetic tasks)"을 만들었습니다.

  • 희소 지도 게임 (The Sparse Map Game): 오직 몇 개의 특정 점들만이 연결되어 있는 거대한 격자판을 상상해 보세요. 로봇은 어떤 점들이 서로 연결되어 있는지 알아내야 합니다.
  • 세포 자동자 게임 (The Cellular Automata Game): 각 세포가 인접한 이웃 세포들에 따라 변화하는 세포 열을 상상해 보세요.

그들은 두 가지 주요 요인이 이 "탐색"을 매우 어렵게 만든다는 것을 발견했습니다:

  1. 컨텍스트 길이 (긴 복도 - The Long Hallway): 만약 로봇이 단서를 찾기 위해 매우 긴 단어의 복도를 지나 뒤를 돌아봐야 한다면, 길을 잃게 됩니다. 컨텍스트가 길어질수록 올바른 스위치를 찾기는 더 어려워집니다.
  2. 희소성 (건초더미 속 바늘 - Sparsity): 만약 로봇이 정보의 99%를 무시하고 단 1%에만 집중해야 한다면(희소한 패턴), 고전하게 됩니다. 이것은 마치 거대한 건초더미 속에서 특정한 바늘을 찾는 것과 같습니다. 건초더미가 거대하고 바늘이 아주 작다면, 로봇은 결코 찾지 못할 수도 있습니다.

4. 더 많은 눈이 도움이 되지만, 크기가 중요하다

논문은 또한 로봇이 이러한 스위치를 더 빨리 찾도록 돕는 방법도 테스트했습니다.

  • 더 많은 헤드 (더 많은 눈 - More Heads): 로봇에게 더 많은 "어텐션 헤드"(더 많은 쌍의 눈)를 주는 것은 도움이 됩니다. 이것은 한 사람이 방을 찾는 대신 팀 단위로 사람들이 검색하는 것과 같습니다. 눈이 많을수록, 누군가가 빠르게 스위치를 발견할 확률이 높아집니다.
  • 큰 눈 vs 많은 눈 (Bigger Heads vs. More Heads): 흥미롭게도, 개별적인 "눈"을 크게 만드는 것(더 많은 용량)은 단순히 "더 많은 눈"을 갖는 것만큼 큰 도움이 되지 않았습니다. 단, 눈이 역할을 수행하기에 충분히 크다는 전제하에 말입니다.

5. 작업에 따른 다른 도구들

마지막으로, 그들은 "표준 로봇 설계(Transformer)가 최선의 도구인가?"라고 물었습니다.

  • 그들은 표준적인 "뒤를 돌아보는" 메커니즘을 사용하지 않는 MLP-Mixer라는 다른 설계를 시도했습니다.
  • 결과: "희소 지도" 게임(특정하고 희소한 연결을 찾는 게임)에서, MLP-Mixer는 표준 로봇보다 10배 더 빨랐습니다. 그것은 거의 즉시 스위치를 찾아냈습니다.
  • 그러나 "세포 자동자" 게임(특정한 순서로 이웃을 살펴봐야 하는 게임)에서는 표준 로봇이 여전히 더 뛰어났습니다.

핵심 요약

이 논문의 결론은 AI가 갑자기 똑똑해지는 "마법"은 마법이 아니라는 것입니다. 그것은 모델이 자신의 주의(attention)를 어떻게 집중할지, 특히 희소한 정보에 어떻게 집중할지를 배우기 위해 고군분투하는 기계적인 과정입니다.

  • 더 큰 모델은 이러한 집중 패턴을 더 빠르고 안정적으로 찾아냅니다.
  • 더 긴 컨텍스트는 이를 훨씬 더 어렵게 만듭니다.
  • 아키텍처의 변화(더 많은 "눈"을 추가하거나 정보를 섞는 방식을 바꾸는 것 등)는 이 탐색 속도를 크게 높일 수 있습니다.

요약하자면, 창발성은 매끄러운 곡선이 아닙니다. 그것은 로봇이 어디를 바라봐야 할지 마침내 깨닫게 되는 연속적인 "아하!(Aha!)" 모먼트들의 집합입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →