← 최신 논문
💻 computer science

Transformer Geometry Observatory TGO-I: Spectral Geometry Observatory

이 논문은 비전 트랜스포머의 스펙트럼 기하학을 분석하기 위해 트랜스포머 지오메트리 옵저버토리(TGO) 프레임워크, 구체적으로 TGO-I를 소개하며, 훈련이 표현 차원 전반에 걸쳐 분산을 점진적으로 재분배함으로써 정보 집중이라는 직관과는 반대로 유효 차원의 증가와 이방성 감소를 초래한다는 사실을 밝힌다.

원저자: Kaustubh Kapil, Kishor P. Upla

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kaustubh Kapil, Kishor P. Upla

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 **비전 트랜스포머(Vision Transformer, ViT)**라는 거대하고 복잡한 기계가 있다고 상상해 보세요. 이 기계는 사진을 보고 그 안에 무엇이 있는지 이해하도록 설계되었습니다. 오랫동안 과학자들은 이 기계가 무엇을 결정하는지(예: "저건 고양이야!") 또는 어디에 주의를 기울이는지(예: "귀 부분을 보고 있어")에 집착해 왔습니다.

하지만 이 논문인 TGO-I는 다른 질문을 던집니다: "기계가 학습함에 따라 그 내부의 '두뇌'는 실제로 어떤 모습인가?"

이 기계의 두뇌를 단순한 사실의 목록이 아니라, 정보가 살아 숨 쉬는 거대하고 다차원적인 방이라고 생각해 보세요. 저자들은 이 방의 형태가 학습 과정 동안 어떻게 변하는지 관찰하기 위해 특별한 "관측소"(도구 세트)를 구축했습니다.

이들이 발견한 내용을 알기 쉽게 설명해 드리겠습니다.

1. 설정: 방의 진화를 관찰하기

연구진은 100가지 유형의 이미지 데이터셋(인터넷 전체의 축소판 같은 것)을 사용하여 비전 트랜스포머를 학습시켰습니다. 그들은 단순히 최종 결과만을 본 것이 아니라, 학습의 모든 단계(1일 차부터 100일 차까지)에서 기계의 내부를 들여다보았습니다.

그들은 데이터의 "기하학적 구조"를 측정했습니다. 데이터를 방 안의 점 구름이라고 상상해 보세요.

  • 초기에는: 구름이 한쪽 벽에 아주 납작하게 붙어 있을 수 있습니다 (매우 좁은 상태).
  • 후기에는: 계속 납작한 상태를 유지할까요? 아니-면 퍼져 나갈까요? 방 전체를 채울까요?

2. 거대한 반전: "퍼져 나가는" 효과

상식적으로 생각하면, 기계가 똑똑해질수록 더 '집중'하게 될 것이라고 생각하기 쉽습니다. 당신은 이렇게 생각할지도 모릅니다. "가장 중요한 것들만 배우고 나머지는 무시해서, 자신의 지식을 몇 개의 좁고 강력한 방향으로 압축할 거야."

하지만 논문은 정반대의 결과를 찾아냈습니다.

정보를 좁은 구석으로 압축하는 대신, 기계의 내부 표현은 방 전체를 채우기 위해 넓게 퍼져 나갔습니다.

  • 비유: 어두운 방 안에 있는 사람들을 상상해 보세요. 시작 단계에서 모두가 똑같은 것을 외치며 좁은 원 안에 옹기종기 모여 있습니다. 학습이 진행됨에 따라, 그들은 더 촘가닥 모이는 것이 아닙니다. 대신, 그들은 천천히 서로 떨어져서 방 전체를 채우며 각자 고유한 정보 조각을 들고 넓게 퍼져 나갑니다.
  • 결과: "유효 계수(Effective Rank)"(얼마나 많은 서로 다른 방향이 사용되는지를 나타내는 멋진 표현)는 상승했습니다. "이방성(Anisotropy)"(모양이 얼마나 치우치거나 납작한지를 나타내는 지표)은 하락했습니다.

3. "CLS 토큰": 궁극의 조직가

이러한 기계에는 CLS 토큰이라는 특별한 토큰이 있습니다. 이 토کن을 "학급 회장" 또는 "팀장"이라고 생각하세요. 팀장은 최종 결정을 내리기 위해 나머지 그룹으로부터 모든 정보를 모읍니다.

논문은 이 "팀장"이 이 방에서 가장 흥미로운 부분이 되었다는 것을 발견했습니다.

  • 학습이 끝날 무렵, CLS 토큰의 내부 공간은 모든 것 중 가장 넓게 퍼져 있었습니다.
  • 가장 덜 납작한 형태를 띠었습니다 (가장 낮은 이방성).
  • 정보를 담기 위해 가장 많은 차원을 사용했습니다.

마치 팀장이 단지 몇 가지 핵심 사실을 암기한 것이 아니라, 모든 구성원의 고유한 관점이 보존되고 활용될 수 있도록 팀 전체를 조직한 것과 같습니다.

4. "대각선" 패턴

연구진은 또한 기계의 서로 다른 부분들이 어떻게 서로 소통하는지(상관관계)를 살펴보았습니다.

  • 초기에는: 부분들이 매우 엉켜 있고 서로 의존적이었습니다 (엉킨 이어폰 줄처럼).
  • 후기에는: 그 "매듭"이 풀렸습니다. 각 부분은 더 독립적이 되었습니다.
  • 시각화: 이 연결들을 지도로 그린다면, 복잡한 교차 연결의 웹 형태가 아니라 깔러운 대각선(각자가 자기 자신하고만 소통하는 형태)처럼 보이기 시작했습니다. 이는 기계가 서로 다른 특징들을 뚜렷하고 중복되지 않게 유지하는 법을 배웠음을 의미합니다.

5. 왜 이런 일이 일어났을까? (가설들)

논문은 왜 이런 현상이 일어났는지 정확히 밝히지는 않지만, 세 가지 추측(가설)을 제시합니다.

  1. 토큰 다양화 (Token Diversification): 기계는 이미지의 모든 조각(모든 "토큰")을 고유하고 뚜렷하게 만들어, 각 조각이 자신만의 공간을 필요로 하도록 학습했습니다.
  2. 의미론적 확장 (Semantic Expansion): 기계는 점점 더 다양한 "의 의미"나 특징을 발견했고, 따라서 이를 모두 저장하기 위해 더 많은 공간이 필요했습니다.
  3. 중복 감소 (Redundancy Reduction): 기계는 반복을 멈췄습니다. 똑같은 것을 말하는 세 가지 특징을 갖는 대신, 모든 특징이 새로운 것을 말하도록 재배치했습니다.

요약

TGO-I의 핵심은 우리가 AI의 학습을 "관찰"하는 새로운 방법을 갖게 되었다는 것입니다. 우리는 예전에 학습이 더 집중되고 좁아지는 과정이라고 생각했습니다. 하지만 이 논문은, 적어도 비전 트랜스포머의 경우, 학습이란 정보를 넓고 평평하며 효율적인 풍경 위로 확장하고 분산시키는 과정임을 보여줍니다.

저자들은 이를 **트랜스포머 기하학 관측소(Transformer Geometry Observatory)**라고 부릅니다. 이것은 시작일 뿐입니다. 이번 TGO-I는 데이터의 형태를 살펴보는 첫 번째 단계였습니다. 그들은 앞으로 "팀장"이 어떻게 움직이는지, "주의(Attention)"가 어떻게 작동하는지, 그리고 기계가 어떻게 경로를 최적화하는지를 관찰하기 위해 더 많은 관측소를 구축할 계획입니다.

요약하자면: 기계는 초점을 좁힘으로써 똑똑해진 것이 아니라, 정보를 넓고 고르게 분산시켜 낭비되는 것 없이 자신의 전체 두뇌를 사용하는 법을 배움으로써 더 똑똑해졌습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →