Transformer Geometry Observatory TGO-II: Representational Similarity Observatory
이 논문은 비전 트랜스포머가 훈련 과정 전반에 걸쳐 강력한 토큰 상호작용 구조를 유지하면서도, 점진적인 매니폴드 확장과 더욱 풍부한 변환을 통해 표현 복잡성과 레이어 특수화를 발달시킨다는 것을 밝히기 위해 트랜스포머 기하학 관측소-II(TGO-II) 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
비전 트랜스포머(Vision Transformer, 이미지를 '보는' 일종의 AI)를 블랙박스가 아니라, 거대하고 다층적인 공장이라고 상상해 보십시오. 이 공장의 각 층은 AI가 이미지를 처리하는 '레이어(layer)'를 나타냅니다.
오랫동안 과학자들은 이 공장이 훈련을 통해 업무 능력이 향려진다는 사실은 알고 있었지만, 각 층의 작업자들이 시간이 흐름에 따라 어떻게 사고방식을 바꾸는지에 대해서는 제대로 이해하지 못했습니다. 그들은 주로 최종 결과물(고양이를 제대로 인식했는가?)이나 작업자들이 사용하는 도구(어텐션 메커니즘)만을 살펴보았습니다.
이 논문인 TGO-II는 훈련 첫날부터 마지막 날까지 작업자들의 내부 세계 지도가 어떻게 진화하는지 관찰하기 위한 새로운 '관측소'(첨단 전망대)를 도입합니다.
연구진이 발견한 내용을 쉬운 비유를 통해 설명하면 다음과 같습니다.
1. 작업자들이 서로를 복제하는 것을 멈춤 (전문화)
비유: 첫째 날의 인턴 그룹을 상상해 보십시오. 그들은 모두 같은 사진을 보고 거의 동일한 스케치를 그려냅니다. 그들은 모두 똑같은 방식으로 생각하고 있습니다.
발견: 훈련이 진행됨에 따라, 각 층의 작업자들은 똑같은 일을 하는 것을 멈춥니다. 이 논문은 층 사이의 '스케치'(표현)가 얼마나 유사한지를 측정했습니다. 그 결과, 시간이 흐를수록 유사성이 감소한다는 것을 발견했습니다.
의미: 공장의 각 층은 전문가가 되어가고 있습니다. 초기 층은 선이나 모양에 집중할 수 있고, 후기 층은 '털'이나 '바퀴'와 같은 복잡한 개념에 집중할 수 있습니다. 그들은 더 이상 서로를 단순히 복제하는 것이 아니라, 자신만의 고유한 역할을 개척해 나가고 있습니다.
2. 작업 공간이 더 커지고 복잡해짐 (매니폴드 확장)
비유: 인턴들이 작은 평면 종이 위에 그림을 그린다고 상상해 보십시오. 처음에는 단순한 선밖에 그릴 수 없습니다. 하지만 배우면서 그들은 더 많은 공간이 필요하다는 것을 깨닫습니다. 그들은 3D 모델을 사용하기 시작하고, 그다음에는 홀로그램 투영을 사용합니다. 그들이 일하는 '방'은 점점 더 커지고 복잡해집니다.
발견: 이 논문은 '고유 차원성(Intrinsic Dimensionality)'을 측정했는데, 이는 기본적으로 AI가 이미지를 설명하기 위해 얼마나 많은 서로 다른 방향이나 '자유도'를 사용하는지를 세는 것입니다. 연구진은 이 수치가 훈련 중에 급격히 증가했다가 안정화된다는 것을 발견했습니다.
의미: AI는 단순히 기존의 기술을 더 잘하게 되는 것이 아닙니다. AI는 말 그대로 자신의 정신적 작업 공간을 확장하고 있습니다. AI는 시작할 때보다 훨씬 더 풍부하고 복잡한 차원들을 사용하여 이미지를 설명하는 법을 배우고 있습니다.
3. 작업자들은 연결된 상태를 유지함 (토큰 결합)
비유: 흔한 추측 중 하나는 AI가 똑똑해짐에 따라 이미지의 서로 다른 부분들(예: '고양이의 귀'와 '고양이의 꼬리')이 서로 대화하는 것을 멈추고, 군중 속의 낯선 사람들처럼 독립적으로 변할 것이라는 것이었습니다.
발견: 이 논문은 이미지의 서로 다른 부분들이 서로 얼마나 영향을 미치는지(토큰 공분산)를 살펴보았습니다. 연구진은 훈련 과정 내내 강한 연결이 유지됨을 발견했습니다. '귀'와 '꼬리'는 서로 소통하는 것을 멈추지 않았으며, 오히려 그 상호작용 패턴은 더욱 조직적이고 구조적으로 변했습니다.
의미: AI는 이미지의 부분들을 고립시켜서 똑똑해지는 것이 아닙니다. AI는 이미지의 부분들을 점점 더 정교한 방식으로 서로 조율함으로써 똑똑해집니다. '팀'은 전문가가 되어가는 와중에도 긴밀하게 결속되어 있습니다.
거대한 놀라움: "전이 구역(Transition Zone)"
연구진은 공장의 4층과 5층 부근에서 기이한 현상이 일어나는 것을 발견했습니다.
- 1~4층: 작업자들이 빠르게 변화하고 있었고, '방'이 확장되고 있었습니다.
- 5~12층: 작업자들이 새로운 리듬에 안착했습니다. 층간 유사성은 떨어졌지만, 복잡성은 계속해서 성장했습니다.
가설: 이 논문은 이곳이 '전이 구역'이라고 제안합니다. 처음 몇 개의 층은 가공되지 않은 기초적인 입력값(픽셀 조각 등)을 처리하며, 4층 혹은 5층 이후부터 AI는 추상적이고 높은 수준의 개념을 다루기 시작합니다. 이는 마치 공장이 '조립 라인' 작업에서 '창의적 디자인' 작업으로 전환되는 것과 같습니다.
새로운 이론의 요약
이 논문 이전의 사람들은 이렇게 생각했을지도 모릅니다: "AI는 이미지를 독립적인 조각들로 나누고 그것들을 따로 분석함으로써 똑똑해진다."
TGO-II는 그 반대를 제안합니다: AI는 조각들을 분리하기보다는, 그 조각들을 긴밀하게 연결된 상태로 유지하면서 그들이 서로 대화하는 방식을 훨씬 더 복잡하고 전문적으로 만듦으로써 똑똑해집니다. 이것은 마치 재즈 밴드와 같습니다: 음악가들은 함께 연주하는 것을 멈추는 것이 아니라(결합을 해제하는 것이 아니라), 각자가 고유한 솔로 스타일을 찾아가는 동시에(전문화) 더 복잡한 화성과 즉흥 연주를 배워나가는 것(매니폴드 확장)과 같습니다.
다음 단계는?
저자들은 이러한 복잡한 패턴들이 '의미(semantics)' 측면에서 정확히 무엇을 뜻하는지 아직 완전히 알지 못한다고 인정합니다. 그들은 이 복잡한 기하학적 구조가 실제로 AI가 '고양이'나 '자동차'가 무엇인지 이해하는 데 도움이 되는지 확인하기 위해 "TGO-III"를 구축할 계획이며, "TGO-IV"를 통해 이미지의 개별 부분들이 시간이 지남에 따라 어떻게 움직이고 변하는지 관찰할 예정입니다.
요약하자면: AI는 사물을 분해하는 것이 아니라, 정신적 지도를 확장하고, 레이어를 전문화하며, 내부의 구성 요소들을 긴밀하게 연결함으로써 학습합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.