← 최신 논문
💻 computer science

Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory

이 논문은 ViT-Small/16의 표현이 훈련 레이어를 거치며 진화하는 과정을 분석하여, 클래스 분리성과 변별적인 의미 구조가 매니폴드 확장과 함께 점진적으로 출현함을 입증함으로써 의미 확장 가설(Semantic Expansion Hypothesis)을 뒷받침하는 프레임워크인 TGO-III를 소개한다.

원저자: Kaustubh Kapil, Kishor P. Upla

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Kaustubh Kapil, Kishor P. Upla

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 동물을 인식하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 고양이, 개, 새의 사진 수천 장을 보여줍니다. 처음에는 로봇의 뇌가 숫자로 된 혼란스러운 덩어리일 뿐입니다. 로봇은 고양이와 개를 그저 차이가 없는 픽셀의 무더기로 봅니다. 하지만 학습이 계속됨에 따라, 그 디지털 뇌 내부에서 마법 같은 일이 일어납니다. 숫자들이 스스로를 조직하기 시작합니다. "고양이" 숫자들이 "개" 숫자들로부터 멀어지며, 광활한 데이터의 바다 속에 깔끔하고 분리된 섬들을 형성합니다. 이 연구 분야를 머신 러닝(machine learning)이라고 부르며, 특히 '비전 트랜스포머(Vision Transformers, 이미지를 보는 초지능형 AI의 한 종류)'가 학습하면서 내부적인 사고 패턴을 어떻게 변화시키는지에 주목합니다. 과학자들이 이를 중요하게 여기는 이유는, 만약 우리가 로봇이 어떻게 생각을 정리하는지 이해할 수 있다면, 단순히 추측하는 것이 아니라 세상을 실제로 이해하는 더 나은, 더 신뢰할 수 있는 AI를 구축할 수 있기 때문입니다.

당신이 읽게 될 "TGO-III: 시맨틱 기하학 관측소(TGO-III: Semantic Geometry Observatory)"라는 제목의 논문은 이 디지털 뇌를 위한 하이테크 현미경과 같습니다. 저자인 카우스텁 카필(Kaustubh Kapil)과 키쇼르 우플라(Kishor Upla)는 큰 질문에 답하고자 했습니다. AI가 학습함에 따라 단순히 더 무작위적이고 복잡해지는 것일까요, 아니면 실제로 의미에 따라 사물들을 분류하기 시작하는 것일까요? 그들은 새로운 도구 세트를 사용하여 100가지 유형의 이미지(ImageNet-100이라는 데이터셋)를 100일(에포크, epochs) 동안 학습하는 과정에서 AI의 "뇌"(구체적으로는 ViT-Small/16 모델)를 관찰했습니다.

다음은 그들이 발견한 이야기를 성장하는 도시라는 관점을 통해 들려주는 이야기입니다.

아이디어의 도시

AI의 내부 세계를 거대하고 텅 빈 도시라고 상상해 보세요. 훈련이 시작될 때, 이 도시는 평평하고 진흙투성이인 벌판입니다. 모든 아이디어(예: "고양이", "개", "자동차")는 같은 지점에 짓눌려 있습니다. AI는 이들을 구별할 수 없습니다.

AI가 훈련을 시작함에 따라 도시는 확장되기 시작합니다. 이전 연구들(TGO-I 및 TGO-II)에서 과학자들은 도시가 새로운 마천루와 구불구불한 도로가 솟아오르는 것처럼 점점 더 커지고 복잡해진다는 것을 발견했습니다. 그들은 이를 "매니폴드 확장(Manifold Expansion)"이라고 불렀습니다. 하지만 그들은 도시가 왜 성장하는지는 알지 못했습니다. 단순히 더 무질서해지는 것일까요? 아니면 더 나은 동네 계획을 세우고 있는 것일까요?

TGO-III는 그 질문에 답하기 위해 투입된 새로운 도시 계획가입니다. 그들은 단순히 도시의 크기만을 본 것이 아니라, 서로 다른 동네들(시맨틱 클래스)이 어떻게 배치되는지를 살펴보았습니다.

관측소의 네 가지 도구

도시의 배치를 이해하기 위해 저자들은 네 가지 특별한 측정 도구를 사용했습니다.

  1. 선형 프로브 (Linear Probe, 단순한 테스트): 아주 단순한 로봇에게 "이것은 고양이인가요, 개인가요?"라고 묻는다고 상상해 보세요. 만약 AI의 뇌가 엉망이라면, 이 단순한 로봇은 틀린 답을 많이 낼 것입니다. 하지만 AI가 생각을 잘 정리했다면, 이 단순한 로봇은 지도 위에 직선 하나를 그어 "왼쪽에 있는 것은 고양이, 오른쪽에 있는 것은 개"라고 말할 수 있습니다. 저자들은 훈련이 진행됨에 따라 이 단순한 로봇이 점점 더 똑똑해진다는 것을 발견했습니다. 이는 AI가 자신의 아이디어를 더 구분하기 쉽게 만들고 있음을 의미합니다.

  2. 피셔 비율 (Fisher Ratio, 인파 측정기): 이 도구는 한 그룹의 친구들(예: 모든 "고양이")이 얼마나 빽빽하게 모여 있는지, 그리고 다른 그룹(예: "개")으로부터 얼마나 떨어져 있는지를 측정합니다. 점수가 높다는 것은 고양이들이 좁은 원 안에 옹기종기 모여 있고, 그 원이 개들과 멀리 떨어져 있다는 것을 의미합니다. 저자들은 이 점수가 상승하는 것을 보았으며, 이는 그룹들이 더 단단해지고 서로 멀어지고 있음을 의미합니다.

  3. 중심점 거리 (Centroid Distances, 지도 걷기): 이것은 각 그룹의 "중심 중력" 사이의 거리를 측정합니다. 만약 당신이 고양이 동네 한복가운데 서서 개 동네 한가운데로 걸어간다면, 거리는 얼마나 될까요? 저자들은 훈련이 진행됨에 따라 이 동네들이 점점 더 멀리 떨어지며, 어떤 두 그룹도 서로 혼동되지 않는 거대하고 탁 트인 도시를 만들어낸다는 것을 발견했습니다.

  4. 로컬 PCA 랭크 (Local PCA Rank, 방의 크기): 이것은 가장 흥-미로운 도구입니다. 질문은 이렇습니다: "특정 동네가 존재하기 위해 몇 개의 차원이 필요한가?" 시작 단계에서 "고양이" 동네는 모든 변형을 담아내기 위해 거대한 3D 창고가 필요한 무질서하고 넓게 퍼진 상태였습니다. 하지만 AI가 학습함에 따라 "고양이" 동네는 더 조직화되었습니다. 더 이상 거대한 창고가 필요하지 않게 되었고, 깔끔하고 조밀한 방 안에 들어갈 수 있게 되었습니다. 저자들은 전체 도시는 커졌지만, 개별 동네들은 더 작고 효율적으로 변했다는 것을 발견했습니다.

거대한 발견: 시맨틱 확장

저자들이 발견한 가장 흥미로운 점은 그들이 **시맨틱 확장 가설(Semantic Expansion Hypothesis)**이라고 부르는 것입니다.

이 논문 이전에 어떤 이들은 AI가 학습하면서 단순히 더 무작위적이고 복잡해진다고 생각했습니다. 하지만 TGO-III는 이보다 훨씬 더 목적이 분명한 무언가를 시사합니다. AI는 단순히 더 큰 난장판을 만드는 것이 아니라, 능동적으로 더 나은 지도를 구축하고 있습니다.

이렇게 생각해 보세요. 당신이 그림 그리는 법을 처음 배울 때, 스케치북은 낙서로 가득합니다. 연습을 거듭하면서 당신은 단순히 더 많은 낙서를 하는 것이 아니라, 뚜렷한 형태를 그리기 시작합니다. 원은 머리를 위한 것이고 선은 몸통을 위한 것이라는 것을 배우게 됩니다. "낙서"(추가적인 복잡성)는 사실 더 명확하고 뚜렷한 범주를 만들기 위해 사용되고 있는 것입니다.

저자들은 AI가 훈련함에 따라 "고양이" 아이디어와 "개" 아이디어가 단순히 무작위로 흩어지는 것이 아님을 관찰했습니다. 그것들은 서로를 쉽게 구별할 수 있는 구조로 스스로를 조직했습니다. "도시"는 이러한 새로운 명확한 구분을 수용하기 위해 확장되었습니다.

"전이 구역"의 놀라움

논문은 또한 AI의 뇌 어디에서 이러한 조직화가 일어나는지도 살펴보았습니다. AI는 여러 층으로 쌓인 건물처럼 레이어(layer)로 구성되어 있습니다. 저자들은 낮은 층(초기 레이어)은 여전히 다소 무질서하다는 것을 발견했습니다. 진짜 마법은 높은 층에서 일어났습니다.

그들은 **전이 구역 가설(Transition Zone Hypothesis)**을 확인했지만, 약간의 반전을 더했습니다. 그들은 중간 층에서 기하학적 변화가 시작되지만, 실제적인 분류는 마지막 층에서 일어난다는 것을 발견했습니다. 상위 레이어는 고양이와 개가 실제로 분리되어 결정적으로 명확해지는 곳입니다. 마치 낮은 층은 건설 현장이고, 높은 층은 주민들이 평화롭게 사는 완성되고 세련된 아파트와 같습니다.

이것이 의미하는 바 (그리고 의미하지 않는 것)

저자들은 자신들이 이러한 행동을 '관찰'했으며, 그 증거가 자신들의 아이디어를 '뒷받침'한다는 점을 신중하게 밝히고 있습니다. 그들이 AI의 미스터리를 완전히 "풀었다"는 것은 아니지만, 그것이 어떻게 작동하는지에 대한 매우 강력한 지도를 제공했습니다.

그들은 AI가 단순히 더 무작위적이 된다거나, 혼란스러운 방식으로 사진을 암기하는 것뿐이라는 생각을 일축했습니다. 대신, AI가 지식을 깔끔하고, 분리되며, 효율적인 그룹으로 능동적으로 조직하고 있다고 제안합니다.

결국, TGO-III는 비전 트랜스포머가 학습할 때 단순히 커지는 것이 아니라, 더 똑똑해진다는 것을 알려줍니다. 그것은 혼란스러운 데이터 구름을 모든 아이디어가 자신만의 자리를 갖고 서로 멀리 떨어져 있어 즉각적으로 인식될 수 있는, 잘 조직된 도시로 변화시킵니다. 이는 기계 내부에서도 어떻게 질서가 혼돈으로부터 생겨날 수 있는지를 보여주는 아름다운 사례입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →