← 최신 논문
🤖 machine learning

Feature Evolution and Migration during Vision Transformer Training

이 논문은 희소 오토인코더(Sparse Autoencoders)를 사용하여 비전 트랜스포머(Vision Transformers)의 네트워크 깊이와 훈련 시간에 따른 특징 진화(feature evolution)를 시각화하는 새로운 프레임워크를 소개하며, 이를 통해 특징 이동(feature migration)이 훈련 초기에 집중되고 더 얕은 층을 향한 이동을 선호하며, 깊은 층이 얕은 층보다 더 일찍 안정화된다는 점을 밝혀낸다.

원저자: Joonas Järve, Halil Ibrahim Aysel, Tarun Khajuria, Meelis Kull

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Joonas Järve, Halil Ibrahim Aysel, Tarun Khajuria, Meelis Kull

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 세계에서 컴퓨터는 디지털 뉴런으로 이루어진 거대하고 층이 있는 네트워크를 통해 이미지를 처리하며 보는 법을 배웁니다. 비전 트랜스포머(Vision Transformers)라고 알려진 이 시스템은 사진 속 동물을 식별하는 것부터 자율 주행 차량을 안내하는 것에 이르기까지 다양한 작업의 표준이 되었습니다. 수년 동안 과학자들은 이 네트워크가 계층적으로 정보를 조직한다는 사실을 이해해 왔습니다. 즉, 초기 층은 가장자리나 질감 같은 단순한 형태를 감지하고, 더 깊은 층은 이러한 형태를 결합하여 얼굴이나 전체 사물과 같은 복잡한 개념을 만들어낸다는 것입니다. 그러나 이러한 내부 조직이 실제로 어떻게 형성되는지에 대해서는 중요한 미스터리가 남아 있었습니다. 우리는 최종 결과물이 잘 정돈된 도서관처럼 보인다는 것은 알고 있었지만, 컴퓨터가 학습하는 동안 책들이 어떻게 분류되고, 이동하고, 선반에 놓이는지는 알지 못했습니다. 네트워크가 발견한 특징들이 학습의 첫 순간부터 마지막까지 동일한 위치에 머물러 있는지, 아니면 시스템이 성숙해짐에 따라 다른 층으로 이동하는지도 불분명했습니다.

이 퍼즐을 풀기 위해 타르투 대학교(University of Tartu)의 연구진은 학습 과정이 실시간으로 펼쳐지는 모습을 관찰할 수 있는 새로운 방법을 개발했습니다. 네트워크를 하나의 정적인 블록으로 보는 대신, 그들은 네트워크의 내부 활동을 두 가지 차원, 즉 첫 번째 층에서 마지막 층까지의 네트워크 깊이와 모델이 거친 수백 번의 학습 주기로 측정된 시간의 흐름에 따라 매핑했습니다. 그들은 네트워크를 살아있는 생태계처럼 취급하여, 특정 정보 패턴이 나타나고, 사라지고, 위치를 이동하는 과정을 추적했습니다. 복잡한 데이터를 단순하고 뚜렷한 구성 요소로 분해하는 수학적 도구를 사용함으로써, 연구팀은 컴퓨터가 인식하는 법을 배운 특정 대상(예: 특정 질감이나 물체의 일부분)인 개별 '특징(features)'을 분리하고 그 여정을 층을 통해 추적할 수 있었습니다. 이 접근 방식은 전체적인 유사성만을 측정하는 기존 방식으로는 놓칠 수 있는 학습의 숨겨진 역학을 볼 수 있게 해주었습니다.

연구진은 100만 장의 방대한 데이터셋을 사용하여 작은 규모의 대표적인 비전 트랜스포머를 학습시켰으며, 이를 통해 수천 개의 서로 다른 범주를 인식하도록 가르쳤습니다. 모델이 300회의 주기에 걸쳐 학습하는 동안, 팀은 매 단계마다 내부 상태를 기록했습니다. 그들은 특징의 조직이 고정되어 있지 않으며, 특히 학습 초기 단계에서 매우 유동적이라는 사실을 발견했습니다. 초기 단계에서 특징들은 시스템이 처음에 이미지 전체를 파악하려고 시도하는 곳인 네트워크의 더 깊은 층에서 자주 나타납니다. 학습이 진행됨에 따라, 이러한 많은 특징은 더 앞선 층인 더 얕은 층으로 역방향으로 이동합니다. 이는 마치 시스템이 처음에는 고차원적인 요약본을 통해 개념을 발견한 다음, 시간이 지나면서 그 개념이 처리 파이프라인의 정확히 어느 지점에 속해야 하는지를 파악하여 더 영구적인 안식처에 정착시키는 것과 같습니다.

이러한 이동은 무작위가 아니며 명확한 패턴을 따릅니다. 연구는 특징들이 더 깊은 층보다는 훨씬 더 빈번하게 앞쪽의 얕은 층을 향해 이동한다는 것을 발견했습니다. 일단 특징이 제 자리를 찾으면, 학습이 계속됨에 따라 점차 안정화되며 그곳에 머무는 경향이 있습니다. 네트워크의 깊은 층은 먼저 안정화되어 초기에 조직을 확정하는 반면, 얕은 층은 더 오랜 기간 동안 그 내용을 조정하고 정교화합니다. 학습이 끝날 때쯤이면 시스템은 특징들이 층 사이를 배회하지 않는 안정적인 구성으로 자리 잡게 됩니다. 연구진은 또한 이러한 행동이 사용된 데이터셋의 크기와 관계없이 일관되게 나타난다는 것을 관찰했으며, 이는 이 이동이 특정 학습 세트의 특이점이 아니라 이러한 네트워크가 학습하는 방식의 근본적인 부분임을 시사합니다.

아마도 가장 놀라운 점은, 학습 초기 단계에 나타나는 특징들이 반드시 가장 오래 지속되는 것은 아니라는 사실을 연구팀이 발견했다는 것입니다. 빠르게 등장하는 일부 특징들은 수명이 매우 짧아 몇 번의 학습 주기 내에 나타났다 사라집니다. 반면, 특히 깊은 층에 자리 잡는 특징들은 학습 기간 내내 지속됩니다. 연구는 또한 움직이는 특징들이 "개"나 "자동차"와 같이 인간이 이해할 수 있는 특정 범주와 일치하는지 조사했습니다. 그들은 일부 특징이 특정 클래스와 명확히 연결되어 있는 반면, 다른 특징들은 더 일반적이거나 관련된 항목 그룹 간에 공유된다는 것을 발견했습니다. 그러나 특징이 어떻게 이동하거나 안정화되는지는 그것이 특정 사물을 나타내는지 혹은 더 넓은 개념을 나타내는지에 달려 있지 않은 것으로 보였습니다. 즉, 이동 패턴은 학습 과정 자체의 구조적 속성입니다.

이러한 발견은 인공지능이 어떻게 학습하는지에 대한 새로운 관점을 제공합니다. 네트워크는 아래에서 위로 경직된 구조를 구축하기보다, 가장 효율적인 배치를 찾을 때까지 정보를 이리저 옮기며 다양한 조직 전략을 탐색하는 것처럼 보입니다. 학습의 초기 단계는 높은 활동성과 재조직의 시기로, 시스템이 학습된 특징들의 다양한 위치를 테스트하는 과정입니다. 학습이 완료됨에 따라 이러한 활동은 진정되며, 네트워크는 안정적인 상태로 정착합니다. 이 연구는 그 여정에 대한 상세한 지도를 제공하며, 이러한 기계의 지능으로 가는 경로가 단순히 지식을 정적으로 축적하는 것이 아니라 발견과 재배치의 역동적인 과정임을 보여줍니다. 특징이 어떻게 이동하고 안정화되는지를 이해함으로써, 과학자들은 이러한 강력한 도구들의 내부 작동 원리에 대해 더 깊은 통찰력을 얻을 수 있으며, 이는 향후 더 효율적이고 해석 가능한 시스템을 만드는 데 기여할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →