← 최신 논문
🤖 machine learning

Geometry-Guided Layerwise FFN Width Allocation in Transformers

이 논문은 그로모프-와서스타인 왜곡(Gromov-Wasserstein distortion) 및 지속적 호몰로지(persistent homology)와 같은 기하학적 지표를 기반으로 트랜스포머 레이어 전반에 걸쳐 피드포워드 네트워크(FFN) 너비를 동적으로 할당하는 기하학 가이드 방식을 제안하며, 이러한 데이터 기반 스케줄이 균등하거나 수동으로 설계된 너비 할당에 비해 검증 손실을 유의미하게 감소시킨다는 것을 입증한다.

원저자: Timur Mudarisov, Mikhail Burtsev, Radu State

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Timur Mudarisov, Mikhail Burtsev, Radu State

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 다층 도서관을 짓고 있다고 상상해 보세요. 각 층은 특정 유형의 정보를 정리하는 데 전념하는 방으로 구성되어 있습니다. 인공지능의 세계에서 이 '도서관'들은 트랜스포머(Transformer)라고 불리며, 현대적인 챗봇과 언어 도구들의 두뇌 역할을 합니다. 각 방 안에는 들어오는 정보를 처리하고, 생각하고, 다음으로 전달하는 임무를 맡은 작업 팀(피드포워드 네트워크, 또는 FFN)이 있습니다. 오랫동안 엔지니어들은 이 도서관을 만들 때 엄격한 규칙을 적용했습니다. 그것은 바로 어떤 층이든 상관없이 모든 방에 정확히 동일한 수의 작업자를 배치해야 한다는 것이었습니다. 이는 마치 지하실의 창고와 화려한 꼭대기 층의 독서실에 똑같은 예산을 배정하는 것과 같습니다.

하지만 만약 이 규칙이 낭비적이라면 어떨까요? 지하실은 상자들이 단순해서 적은 인원이 필요하고, 꼭대기 층은 복잡하고 추상적인 아이디어를 다루기 위해 거대한 팀이 필요하다면 어떨까요? 이 질문은 연구자들이 던지기 시작한 질문입니다. 그들은 정보가 도서관을 통과하면서 형태가 변하고 더 복잡해진다는 것을 알고 있습니다. 큰 문제는, 추가로 사람을 고용하지 않고도 각 방이 얼마나 많은 '일'을 하고 있는지 정확히 측정하여 작업자들을 필요한 곳으로 옮길 수 있느냐는 것입니다. 이 논문은 기하학(모양과 거리를 연구하는 학문)과 수학을 결합하여 각 방을 위한 완벽한 인력 배치 계획을 찾아내는 이 아이디어를 탐구합니다.

이 논문의 저자인 티무르 무다리소프(Timur Mudarisov), 미하일 버트세프(Mikhail Burtsev), 라두 스테이트(Radu State)는 추측하는 것을 멈추고 측정을 시작하기로 했습니다. 그들은 AI를 통해 흐르는 정보를 '점들의 구름'(방 안을 움직이는 반딧불이 떼라고 생각하세요)처럼 취급했습니다. 반딧불이들이 한 방에서 다음 방으로 이동함에 따라, 그들은 이동하고, 늘어나고, 뒤틀립니다. 연구팀은 각 방에서 얼마나 많은 '기하학적 작업'이 일어나는지 정확히 측정하는 방법을 개발했습니다. 그들은 세 가지 다른 방식으로 이를 측정했습니다. 반딧불이가 얼마나 멀리 이동했는지(이동), 반딧불이 사이의 거리가 어떻게 변했는지(그로모프-와서스타인), 그리고 그들의 형성 구조에서 루프와 구멍이 어떻게 변했는지(위상)를 살펴보았습니다.

여기 반전이 있습니다. 어떻게 측정하느냐가 중요하다는 점을 발견했습니다. 단순히 물리적 거리만 본다면, 나중에 나오는 방들이 가장 많은 일을 하는 것처럼 보이지만, 이는 종종 데이터의 규모 문제(scale issue) 때문입니다. 즉, 반딧불이 떼 자체가 커지고 있기 때문입니다. 그러나 그들이 데이터를 정규화했을 때—즉, 크기가 아니라 움직임의 '형태'를 보았을 때—그들은 다른 패턴을 발견했습니다. 실제 '작업'은 도서관의 맨 처음에 가장 높았다가, 깊이 들어갈수록 줄어들었습니다. 이는 초기 단계의 방들이 가장 많은 두뇌 능력을 필요로 하는 반면, 나중의 방들은 더 적은 인원으로도 충분하다는 것을 시사합니다.

이를 테스트하기 위해, 그들은 새로운 '인력 배치 일정'을 만들었습니다. 모든 방에 동일한 수의 작업자를 주는 대신, 초기 방에는 더 많은 인원을, 나중 방에는 더 적은 인원을 배정하되, 기존의 균등한 모델과 전체 작업자 수는 정확히 동일하게 유지했습니다. 그들은 이 방법을 1억 2천 8백만 개의 파라미터를 가진 작은 모델부터 4억 4천만 개의 파라미터를 가진 더 큰 모델에 이르기까지 다양한 AI 모델에 테스트했습니다.

결과는 유망했습니다. 그들의 실험에서, '기하학 가이드' 방식의 배치 계획을 사용한 모델들은 모든 방이 동일했던 표준 모델보다 더 나은 성능을 보였습니다. 실제로 그들은 자신들의 데이터 기반 접근 방식이, 단순히 작업량이 슬라이드처럼 매끄럽게 감소한다고 가정하는 인기 있는 설계 방식인 '코사인 테이퍼(cosine taper)'보다 더 뛰어난 성과를 냈음을 입증했습니다. 4억 4천만 파라미터 규모에서, 그들의 기하학 기반 계획은 코사인 계획보다 모델의 오류를 훨씬 더 유의미하게 줄였습니다.

하지만 저자들은 자신들의 방법이 문제를 영원히 해결했다고 주장하는 데는 신중합니다. 그들은 자신들의 방법이 '참조' 모델을 측정하고 그 규칙을 새로운 모델에 적용하는 방식에 의존한다는 점을 언급합니다. 비록 결과는 초기 레이어에 용량을 집중하는 전략이 승리하는 전략임을 시사하지만, 어떤 특정 측정 도구(위상 vs 기하학)가 최선인지에 대해서는 더 많은 테스트가 필요하다고 인정합니다. 또한, 그들은 데이터가 제안하는 것과 정반대로 의도적으로 설계된 '안티-토폴로지컬(anti-topological)' 대조군이 표준 모델보다 성능이 낮았다는 점을 지적하며, 이는 그들의 새로운 계획의 방향이 정말로 맞다는 것을 확인시켜 준다고 말합니다.

요약하자면, 이 논문은 AI 모델이 반드시 동일한 방들로 구축될 필요는 없다는 것을 시사합니다. 기하학을 사용하여 실제 작업이 어디에서 발생하는지 측정함으로써, 우리는 단 한 푼의 추가 비용도 들이지 않고도 전체 도서관을 더 똑똑하게 만들기 위해 작업자들을 재배치할 수 있습니다. 이는 동일한 컴퓨팅 파워로부터 더 높은 성능을 끌어내기 위한 영리하고 데이터 중심적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →