Which Question Is Your Attention Metric Answering? Attention Rows as Compositional Data
이 논문은 표준적인 어텐션 지표들이 모델의 초점이 지배적인 '싱크(sink)' 토큰에 있는지 아니면 콘텐츠 토큰들에 분산되어 있는지에 대한 구분을 실패함으로써 오해의 소지가 있는 결론을 도출하는 경우가 많다고 주장하며, 대신 어텐션 행(row)을 구성 데이터(compositional data)로 취급하여 이러한 요인들을 정확하게 분리하고 모델 분석 및 프루닝(pruning)에서의 아티팩트를 방지할 것을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능을 구동하는 거대한 신경망 내부에는 문장이나 이미지의 어느 부분이 특정 순간에 가장 중요한지를 결정할 수 있게 해주는 '어텐션(attention)'이라는 메커니즘이 존재합니다. 이 메커니즘이 작동하면 모든 단어나 토큰에 대한 확률 목록을 생성하여, 각 요소에 얼마나 많은 집중력이 배치되는지를 보여줍니다. 수년 동안 연구자들은 기계가 어떻게 생각하는지 이해하기 위해 표준적인 수학적 도구를 사용하여 이 목록들을 비교해 왔습니다. 그들은 만약 두 목록이 유사해 보인다면, 그 밑바탕에 깔린 사고 과정도 유사할 것이라고 가정했습니다. 그러나 새로운 분석은 이 가정이 과학자들이 인지하지 못한 채 저질러온 숨겨진 선택에 기반하고 있으며, 이 선택이 기계가 실제로 무엇을 하고 있는지에 대한 결론을 완전히 뒤집을 수 있다는 사실을 밝혀냈습니다.
문제의 핵심은 거의 모든 거대 언어 모델에서 발견되는 독특한 행동, 즉 문장의 맨 첫 단어와 같이 정보가 없는 단어 하나에 엄청난 양의 어텐션을 쏟아붓는 경향에 있습니다. 연구자들은 이를 '어텐션 싱크(attention sink)'라고 부릅니다. 많은 경우, 이 단일 토큰은 전체 어텐션의 80% 이상을 흡수하며, 나머지 토큰들은 아주 적은 잔여량을 나누어 갖게 됩니다. 과학자들이 서로 다른 두 어텐션 패턴을 비교하고자 할 때, 그들은 딜레마에 직면합니다. 이 지배적인 첫 번째 토큰을 비교에 포함할 것인가, 아니면 이를 제거하여 나머지 정보가 어떻게 분포되어 있는지를 볼 것인가? 논문은 이것이 단순한 기술적 세부 사항이 아님을 입증합니다. 연구자가 어떤 옵션을 선택하느냐에 따라, 동일한 두 어텐션 패턴이 거의 동일해 보일 수도 있고, 혹은 완전히 다르게 보일 수도 있습니다. 이는 수십 년간의 기존 연구들이 이 패턴을 비교할 때 첫 번째 토큰을 어떻게 처리했는지 명시하지 않은 채 진행되었으며, 그 결과가 실제 모델의 사고 구조가 아닌 임의적인 관례에 기반한 결론을 도출했을 수 있음을 의미합니다.
이를 해결하기 위해 저자들은 어텐션 목록을 부분들의 절대적인 크기가 아니라 상대적인 비율만이 중요한 데이터 유형인 '구성 데이터(compositional data)'로 취급했습니다. 이러한 종류의 데이터에 특화된 수학적 프레임워크를 적용함으로써, 그들은 '싱크(sink)' 문제와 '콘텐츠(content)' 문제를 분리할 수 있었습니다. 그들은 코사인 유사도(cosine similarity)나 엔트로피(entropy)와 같은 커뮤니티에서 사용되는 표준 도구들이 이 두 가지 별개의 질문을 혼합하고 있음을 증명했습니다. 어텐션 싱크가 커질수록, 표준 도구들은 어텐션이 더 집중되고 시스템이 더 단순한 상태로 붕괴하고 있다고 보고합니다. 하지만 새로운 분석에 따르면 이는 종종 환상에 불과합니다. 어텐션이 콘텐츠에 더 집중되는 것이 아니라, 단순히 첫 번째 토큰이 스포트라이트를 독차지하고 있을 뿐입니다. 실제 의미 있는 단어들 사이의 어텐션 분포는 완전히 변하지 않은 채로 남아 있을 수 있음에도 불구하고, 표준 지표들은 시스템이 붕괴했다고 비명을 지르는 것입니다.
연구진은 소규모 실험용 네트워크부터 수십억 개의 파라미터를 가진 거대 모델에 이르기까지 10가지 서로 다른 사전 학습된 모델을 대상으로 이 이론을 테스트했습니다. 그들은 선택한 관례가 놀라운 수의 사례에서 판결을 바꾼다는 것을 발견했습니다. 어떤 모델에서는 싱크를 포함했을 때와 제외했을 때, 네트워크의 서로 다른 부분들 사이의 비교 결과 중 거의 절반이 반대로 뒤집혔습니다. 예를 들어, 싱크를 포함했을 때 네트워크에서 가장 가까운 이웃이었던 한 쌍의 어-헤드(attention head)들이, 싱크를 제거하자 먼 타인이 될 수 있었습니다. 반대로, 싱크를 포함했을 때는 무관해 보였던 헤드들이 싱크를 제외하면 동일한 쌍둥이처럼 보일 수도 있었습니다. 이러한 불안정성은 과학자들이 뇌의 각 부분이 무엇을 하는지 분류하기 위해 사용하는 유명한 '헤드 클러스터링(head clustering)' 지도들이, 실제 기능보다는 싱크의 크기를 포착하고 있는 경우가 많았음을 의미합니다. 표준 클러스터링 파이프라인을 재분석한 한 사례에서는, 싱크를 제대로 고려하자 데이터에서 발견되었던 가장 두드러진 구조가 완전히 사라졌으며, 이는 그 구조가 모델의 특징이 아니라 측정 방법의 산물이었음을 드러냈습니다.
이러한 연구 결과는 모델을 훈련하고 개선하는 데 있어 중요한 시사점을 가집니다. 논문은 '엔트로피 붕괴(entropy collapse)'—모델이 훈련 중에 불안정해지거나 지나치게 단순해지는 징후—처럼 보이는 현상의 상당 부분이 실제로는 어텐션 싱크가 커지는 현상임을 보여줍니다. 10억 개의 파라미터를 가진 모델에서, 나타난 복잡성 감소의 95%는 콘텐츠가 덜 다양해진 것이 아니라 싱크가 더 많은 공간을 차지했기 때문이었습니다. 이 구분은 엔지니어가 네트워크의 불필요한 부분을 가지치기(pruning)하거나 제거할 때 매우 중요합니다. 연구진이 싱크의 노이즈와 콘텐츠의 신호를 분리하는 새로운 방법을 사용하여 네트워크의 어떤 부분을 잘라낼지 결정했을 때, 기존의 방법을 사용하면 모델의 성능이 급락하여 오류율이 어떤 경우에는 100배 이상 증가할 수 있음을 발견했습니다. 새로운 방법은 모델을 망가뜨리지 않고도 중복된 부분을 식별하고 제거할 수 있게 해주었지만, 이는 반드시 싱크의 노이즈를 콘텐츠의 신호로부터 먼저 분리했을 때만 가능했습니다.
궁극적으로, 이 작업은 기존의 수학이 틀렸다고 주장하는 것이 아니라, 연구자들이 묻고자 했던 질문과는 다른 질문에 답하고 있었다는 점을 지적합니다. 기존의 도구들은 첫 번째 토큰에 대한 거대한 편향을 포함한 전체 어텐션 할당량을 측정했습니다. 새로운 도구들은 남은 어텐션이 실제 콘텐츠 사이에서 어떻게 공유되는지를 측정합니다. 저자들은 각 접근 방식이 언제 안전하게 사용될 수 있고 언제 재앙으로 이어지는지에 대한 명확한 지도를 제공합니다. 그들은 강력한 어텐션 싱크를 가진 모델의 경우, 표준적인 방법들이 기계의 내부 논리를 이해하는 데 신뢰할 수 없음을 보여줍니다. 두 채널을 분리함으로써, 연구자들은 이제 모델의 어텐션이 가진 진정한 기하학적 구조를 볼 수 있으며, 시스템이 진정으로 생각을 단순화하고 있는 것인지, 아니면 단순히 첫 번째 토큰이 대화를 독점하게 두고 있는 것인지를 구별할 수 있습니다. 이러한 분리는 연구자들이 모델의 내적 작동 원리에 대한 발견이 단순한 측정의 특이점이 아니라, 그들의 생각의 내용에 기반하도록 보장함으로써, 이 복잡한 시스템이 정보를 조직하는 방식에 대해 더 정직한 시각을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.