← 최신 논문
💻 computer science

All Routes Lead to Collapse

원저자: K. R. Balasubramanian

게시일 2026-06-23
📖 5 분 읽기🧠 심층 분석

원저자: K. R. Balasubramanian

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "눈먼 판사" 문제

당신이 오디션 프로그램의 심사위원이라고 상 imagine 해보세요. 당신의 임무는 최고의 출연자(토큰)를 골라 스포트라이트를 비춰주는 것입니다. 당신에게는 출연자들에게 점수를 매기는 규칙 책(알고리즘)이 있습니다.

이 논문은 모든 현대적 AI 모델(Transformer, Mamba, RWKV 등)이 특정 세부 사항에 대해 "눈이 먼" 규칙 책을 사용하고 있다고 주장합니다.

  • 규칙 책: 이 규칙은 출연자의 "콘텐츠"가 당신의 질의(query)와 얼마나 잘 일치하는지를 기준으로 점수를 매깁니다.
  • 맹점: 이 규칙은 출연자가 **얼마나 크거나 큰지(볼륨/크기)**는 완전히 무시합니다. 오직 목소리의 형태에만 신경을 쓸 뿐, 음량에는 관심이 없습니다.

판사가 음량을 볼 수 없기 때문에 시스템은 혼란에 빠집니다. 결정을 내리기 위해 시스템은 극단적인 행동을 해야만 합니다. 스포트라이트를 여러 곳에 골고루 나누어 주는 대신, 단 한두 명의 출연자에게 모든 관심을 쏟아붓는 것입니다.

논문은 이를 **"붕괴(Collapse)"**라고 부릅니다. 이것은 코드의 버그가 아니라 수학적 필연성입니다. 측정 도구(크기에 눈이 먼)가 고장 났다면, 시스템은 이해를 돕기 위해 모든 것을 아주 작은 구석으로 몰아넣어야만 합니다.


세 가지 증상 (The "Signature")

이 논문은 이 "눈먼 판사"가 통제권을 가질 때마다 발생하는 세 가지 현상을 식별했습니다. 이것들을 동일한 질병의 증상이라고 생각해보세요.

  1. "어텐션 싱크" (스포트레이트 쏠림 현상):
    스포트라이트가 여러 배우 사이를 부드럽게 이동하는 대신, 단 몇 명에게 고착됩니다. AI 용어로 말하면, 아주 적은 수의 토큰(예: 문장의 맨 첫 단어)이 거의 모든 어텐션을 흡수해 버립니다.

    • 비유: 선생님이 학급 전체에 질문을 던지는 것을 멈추고, 갑자기 맨 앞줄에 앉은 학생 한 명만을 뚫어지게 쳐다보는 교실을 상상해 보세요.
  2. 랭크 붕괴 (평면화):
    AI의 내부 "생각"(표현)이 다양성을 잃습니다. 모든 생각이 서로 비슷해지며, 단순하고 낮은 차원의 모양으로 줄어듭니다.

    • 비유: 3D 조각상이 서서히 납작해지다가 결국 2D 그림처럼 변하는 것을 상상해 보세요. 모든 깊이와 미묘한 차이가 사라지고, 모든 것이 평평한 시트가 되어버립니다.
  3. 노름 계층화 (Volume Explosion - 음량 폭발):
    판사가 음량을 무시하기 때문에, AI는 어떤 토큰은 엄청나게 크게(높은 노름/norm) 만들고 다른 토들은 작게 만들어, 큰 것들이 눈에 띄도록 하는 방식으로 "속임수"를 씁니다.

    • 비유: 판사가 음량의 차이를 들을 수 없기 때문에, 배우들이 주목받으려고 목청껏 소리를 지르는 반면 다른 이들은 속삭이는 상황과 같습니다.

위대한 발견: 이것은 단지 "Attention"만의 문제가 아니다

오랫동안 과학자들은 이 문제가 Transformer(특정한 방식의 "Attention"을 사용하는 AI 유형)에서만 발생한다고 생각했습니다. 그들은 이것이 "Attention" 메커니즘 자체의 결함이라고 믿었습니다.

하지만 이 논문은 그것이 틀렸음을 증명합니다.

저자들은 표준적인 Attention을 사용하지 않는 네 가지 다른 유형의 AI 아키텍처에 대해 이 "눈먼 판사" 이론을 테스트했습니다:

  1. Graph Attention: 네트워크의 노드 간에 정보를 전달하는 방식.
  2. Mamba: 어텐션 대신 "상태 공간(state spaces, 메모리 버퍼와 같은)"을 사용하는 모델.
  3. RWKV: 재귀(recurrence)처럼 시간에 따라 정보를 혼합하는 모델.
  4. Attention Residuals: 시간 대신 깊이(레이어)에 따라 정보를 전달하는 모델.

결과: 이 네 가지 서로 다른 시스템 모두 정확히 동일한 증상(스포트라이트 쏠림, 평면화, 음량 폭발)을 보였습니다.

결론: 문제는 "Attention"이 아닙니다. 문제는 **측정 도구가 "노름(크기)에 눈이 멀었을 때" 발생하는 콘텐츠 기반 라우팅(Content-Based Routing)**입니다. 만약 크기를 무시한 채 콘텐츠만을 기준으로 정보를 전달한다면, 어떤 아키텍처를 구축하더라도 시스템은 반드시 붕괴하게 됩니다.


"브레이크" 비유: 왜 어떤 모델은 더 빨리 붕괴하는가?

메커니즘이 같다면, 왜 어떤 모델은 즉시 붕괴(Transformer처럼)하고, 어떤 모델은 오래 걸릴까요(Mamba처럼)?

논문은 **"위치 브레이크(Positional Brake)"**라는 개념을 도입합니다.

  • 엔진: "콘텐츠 점수"는 시스템을 붕괴(최적의 콘텐츠를 선택하는 것)로 밀어붙이려는 엔진입니다.
  • 브레이크: 모든 모델에는 "잠깐, 이게 어디서 왔는지 기억해!"라고 말하는 보조 규칙이 있습니다 (예: "가장 최근의 단어를 잊지 마라" 또는 "첫 번째 단어를 잊지 마라").

브레이크의 작동 방식:

  • 강한 브레이크: 브레이크가 강하면(시간 쇠퇴 규칙이 강한 Mamba나 RWKV처럼), 브레이크가 엔진과 싸웁니다. 시스템은 오랫동안 붕계에 저항합니다. "콘텐츠"가 승리하기까지 시간이 걸립니다.
  • 약한 브레이크: 브레이크가 약하면(Rotary Positional Encoding을 사용하는 일반적인 Transformer처럼), 엔진이 빠르게 승리합니다. 시스템은 일찍, 그리고 강하게 붕괴합니다.

실험:
저자들은 모델(RWKV)을 가져와서 브레이크를 수동으로 조절했습니다.

  • 브레이크를 조이면(시간 쇠퇴를 더 강하게 만들면), 붕괴가 더 늦게, 더 약하게 일어났습니다.
  • 브레이크를 제거하면(콘텐츠가 마음껏 날뛰도록 두면), 붕괴가 거의 즉시 일어났습니다.

이는 메커니즘(붕괴)은 항상 존재하지만, 타이밍은 브레이크가 얼마나 강한지에 달려 있음을 증명합니다.


"음량"의 속임수 (Norm Stratification)

가장 흥리로운 발견 중 하나는 "음량 폭발(Norm Stratification)"에 관한 것입니다.

  • 이론: AI는 판사가 음량에 눈이 멀었기 때문에 이를 보완하려고 '큰' 토큰을 만듭니다.
  • 테스트: 저자들은 토큰의 음량이 동일하도록 강제된(정규화된) 모델(AttnRes)을 조사했습니다. 이렇게 하면 붕괴가 멈출 것이라고 생각할 수 있습니다.
  • 결과: 붕괴는 여전히 일어났습니다. 시스템은 다른 방식으로 속임수를 썼습니다. 음량을 사용하는 대신 순수하게 "콘텐츠 허브"에 집중하는 방식을 택했습니다.

교훈: "음량 폭발"은 AI가 고장 난 자를 고치기 위해 시도하는 하나의 방법일 뿐입니다. 그것은 원인이 아니라 증상입니다. 진짜 원인은 눈먼 자(측정 도구) 그 자체입니다.


요약: 이것이 의미하는 바

  1. 보편적인 법칙: 이것은 특정 AI 모델의 버그가 아닙니다. 이러한 라우팅 시스템이 작동하는 방식에 따른 근본적인 수학적 결과입니다. 크기를 무시한 채 콘텐츠를 기준으로 경로를 정한다면, 붕괴는 반드시 일어납니다.
  2. 기하학은 진단 도구이지 치료제가 아니다: 저자들은 왜 이런 일이 일어나는지 설명하기 위해 기하학적 언어(거리, 매니폴드)를 사용하지만, 이는 AI가 복잡한 기하학을 수행하고 있다는 뜻이 아닙니다. AI가 자신의 "자(ruler)"가 평평하고 눈이 멀었기 때문에 고군분투하고 있다는 것을 말하는 것입니다.
  3. 브레이크가 타이밍을 조절한다: 우리는 붕괴를 완전히 막을 수는 없지만(이 논문에 따르면), "위치 브레이크"(모델이 위치에 얼마나 신경 쓰느냐 vs 콘텐츠에 얼마나 신경 쓰느냐)를 조절함으로써 붕괴가 발생하는 시점을 제어할 수 있습니다.

요약하자면, 이 논문은 이렇게 말합니다. "특정 유형의 AI(Transformer)를 탓하지 마세요. 문제는 측정 테이프입니다. 측정 테이프가 크기에 눈이 멀어 있는 한, 시스템은 이해를 돕기 위해 결국 모든 것을 한 구석으로 몰아넣게 될 것입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →