← 최신 논문
🤖 AI

Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals

이 논문은 비학습 토큰 축소 방법들이 쌍대 유사성 신호의 불안정성과 계층별 축적 오차로 인해 고압축률에서 성능이 급격히 저하되는 원인을 규명하고, 이를 해결하기 위해 단수 신호와 분류 전략을 도입한 CATIS 를 제안하여 ImageNet-1K 에서 기존 방법들의 붕괴를 극복하고 81.0% 의 정확도를 유지함을 보여줍니다.

원저자: Yang Shanglin

게시일 2026-04-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yang Shanglin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏢 1. 문제: 왜 갑자기 무너지는가? (The Collapse)

지금까지 AI 모델을 가볍게 만들기 위해 '불필요한 정보 (토큰)'를 잘라내는 방법들이 많이 나왔습니다. (ToMe, ToFu 등)
하지만 연구자들은 놀라운 사실을 발견했습니다. 어떤 방법을 쓰든, 정보를 너무 많이 줄이면 (약 60% 이상) AI 의 성능이 갑자기 '절벽'처럼 추락한다는 것입니다.

  • 비유: 100 층짜리 빌딩 (AI 모델) 이 있다고 칩시다.
    • 기존 방법들은 "엘리베이터를 타는 사람 중 누가 덜 중요한지"를 판단해서, **사람끼리 서로 비교 (Pairwise)**하며 불필요한 사람을 내보내거나 합칩니다.
    • 문제는 층이 높을수록 (심층 레이어) 이 판단이 엉망이 된다는 것입니다.
    • 처음에는 "A 와 B 를 비교하니 B 가 덜 중요해"라고 잘 판단하다가, 50 층이 넘어가면 "A 와 B 를 비교하니... 뭐가 중요하지? 그냥 랜덤으로 고르자"라고 망가집니다.

🔍 2. 원인 분석: 두 가지 치명적인 오류

논문은 이 붕괴가 두 가지 원인이 서로 얽혀서 일어난다고 설명합니다.

원인 1: "오류 증폭기" (The Error Amplifier)

  • 상황: 1 층에서 실수로 중요한 사람을 내보냈거나, 엉뚱한 두 사람을 합쳐버리면, 그 잘못된 정보가 2 층, 3 층으로 전달됩니다.
  • 악순환: 2 층은 이미 망가진 정보를 보고 다시 판단을 내립니다. 3 층은 더 망가진 정보를 보고 판단합니다.
  • 결과: 작은 실수가 층을 올라갈수록 기하급수적으로 커져, 마지막 층에서는 완전히 엉망이 되어버립니다. 이를 **'오류 증폭'**이라고 합니다.

원인 2: "비교의 불안정성" (Unstable Pairwise Signals)

  • 기존 방법의 문제: 기존 방법들은 "이 사람과 저 사람을 비교해서 (Pairwise)" 중요도를 매겼습니다.
    • 비유: 100 명을 한 명씩 비교하는 게 아니라, **100 명을 서로 모두 비교 (100x99)**해야 합니다.
    • 문제: 깊은 층으로 갈수록 사람들의 얼굴 (데이터 특징) 이 모두 비슷해집니다 (Homogenization). 이때 100 명을 서로 비교하면, 아주 작은 노이즈 때문에 순서가 완전히 뒤바뀝니다. 마치 "이 사람과 저 사람 중 누가 더 예쁜지"를 100 명 모두에게 물어봤는데, 깊은 층에서는 사람들이 모두 비슷해져서 "누가 더 예쁜지"를 구분할 수 없게 되는 상황입니다.
  • 통계적 이유: 두 사람을 비교할 때 (Pairwise) 는 두 사람의 작은 실수가 모두 영향을 미쳐서 불안정성이 2 배가 됩니다. 하지만 한 사람의 특징만 보고 판단하면 (Unary) 훨씬 안정적입니다.

💡 3. 해결책: CATIS (새로운 방법)

저자는 이 문제를 해결하기 위해 CATIS라는 새로운 방법을 만들었습니다. 세 가지 원칙을 적용했습니다.

원칙 1: "비교" 대신 "단독 평가" (Unary Signals)

  • 변화: "A 와 B 를 비교해서"가 아니라, **"이 사람이 빌딩의 평균과 얼마나 다른지"**를 봅니다.
  • 효과: 전체 평균 (Population Statistics) 은 한 두 사람의 실수에 흔들리지 않습니다. 마치 "이 학생이 반 평균보다 얼마나 뛰어난지"를 볼 때, 한 두 명의 성적이 바뀌어도 전체 평균은 크게 변하지 않는 것과 같습니다.
  • 결과: 깊은 층에서도 판단이 훨씬 안정적이 됩니다.

원칙 2: "다양한 시선"의 결합 (Fusion)

  • 전략: 얕은 층에서는 '개별 특징'이 중요하고, 깊은 층에서는 '전체 흐름 (CLS 토큰)'이 중요합니다. CATIS 는 이 두 가지 정보를 합쳐서, 층마다 가장 좋은 판단을 내립니다.

원칙 3: "선별적 보호" (Triage)

  • 전략: 모든 사람을 한 번에 처리하지 않습니다.
    1. 확실한 VIP (보호): 중요한 사람은 절대 건드리지 않습니다.
    2. 확실한 불필요자 (퇴출): 확실히 필요 없는 사람은 바로 내보냅니다.
    3. 중간층 (병합): 애매한 사람들끼리만 합칩니다.
  • 효과: 가장 위험한 실수 (중요한 사람을 내보내거나, 엉뚱한 사람을 합치는 것) 를 막아줍니다.

🏆 4. 결과: 기적 같은 성과

이 방법을 적용한 결과, 기존 방법들이 60% 이상 정보를 줄이면 성능이 40~60% 로 추락했던 반면, CATIS 는 81% 의 성능을 96.9% 수준으로 유지했습니다.

  • 비유: 기존 방법들은 엘리베이터를 60% 줄이다가 탑승객들이 모두 떨어졌다면, CATIS 는 VIP 는 보호하고, 불필요한 짐만 버리면서 엘리베이터를 효율적으로 운영한 것입니다.

📝 요약

  1. 문제: AI 가 정보를 줄일 때, "사람끼리 비교하는 방식"이 깊은 층에서 무너지고, 그 실수가 층을 올라가며 증폭되어 AI 가 붕괴됩니다.
  2. 원인: 깊은 층에서는 데이터가 비슷해져서 '비교'가 불가능해지고, 작은 실수가 기하급수적으로 커집니다.
  3. 해결:
    • 비교하지 말고, 평균과 비교하세요. (단독 평가)
    • 중요한 사람은 보호하세요. (선별적 퇴출/병합)
  4. 성과: 기존 방법들이 무너지는 지점에서도 AI 가 거의 원래 성능을 유지하며, 훨씬 더 가볍고 빠르게 작동합니다.

이 논문은 AI 를 가볍게 만드는 것이 단순히 "무작정 잘라내는 것"이 아니라, **"어떻게 판단하고, 무엇을 보호할지"**에 대한 구조적인 이해가 필요함을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →