Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals
이 논문은 비학습 토큰 축소 방법들이 쌍대 유사성 신호의 불안정성과 계층별 축적 오차로 인해 고압축률에서 성능이 급격히 저하되는 원인을 규명하고, 이를 해결하기 위해 단수 신호와 분류 전략을 도입한 CATIS 를 제안하여 ImageNet-1K 에서 기존 방법들의 붕괴를 극복하고 81.0% 의 정확도를 유지함을 보여줍니다.
지금까지 AI 모델을 가볍게 만들기 위해 '불필요한 정보 (토큰)'를 잘라내는 방법들이 많이 나왔습니다. (ToMe, ToFu 등) 하지만 연구자들은 놀라운 사실을 발견했습니다. 어떤 방법을 쓰든, 정보를 너무 많이 줄이면 (약 60% 이상) AI 의 성능이 갑자기 '절벽'처럼 추락한다는 것입니다.
비유: 100 층짜리 빌딩 (AI 모델) 이 있다고 칩시다.
기존 방법들은 "엘리베이터를 타는 사람 중 누가 덜 중요한지"를 판단해서, **사람끼리 서로 비교 (Pairwise)**하며 불필요한 사람을 내보내거나 합칩니다.
문제는 층이 높을수록 (심층 레이어) 이 판단이 엉망이 된다는 것입니다.
처음에는 "A 와 B 를 비교하니 B 가 덜 중요해"라고 잘 판단하다가, 50 층이 넘어가면 "A 와 B 를 비교하니... 뭐가 중요하지? 그냥 랜덤으로 고르자"라고 망가집니다.
🔍 2. 원인 분석: 두 가지 치명적인 오류
논문은 이 붕괴가 두 가지 원인이 서로 얽혀서 일어난다고 설명합니다.
원인 1: "오류 증폭기" (The Error Amplifier)
상황: 1 층에서 실수로 중요한 사람을 내보냈거나, 엉뚱한 두 사람을 합쳐버리면, 그 잘못된 정보가 2 층, 3 층으로 전달됩니다.
악순환: 2 층은 이미 망가진 정보를 보고 다시 판단을 내립니다. 3 층은 더 망가진 정보를 보고 판단합니다.
결과: 작은 실수가 층을 올라갈수록 기하급수적으로 커져, 마지막 층에서는 완전히 엉망이 되어버립니다. 이를 **'오류 증폭'**이라고 합니다.
원인 2: "비교의 불안정성" (Unstable Pairwise Signals)
기존 방법의 문제: 기존 방법들은 "이 사람과 저 사람을 비교해서 (Pairwise)" 중요도를 매겼습니다.
비유: 100 명을 한 명씩 비교하는 게 아니라, **100 명을 서로 모두 비교 (100x99)**해야 합니다.
문제: 깊은 층으로 갈수록 사람들의 얼굴 (데이터 특징) 이 모두 비슷해집니다 (Homogenization). 이때 100 명을 서로 비교하면, 아주 작은 노이즈 때문에 순서가 완전히 뒤바뀝니다. 마치 "이 사람과 저 사람 중 누가 더 예쁜지"를 100 명 모두에게 물어봤는데, 깊은 층에서는 사람들이 모두 비슷해져서 "누가 더 예쁜지"를 구분할 수 없게 되는 상황입니다.
통계적 이유: 두 사람을 비교할 때 (Pairwise) 는 두 사람의 작은 실수가 모두 영향을 미쳐서 불안정성이 2 배가 됩니다. 하지만 한 사람의 특징만 보고 판단하면 (Unary) 훨씬 안정적입니다.
💡 3. 해결책: CATIS (새로운 방법)
저자는 이 문제를 해결하기 위해 CATIS라는 새로운 방법을 만들었습니다. 세 가지 원칙을 적용했습니다.
원칙 1: "비교" 대신 "단독 평가" (Unary Signals)
변화: "A 와 B 를 비교해서"가 아니라, **"이 사람이 빌딩의 평균과 얼마나 다른지"**를 봅니다.
효과: 전체 평균 (Population Statistics) 은 한 두 사람의 실수에 흔들리지 않습니다. 마치 "이 학생이 반 평균보다 얼마나 뛰어난지"를 볼 때, 한 두 명의 성적이 바뀌어도 전체 평균은 크게 변하지 않는 것과 같습니다.
결과: 깊은 층에서도 판단이 훨씬 안정적이 됩니다.
원칙 2: "다양한 시선"의 결합 (Fusion)
전략: 얕은 층에서는 '개별 특징'이 중요하고, 깊은 층에서는 '전체 흐름 (CLS 토큰)'이 중요합니다. CATIS 는 이 두 가지 정보를 합쳐서, 층마다 가장 좋은 판단을 내립니다.
원칙 3: "선별적 보호" (Triage)
전략: 모든 사람을 한 번에 처리하지 않습니다.
확실한 VIP (보호): 중요한 사람은 절대 건드리지 않습니다.
확실한 불필요자 (퇴출): 확실히 필요 없는 사람은 바로 내보냅니다.
중간층 (병합): 애매한 사람들끼리만 합칩니다.
효과: 가장 위험한 실수 (중요한 사람을 내보내거나, 엉뚱한 사람을 합치는 것) 를 막아줍니다.
🏆 4. 결과: 기적 같은 성과
이 방법을 적용한 결과, 기존 방법들이 60% 이상 정보를 줄이면 성능이 40~60% 로 추락했던 반면, CATIS 는 81% 의 성능을 96.9% 수준으로 유지했습니다.
비유: 기존 방법들은 엘리베이터를 60% 줄이다가 탑승객들이 모두 떨어졌다면, CATIS 는 VIP 는 보호하고, 불필요한 짐만 버리면서 엘리베이터를 효율적으로 운영한 것입니다.
📝 요약
문제: AI 가 정보를 줄일 때, "사람끼리 비교하는 방식"이 깊은 층에서 무너지고, 그 실수가 층을 올라가며 증폭되어 AI 가 붕괴됩니다.
원인: 깊은 층에서는 데이터가 비슷해져서 '비교'가 불가능해지고, 작은 실수가 기하급수적으로 커집니다.
해결:
비교하지 말고, 평균과 비교하세요. (단독 평가)
중요한 사람은 보호하세요. (선별적 퇴출/병합)
성과: 기존 방법들이 무너지는 지점에서도 AI 가 거의 원래 성능을 유지하며, 훨씬 더 가볍고 빠르게 작동합니다.
이 논문은 AI 를 가볍게 만드는 것이 단순히 "무작정 잘라내는 것"이 아니라, **"어떻게 판단하고, 무엇을 보호할지"**에 대한 구조적인 이해가 필요함을 보여줍니다.
1. 문제 정의 (Problem)
기존의 학습 없는 토큰 축소 기법들 (ToMe, ToFu, PiToMe, MCTF 등) 은 추론 시 모델 가중치를 수정하지 않고 불필요한 토큰을 제거하거나 병합하여 계산 효율을 높입니다. moderate compression(중간 압축) 수준에서는 좋은 성능을 보이지만, 고압축 (Aggressive Compression) 구간에서는 모든 선도적인 방법들이 거의 동일한 시점에서 급격하게 정확도가 떨어지는 '절벽 (Cliff)' 현상을 보입니다.
현상: ViT-Large 모델에서 토큰 축소 비율 (r) 이 9 에서 11 로 약간만 증가해도 정확도가 23~40%p 급감.
가설: 각 방법의 설계 차이 때문이 아니라, 모든 방법이 공유하는 구조적 한계가 원인일 것이라는 의문 제기.
2. 진단 프레임워크 및 원인 분석 (Diagnosis & Root Cause)
저자는 두 가지 주요 구성 요소를 통해 이 붕괴 현상을 설명하는 진단 프레임워크를 개발했습니다.
A. 오류 증폭기 (The Error Amplifier)
메커니즘: 레이어별 토큰 축소는 양의 피드백 루프를 생성합니다. 이전 레이어에서 발생한 축소 오류 (잘못된 병합 또는 제거) 는 다음 레이어의 중요도 추정을 왜곡시키고, 이 왜곡이 레이어를 거치며 기하급수적으로 증폭됩니다.
수식적 모델: 누적 왜곡 Δ(l)이 레이어 l에 따라 초선형 (super-linear) 으로 증가함을 증명.
예측:
정확도 - GFLOP 곡선 (Pareto curve) 이 볼록 (convex) 하게 형성됨.
붕괴 임계값 (rcrit) 은 모델 깊이 (L) 에 반비례 (rcrit∝1/L). 즉, 깊은 모델일수록 더 낮은 축소 비율에서도 붕괴가 발생함.
신호 품질 향상 또는 토큰 보호는 붕괴 임계값을 지연시킴.
B. 쌍대 신호의 불안정성 (Instability of Pairwise Signals)
근본 원인: 기존 방법들은 모두 토큰 간 **쌍대 유사성 (Pairwise Similarity, 예: Cosine Similarity)**을 기반으로 중요도를 산정합니다.
문제점: 깊은 레이어로 갈수록 토큰 표현이 동질화 (Homogenization) 되면서, 쌍대 신호의 순위 일관성 (Ranking Consistency, ρs) 이 급격히 저하됨 (0.88 → 0.27).
이론적 배경:
Pairwise 신호:O(Np2)개의 결합된 perturbation(교란) 요소에 의존. 단일 토큰의 변화가 모든 쌍대 점수에 영향을 미쳐 불안정함.
Unary 신호:O(Np)개의 독립적 요소와 중심극한정리 (CLT) 에 기반한 집단 통계량을 사용하여 훨씬 안정적임.
결론: 쌍대 신호의 구조적 불안정성이 오류 증폭기의 '트리거 (Trigger)'를 낮게 설정하여, 모든 방법이 동일한 시점에서 붕괴하게 만듭니다.
3. 제안 방법: CATIS (Constructive Validation)
위 진단에서 도출된 3 가지 설계 원칙 (P1-P3) 을 기반으로 **CATIS (Complementary Activation Triage with Importance Scoring)**를 제안합니다.
P1: Unary 신호로 전환 (Trigger Threshold 상승)
쌍대 신호 대신 Univariate 신호를 사용하여 교란에 대한 민감도를 낮춤.
구현: 토큰 중요도를 레이어 내 토큰 집단의 분포에서 벗어난 정도 (Anomaly Detection) 로 정의. Mahalanobis 거리의 대각 근사 (normF) 를 사용하여 계산 효율성을 유지하면서도 Unary 특성을 확보.
P2: 상보적 신호 융합 (Depth-band Complementarity)
단일 Unary 신호는 모든 깊이에서 일관된 성능을 내지 못함.
구현: 얕은 레이어에 강한 **Activation 신호 (normF)**와 중간 레이어에 강한 **Context 신호 (CLS Attention + Momentum)**를 융합하여 모든 레이어에서 높은 순위 일관성 (ρs) 을 확보.
P3: 분류 (Triage) 메커니즘 (증폭 이득 억제)
단순히 중요도 순서대로 토큰을 줄이는 것이 아니라, 신뢰도 수준에 따라 토큰을 3 가지 집합으로 나눕니다.
구현:
보호 (Protect): 고신뢰도 토큰은 축소 없이 보존.
추방 (Evict): 저신뢰도 토큰은 삭제 (병합보다 구조적 손상이 적음).
병합 (Merge): 중간 신뢰도 토큰만 병합.
효과: 가장 위험한 결정 (중요 토큰 제거) 을 피하고, 병합으로 인한 구조적 손상 (δm) 을 최소화하며, 유효 축소 비율을 낮춤.
4. 주요 실험 결과 (Results)
ImageNet-1K 및 다양한 Robustness 벤치마크 (ImageNet-A, R, Sketch) 에서 ViT-Large, DeiT-3 등 7 가지 모델에 대해 평가했습니다.
성능: ViT-Large 에서 63% FLOPs 감소 시, 기존 방법들 (ToMe, ToFu 등) 이 정확도가 43~65% 로 붕괴한 반면, **CATIS 는 81.0% (Vanilla 83.64% 대비 96.9% 유지)**를 기록했습니다.
일반화: 학습된 방법 (Fine-tuning 기반) 이 아닌 학습 없는 방법 중 가장 높은 성능을 보였으며, DINOv3 와 같은 자기지도학습 모델에서도 우수한 성능을 입증했습니다.
비디오 분류: VideoMAE 에 적용 시에도 91.8% 토큰 축소 시 Vanilla 대비 81.73% 정확도를 유지하며 붕괴를 방지했습니다.
속도: 추가적인 분류 (Triage) 로 인한 오버헤드는 미미하여, 기존 방법들과 동등한 처리 속도 (Throughput) 를 달성했습니다.
5. 기여 및 의의 (Contributions & Significance)
구조적 원인 규명: 학습 없는 토큰 축소 실패의 원인이 특정 알고리즘이 아닌 쌍대 신호의 구조적 불안정성과 오류 증폭 메커니즘에 있음을 수학적으로 증명했습니다.
재사용 가능한 진단 도구:
ρs (Ranking Consistency): 붕괴가 발생할지 예측하는 지표.
ρoff (Off-diagonal Correlation): 구조적 손상 (Dimension Collapse) 이 발생했는지 진단하는 지표.
이 두 도구는 향후 개발될 모든 토큰 축소 방법의 사전 배포 건강 진단 (Pre-deployment health check) 으로 활용 가능합니다.
새로운 설계 패러다임: 단순한 점수 함수 최적화를 넘어, Unary 신호 사용, 상보적 신호 융합, Triage 기반 분류라는 3 가지 설계 원칙을 제시하여, 고압축 환경에서도 안정적인 ViT 추론을 가능하게 하는 구체적인 로드맵을 제시했습니다.
요약
이 논문은 "왜 학습 없는 토큰 축소는 고압축에서 실패하는가?"에 대한 명확한 답을 제시하며, 기존 방법들의 공통된 치명적 결함 (쌍대 신호의 불안정성) 을 지적하고, 이를 보완한 CATIS를 통해 고압축 환경에서도 원본 모델에 버금가는 성능을 유지하는 새로운 가능성을 열었습니다.