← 최신 논문
💻 computer science

When Compression Scores Cannot Decide: Information Boundaries for Group-Robust LLM Pruning

본 논문은 표준 압축 점수가 해결되지 않은 정보 경계로 인해 그룹 강건성(group-robustness)을 위한 최적의 프루닝 후보를 식별하는 데 종종 실패한다고 주장하며, 대신 그룹별로 분해된 모멘트(group-resolved moments)와 검증된 선택 보장(selection guarantees)을 사용하는 프레임워크를 제안하여 대규모 언어 모델의 최악 그룹 퍼플렉서티(worst-group perplexity)를 유의미하게 감소시킨다.

원저자: Andrew Zhang

게시일 2026-08-05
📖 6 분 읽기🧠 심층 분석

원저자: Andrew Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 "대규모 언어 모델(Large Language Model)"이라는 이름의 거대하고 첨단 기술이 집약된 우주선의 선장이라고 상상해 보십시오. 이 배는 인간의 언어를 이해하고 생성하도록 설계되었지만, 너무 무겁고 복잡해서 실제 응용 프로그램이라는 좁은 협곡을 비행하기에는 너무 느립니다. 이 배를 날게 하려면 "가지치기(pruning)"를 수행해야 합니다. 즉, 배가 추락하지 않으면서도 더 가볍게 만들 수 있도록 엔진의 부품을 신중하게 제거해야 합니다.

까다로운 점은 이 배가 단 한 종류의 화물만 실을 수 있는 것이 아니라는 점입니다. "일반 여행자", "희귀 코드 전문가", "안전 검사관"과 같이 다양한 그룹의 승객들을 태우고 있습니다. 만약 당신이 "희귀 코드 전문가"들이 의존하는 엔진 부품을 잘라낸다면, 다른 모든 사람에게는 배가 잘 날아가는 것처럼 보일지 몰라도 전문가들은 낙오될 것입니다. 여기서 발생하는 핵심 질문은 이것입니다. 모든 가능한 절단(cut)을 테스트할 수 없는 상황에서, 어떻게 하면 모든 그룹의 승객을 안전하게 지키면서 어떤 부분을 잘라낼지 알 수 있을까요? 과학자들은 어떤 부분이 쓸모없는지 예측하려는 수학적 점수인 "압축 통계량(compression statistics)"을 사용합니다. 하지만 이 논문은 무서운 질문을 던집니다. 만약 그 점수가 특정 부품을 잘라도 안전하다고 말하지만, 실제로는 특정 그룹에게 배를 파괴하게 된다면 어떻게 될까요?

"압축 점수가 결정할 수 없을 때(When Compression Scores Cannot Decide)"라는 제목의 이 논문은 이러한 예측 점수의 숨겨진 한계를 조사합니다. 앤드류 장(Andrew Zhang)이 이끄는 저자들은 단 하나의 평균적인 점수를 보는 것은 마치 흐릿한 지도를 보는 것과 같다고 주장합니다. 지도는 전반적으로는 괜찮다는 것을 보여줄 수 있지만, 특정 구석에 불이 나고 있다는 사실은 숨길 수 있습니다. 그들은 이러한 점수들이 특정 그룹에 대한 최악의 상황을 예측하는 데 자주 실패한다는 것을 발견했습니다.

"평균" 점수의 문제점

압축 점수를 선생님이 학급을 채점하는 것에 비유해 보십시오. 선생님이 학급 평균만 본다면 모두가 잘하고 있다고 생각할 수도 있습니다. 하지만 만약 다른 학생들은 모두 시험을 잘 봤는데 단 한 명의 학생이 처참하게 낙제하고 있다면 어떨까요? 평균은 그 실패를 숨깁니다. AI의 세계에서 연구자들은 뉴런(AI 내부의 작은 처리 단위)을 제거하기 위해 "가지치기 점수"를 사용합니다. 이러한 점수들은 종종 모든 데이터에 걸친 AI의 "평균적인" 행동을 살펴봅니다.

저자는 이러한 접근 방식이 위험하다는 것을 발견했습니다. 그들은 매우 신뢰할 수 있는(두 번 테스트했을 때 동일한 답을 내놓는 '분할-절반 신뢰도'가 0.906인) 특정 가지치기 점수를 찾아냈습니다. 이 점수는 특정 절단이 AI의 성능을 16.1% 향상시킬 것이라고 예측했습니다. 그러나 실제로 절단을 수행했을 때 결과는 재앙적이었습니다: AI는 대조군보다 6.0%에서 7.7% 더 낮은 성능을 보였습니다. 점수는 평균에 대해서는 맞았지만, 특정 사용자 그룹의 경험을 망칠 것이라는 사실은 완전히 놓쳤습니다.

"정보 경계"와 숨겨진 간극

이를 설명하기 위해 저자는 "정보 경계(information boundary)"라는 개념을 사용합니다. 숨겨진 물체의 모양을 추측하기 위해 그 그림자를 보고 있다고 상상해 보십시오. 만약 그림자가 단순한 평균이라면, 당신은 물체가 완벽한 구형이라고 생각할 수 있습니다. 하지만 실제 물체는 날카로운 모서리가 튀어나온 정육면체일 수도 있습니다.

이 논문은 표준적인 가지치기 방법이 오직 "그림자"(통합된 평균)만을 본다고 주장합니다. 그들은 "날카로운 모서리"(개별 그룹에 대한 특정 피해)를 놓칩니다. 저자는 점수가 보는 것과 실제로 일어나는 일 사이의 간극을 "관측 섬유(observation fiber)"라고 부릅니다. 이는 안개 낀 창문과 같습니다. 일반적인 형태는 볼 수 있지만, 가장 중요한 세부 사항은 볼 수 없습니다.

그들은 수학적으로 만약 평균만을 본다면, 그룹의 수만큼 오차가 발생할 수 있음을 증명했습니다. 만약 4개의 그룹이 있다면, 최악의 피해는 평균이 시사하는 것보다 4배 더 클 수 있습니다. 이것은 그들이 도출한 "원뿔 법칙(conic law)"으로, AI 가지치기에 대한 물리 법칙처럼 작용합니다. 즉, 특별히 그룹을 따로 살펴보는 조치를 취하지 않는 한, 평균화는 항상 최악의 시나리오를 숨긴다는 것입니다.

해결책: 2단계 댄스

그렇다면 평균 점수가 거짓말을 한다면 우리는 무엇을 해야 할까요? 논문은 "제안(Propose)"과 "결정(Decide)"이라고 부르는 2단계 과정을 제안합니다.

1단계: 제안 (지역적 단서)
먼저, 지역적 단서를 사용하여 짧은 후보 목록을 만듭니다. 밀집된 AI 모델(크고 무거운 모델들)에서 그들은 "그룹별 대각선(group-resolved diagonal)" 방법을 사용했습니다. 이것은 단순히 전체 엔진을 보는 것이 아니라, 각 특정 그룹의 승객을 위해 엔진 부품을 개별적으로 확인하는 것과 같습니다. 이 방법은 일반적인 피해의 심각성을 포착하는 데 매우 뛰어났습니다(실제 최악의 피해와 0.9239의 상관관계를 보임). 이 방법은 "이 부품을 자르면 이 그룹의 승객들이 큰 곤경에 처할 것이다"라고 말해줄 수 있었습니다. 하지만 이 방법은 괜찮아 보이는 것들 중에서 정확히 어떤 절단이 최선인지는 알려주지 못했습니다. 즉, 위험을 찾는 데는 좋았지만, 승자를 뽑는 데는 서툴렀습니다.

2단계: 결정 (실제 테스트)
짧은 후보 목록(유한한 메뉴)을 확보했다면, 이제 추측을 멈추고 테스트를 시작해야 합니다. 저자는 단일 점수에 의존하여 이 후보들의 순위를 매길 수 없다는 것을 발견했습니다. 대신, 각 그룹에 대한 후보들의 실제 성능을 측정해야 합니다.

그들은 Llama, SmolLM3, Qwen의 세 가지 AI 모델을 통해 이를 테스트했습니다. 그들은 관심 있는 특정 그룹에 대해 후보들의 실제 성능을 측정하는 "타겟 매칭(target-matched)" 접근 방식을 사용하여 실제 개선을 확인했습니다.

  • Llama 모델의 경우, "최악의 그룹 퍼플렉시티 상승(worst-group perplexity inflation, AI가 얼마나 혼란스러워하는지를 나타내는 척도)"을 7.96% 줄였습니다.
  • Qwen의 경우, 이를 2.80% 줄였습니다.
  • SmolLM3의 경우, 이를 2.68% 줄였습니다.

이것은 단순한 추측이 아니라, 새로운 미지의 데이터에서도 유지되는 측정된 개선 수치였습니다.

MoE의 반전: 라우터의 비밀 지도

논문은 또한 "전문가 혼합(Mixture of Experts, MoE)"이라는 다른 유형의 AI도 살펴보았습니다. 이 모델들을 전문가 팀이라고 상상해 보십시오. 하나의 거대한 뇌 대신, 여러 명의 작은 전문가들이 있고 "라우터"가 각 질문에 대해 어떤 전문가를 사용할지 결정합니다.

이 설정에서 라우터는 어떤 전문가가 어떤 그룹에 사용되는지에 대한 "흔적" 또는 지도를 남깁니다. 저자는 이 지도가 매우 유용하다는 것을 발견했습니다. 이 지도는 단일 전문가를 제거하는 것을 무작위 추측보다 더 잘 예측할 수 있었습니다(표준 방법이 192번 중 81번 성공한 데 비해, 이 방법은 192번 중 114번 성공함).

하지만 큰 모델들과 마찬가지로, 이 지도도 완벽하지는 않았습니다. 지도는 어떤 단일 전문가가 제거하기에 가장 위험한지를 알려줄 수는 있었지만, 어떤 전문가들의 "조합"을 제거하는 것이 최선인지는 알려주지 못했습니다. 이를 해결하기 위해 그들은 전체 조합을 테스트해야 했습니다. 테스트 결과, 그들은 최악의 그룹들에 대해 AI 성능을 **13.7%**와 **7.2%**씩 개선하는 두 가지 특정 움직임을 찾아냈습니다.

핵심 요약

이 논문의 주요 교훈은 AI 그룹에 대한 생사 결정을 내릴 때 단 하나의 평균값에 의존해서는 안 된다는 것입니다. 만약 모두에게 공정하고 견고한 AI를 만들고 싶다면, 더 주의를 기울여야 합니다.

  1. 지역적 단서는 위험을 감지하는 데 좋습니다: 그룹별 점수를 사용하여 큰 위험을 찾아내십시오.
  2. 하지만 승자들을 반드시 테스트하십시오: 짧은 옵션 목록을 확보했다면, 당신이 관심을 두는 특정 그룹에 대해 그것들이 실제로 어떻게 작동하는지 직접 측정해야 합니다.
  3. "원 사이즈 피츠 올(One-Size-Fits-All)" 방식은 실패합니다: 한 모델이나 그룹에 작동하는 가지치기 전략이 다른 모델이나 그룹에서는 완전히 실패할 수 있습니다. 저자는 한 모델에서 작동했던 "미세 방향(fine directions, 특정 절단 패턴)"이 다른 모델에서는 작동하지 않는다는 것을 발견했습니다.

논문은 우리가 더 나은 지도와 후보 목록을 만들 수는 있지만, 최종 결정은 항상 직접적인 결과 측정(measurement)을 필요로 한다고 결론짓습니다. 단순히 계산만으로 안전에 도달할 수는 없습니다. 매 절단 후에 엔진을 직접 확인해야 합니다. 이렇게 함으로써 당신의 AI 우주선을 운항할 때, 어떤 그룹의 승객도 어둠 속에 홀로 남겨지지 않도록 보장할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →