Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution
이 논문은 완만하게 압축된 거대 언어 모델이 모든 표준 데이터 프리 품질 및 충실도 가드레일을 통과하면서도 에이전트 실행 과정에서 절차적 단계를 환각하는 현상을 드러내며, 이는 오차의 크기가 아닌 압축 오류의 일관성에 의해 발생하는 특정 실패 모드로써 이를 탐지하기 위한 새로운 2축 스크리닝 지표를 필요로 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 복잡한 레시피 북을 아주 작은 주머니용 수첩에 담으려는 셰프라고 상상해 보세요. 당신은 이 책을 어디든 가지고 다닐 수 있을 만큼 작게 만들고 싶지만, 여전히 똑같이 맛있는 요리를 만들어낼 수 있어야 합니다. 인공지능의 세계에서 이러한 "축소"를 **압축(compression)**이라고 부릅니다. 코드를 작성하고, 이야기를 들려주고, 우리와 대화하는 거대한 AI 뇌인 대규모 언 언어 모델(LLM)은 매우 크기 때문에, 엔지니어들은 양자화(quantization)(내부 숫자를 단순화하는 것), 가지치기(pruning)(사용되지 않는 연결을 잘라내는 것), 그리고 저계수 인수분해(low-rank factorization)(더 단순한 수학적 골격을 찾는 것)와 같은 기술을 사용하여 모델을 더 작고 빠르게 만듭니다.
하지만 축소된 책이 여전히 제대로 작동하는지 어떻게 알 수 있을까요? 모든 요리를 직접 맛볼 수는 없습니다. 대신, 당신은 "품질 파수꾼(quality guards)"을 사용합니다. AI가 여전히 기본적인 문법을 이해하는지(퍼플렉시티, perplexity), 트로비아 질문에 올바르게 답할 수 있는지(MMLU와 같은 테스트), 그리고 무작위 질문을 던졌을 때 내부의 "생각"이 원래의 거대한 뇌와 여전히 유사하게 보이는지를 확인합니다. 이러한 검사들은 빠르며 새로운 데이터를 필요로 하지 않습니다. 큰 질문은 이것입니다: 이러한 파수꾼들이 AI를 실제 세상으로 보내 작업을 수행하게 하기에 안전하다는 것을 증명하기에 충분한가? 이 논문은 한 가지 무서운 가능성을 파고듭니다: 만약 AI가 모든 테스트를 통과했지만, 절차를 따르려고 할 때 스스로 규칙을 만들어내기 시작한다면 어떻게 될까요?
위대한 "발명" 강도 사건
이 논문의 저자들은 압축된 AI를 테스트하는 방식에 숨겨진 사각지대를 발견했습니다. 그들은 AI 모델이 모든 표준 안전 테스트를 통과하고 서류상으로는 완벽해 보일지라도, 에이전트(엄격한 지침을 따르는 디지털 작업자)로서 행동하도록 요청받았을 때, 지침에 없던 단계를 스스로 만들어내기 시작한다는 사실을 발견했습니다.
이것은 마치 수학 시험은 만점으로 통과했지만, 케이크를 만드는 레시피를 따르라고 하면 "멋져 보이니까 반짝이 가루를 한 꼬집 넣자"라고 결정하는 학생과 같습니다. 그 학생은 수학 시험에서 떨어진 것이 아닙니다. 단지 명령을 정확히 따르는 특정한 과업에서 실패한 것입니다.
연구진은 이를 세 가지 다른 AI 모델 제품군(Mistral, Qwen, Llama)에 대해 테스트했습니다. 그들은 SVD(저계수 인수분해의 일종)라는 방법으로 "부드럽게 압축된" 모델들을 가져왔습니다. 이 모델들은 너무 잘 압축되어 "퍼플렉시티 파수꾼"(혼란도가 원래 모델보다 1.069~1.17배 높음, 안전 한계치인 1.15 이내)과 "충실도 파수꾼"(내부의 생각이 원본과 일치함)을 모두 통과했습니다.
하지만 연구진이 이 모델들에게 서버를 수리하거나 주문을 처리하는 것과 같은 표준 작업 절차(SOP, 체크리스트)를 따르는 에이전트 역할을 맡겼을 때, 모델들은 **환각(confabulating)**을 일으키기 시작했습니다. 즉, 존재하지 않는 추가 단계를 만들어냈습니다.
- Mistral-7B 모델의 경우, 압축된 버전은 쿼리당 평균 +1.729개의 추가 단계를 만들어냈습니다.
- Qwen3-8B 모델의 경우, +0.208개의 추가 단계를 만들어냈습니다.
- Llama-3.1-8B 모델의 경우, "부드럽게 압축된" 버전은 노이즈 플로어(noise floor) 수준을 유지했습니다(단지 +0.056개의 단계만 생성). 이는 이 특정 빌드에 대해서는 테스트가 **진단 불가능(non-diagnostic)**했음을 의미합니다. 이 모델의 내부 스펙트럼에는 안전 파수꾼을 건드리지 않으면서 '발명 효과'를 유발할 만큼의 "저계수 헤드룸(low-rank headroom)"이 부족했습니다. 이 실패는 Llama 모델이 표준 안전 파수꾼을 벗어날 정도로 더 공격적으로 압축되었을 때에야 나타났습니다.
무서운 점은 무엇일까요? 이렇게 행동한 모델들은 "충실도(fidelity)" 테스트를 통과한 모델들이었다는 것입니다. 테스트는 "헤이, 네 뇌는 원본과 똑같아!"라고 말했지만, 현실은 "사실, 네 뇌는 이제 새로운 규칙을 환각하고 있어"였습니다.
범인: 손상이 아니라 일관성(Coherence)
왜 이런 일이 발생했을까요? 저자들은 이것이 모델이 얼마나 많이 손상되었는지(오차의 "크기")와 관련이 있는 것이 아님을 발견했습니다. 그들은 "SVD" 압축을 크기 가지치기(magnitude pruning)(가장 작은 숫자들을 잘라내는 것)와 비교했습니다.
두 방법이 정확히 동일한 양의 혼란(퍼플렉시티)을 일으키도록 맞추었을 때, 결과는 판이하게 달랐습니다:
- SVD 모델(매끄럽고 구조적인 왜곡, 즉 "일관된" 오류를 생성하는 방식)은 테스트에 실패하여 단계를 만들어냈습니다.
- 가지치기(Pruning) 모델(무작위 정전기처럼 "지저도하고" 비일관적인 오류를 생성하는 방식)은 테스트를 통과했으며, 거의 아무것도 만들어내지 않았습니다(약 -0.146단계, 이는 사실상 0입니다).
저자들은 문제가 실수의 크기가 아니라, 그 모양에 있다는 것을 깨달았습니다. 그들은 이를 "일관성 × 비율(Coherence × Rate)" 메커니즘이라고 부릅니다.
- 일관성(Coherence): 오류가 구조적이고 매끄러움 (예: 저계수 SVD).
- 비율(Rate): 모델의 어느 정도가 영향을 받는가.
만약 매끄럽고 구조적인 오류가 표준 테스트의 레이더망을 피할 만큼 적절히 존재한다면, AI는 존재하지 않는 지름길을 안다고 착각하여 새로운 절차 단계를 만들어내기 시작합니다. "손상(퍼플렉시티)"은 이를 예측하지 못했습니다. "왜곡의 형태(smoothness)"가 이를 예측했습니다.
"카나리(Canary)"와 새로운 탐지기
이를 증명하기 위해 연구진은 **"카나리(canary)"**라고 부르는 특별한 테스트를 만들었습니다. 이것은 탄광의 카나리아와 같습니다. 그들은 AI에게 10개의 단계와 조건부 11번째 단계가 포함된 가짜 SOP를 주고, 단계를 나열하라고 요청했습니다. 만약 AI가 지침에 없는 단계를 나열하면 실패하는 방식입니다.
그들은 동일한 AI 가중치가 표준 "충실도 테스트"(원본과 닮았음을 증명)에서는 승리했지만, "카나리 테스트"(단계를 만들어내지 않음을 증명)에서는 패배한다는 것을 발견했습니다. 이것은 "해리(dissociation)" 현상입니다: 표준 테스트들은 이 특정 유형의 실패를 감지하지 못합니다.
하지만 저자들은 문제를 발견하는 데서 그치지 않고, 배포 전에 이를 잡아낼 수 있는 데이터 프리(data-free) 탐지기를 구축했습니다. 그들은 새로운 데이터 없이도 두 가지를 측정할 수 있다는 것을 깨달았습니다:
- 일관된 비율(Coherent Fraction): 오류 중 얼마나 많은 부분이 "매끄럽고" 구조적인가?
- 오류율(Error Rate): 전체적인 오류의 크기는 얼마인가?
그들은 간단한 "게이트(gate)"(합격/불합격 체크)를 만들었습니다:
- 만약 일관된 비율 > 0.007 이고 오류율 > 0.01 이라면, 모델은 실패(FAIL).
- 두 조건을 모두 충족하지 않으면, 합격(PASS).
이 게이트는 테스트에 실패한 모든 모델을 정확하게 식별해 냈습니다. 예를 들어, 단계를 만들어낸 Mistral 모델은 일관된 비율이 0.0080이었고 오류율이 0.0159였으며, 이로 인해 경보가 울렸습니다. 안전했던 가지치기 모델은 일관된 비율이 0.0054였기에 "일관성" 체크를 피해 레이더망 아래로 미끄러져 들어가 합격했습니다.
시사점
이 논문은 퍼플렉시티, MMLU, 그리고 데이터 프리 충실도 체크만으로는 AI가 에이전트 업무를 수행하기에 안전하다고 인증하기에 충분하지 않다고 결론짓습니다. AI가 표준 "학교 시험"을 통과했다고 해서, 실제 업무 현장에서 규칙을 만들어내지 않을 것이라고 믿어서는 안 됩니다.
저자들은 압축된 AI를 에이전트(업무 수행, 절차 준수)로 배포하기 전에, 반드시 이 새로운 "일관성 스크린(coherence screen)"을 실행해야 한다고 제안합니다. 만약 모델이 저계수 방식(SVD)을 통해 "부드럽게 압축"되었고 이 새로운 게이트를 통과하지 못한다면, 그 모델은 다른 모든 테스트에서 완벽해 보일지라도 지침을 따르는 데 실패하며 단계를 새로 만들어낼 가능성이 높습니다.
요약하자면: AI가 테스트를 통과했다고 해서 그냥 믿지 마세요. 그것이 "매끄럽게" 고장 난 상태인지 확인하십시오. 그래야만 AI가 스스로 규칙을 만들어내기 시작하는 것을 막을 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.