Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures
이 논문은 LLM 의 불투명한 내부 메커니즘을 해결하기 위해 모델 아키텍처와 연산에 직접 투명성을 구축하는 '내재적 해석 가능성'의 최신 연구 동향을 기능적 투명성, 개념 정렬, 표현 분해성, 명시적 모듈화, 잠재 희소성 유도라는 다섯 가지 설계 패러다임으로 체계적으로 검토하고 향후 연구 방향을 제시합니다.
원저자:Yutong Gao, Qinglin Meng, Yuan Zhou, Liangming Pan
이 논문은 **"거대 언어 모델 (LLM, 예: 챗GPT)"**이 어떻게 작동하는지 그 내부 구조를 투명하게 만들어, 우리가 그 이유를 이해할 수 있게 하는 방법을 소개합니다.
기존의 AI 는 마치 **"마법 상자"**처럼, 입력을 넣으면 답이 나오지만 그 내부에서 무슨 일이 일어났는지 알 수 없었습니다. 이 논문은 그 마법 상자를 **"유리 상자"**로 바꾸는 새로운 설계 원칙들을 정리했습니다.
이 내용을 일상적인 비유로 쉽게 설명해 드릴게요.
1. 문제: "마법 상자" vs "유리 상자"
기존 방식 (후속 설명, Post-hoc): AI 가 답을 낸 후에 외부에서 "아마 이 단어가 중요했겠지?"라고 추측하는 방식입니다.
비유: 요리사가 만든 요리를 보고 "아, 아마 소금 때문이겠네"라고 추측하는 것과 같습니다. 요리사 (AI) 는 그 추측이 맞는지 모르고, 요리 과정 자체는 여전히 비밀입니다.
이 논문의 제안 (본질적 해석 가능성, Intrinsic): 처음부터 AI 를 설계할 때, 그 내부가 투명하도록 만드는 방식입니다.
비유: 요리사가 요리를 할 때, "이 단계는 소금, 저 단계는 후추"라고 레시피를 그대로 보여주면서 요리하는 것입니다. 결과물뿐만 아니라 과정 자체가 투명합니다.
2. 5 가지 설계 원칙 (투명한 AI 를 만드는 5 가지 방법)
논문은 투명한 AI 를 만들기 위한 5 가지 핵심 아이디어를 소개합니다.
① 기능적 투명성 (Functional Transparency): "수학 공식처럼 명확한 계산"
비유: 일반적인 AI 는 복잡한 기계 장치처럼 모든 부품이 뒤섞여 돌아가지만, 이 방식은 레고 블록처럼 각 부품이 어떤 역할을 하는지 명확하게 분리합니다.
핵심: "어디서 (어떤 부품이)" "무엇을 (어떤 연산을)" 했는지 수학적으로 명확하게 보이게 설계합니다.
② 개념 정렬 (Concept Alignment): "사람이 이해하는 언어로 생각하기"
비유: AI 가 "빨간색, 둥글다, 사과" 같은 사람이 이해할 수 있는 개념으로만 생각하도록 훈련시킵니다.
핵심: AI 내부의 복잡한 숫자 덩어리 대신, "사과", "자동차"처럼 우리가 아는 단어로 생각을 정리하게 합니다.
③ 표현의 분해 가능성 (Representational Decomposability): "주머니 나누기"
비유: AI 의 기억 공간 (머리) 을 여러 개의 주머니로 나눕니다. "맛"은 한 주머니에, "색깔"은 다른 주머니에 넣어서 서로 섞이지 않게 합니다.
핵심: 서로 다른 정보 (색깔, 모양, 의미) 가 뒤섞이지 않고 깔끔하게 분리되어 저장되도록 합니다.
④ 명시적 모듈화 (Explicit Modularization): "전문가 팀 구성"
비유: 한 명의 만능 직원이 모든 일을 하는 대신, 전문가 팀을 꾸립니다.
"수학 질문"이 오면 수학 전문가가, "요리 질문"이 오면 요리 전문가가 답변합니다.
**루터 (Router)**라는 관리자가 어떤 질문을 어떤 전문가에게 보낼지 결정합니다.
핵심: 누가 어떤 일을 했는지 명확하게 추적할 수 있습니다.
⑤ 잠재적 희소성 유도 (Latent Sparsity Induction): "필요한 것만 쓰기"
비유: 평소에는 모든 전등을 켜고 있는 대신, 필요한 방의 전등만 켜는 방식입니다.
핵심: AI 가 모든 정보를 동시에 처리하지 않고, 특정 작업에 필요한 부분만 선택적으로 활성화하게 만들어 불필요한 복잡성을 줄입니다.
3. 앞으로의 과제: "투명함과 성능의 줄다리기"
이론적으로는 완벽해 보이지만, 현실에서는 몇 가지 어려움이 있습니다.
성능 vs 투명성: 너무 투명하게 만들면 (예: 모든 것을 분리하면) AI 가 복잡한 문제를 해결하는 능력이 떨어질 수 있습니다. 마치 "모든 단계를 설명하는 요리사"가 "순식간에 요리를 하는 요리사"보다 느릴 수 있는 것처럼요.
크기 문제: 작은 AI 는 투명하게 만들 수 있지만, 수조 개의 파라미터를 가진 거대 AI 를 투명하게 만드는 것은 여전히 어렵습니다.
평가 기준: "이 AI 가 정말 투명할까?"를 어떻게 숫자로 측정할지 아직 명확한 기준이 부족합니다.
4. 결론
이 논문은 **"AI 를 블랙박스 (마법 상자) 로 두는 것이 아니라, 처음부터 유리상자로 설계하자"**고 주장합니다.
미래에는 AI 가 "왜 이 답을 냈는지"를 단순히 추측하는 것이 아니라, **"내가 이렇게 생각해서 이 답을 냈다"**고 그 내부 과정을 투명하게 보여줄 수 있을 것입니다. 이는 의료, 법률 등 중요한 분야에서 AI 를 신뢰하고 안전하게 사용하는 데 필수적인 첫걸음입니다.
1. 문제 정의 (Problem)
대형 언어 모델 (LLM) 은 다양한 NLP 작업에서 뛰어난 성능을 보이지만, 그 내부 작동 원리가 불투명하여 '블랙박스 (Black Box)' 로 간주됩니다. 이러한 투명성 부재는 의료, 법률 등 고위험 분야에서 신뢰성과 안전성 문제를 야기합니다. 기존의 해석 가능성 연구는 대부분 사후 설명 (Post-hoc Explanation) 에 의존합니다. 이는 훈련된 고정된 모델을 외부 도구 (LIME, SHAP, SAE 등) 를 통해 분석하는 방식인데, 다음과 같은 한계가 있습니다:
정확성 격차 (Fidelity Gap): 설명이 모델의 실제 계산 과정과 일치하지 않을 수 있음.
국소적 한계: 인과적 개입을 통한 방법조차 전체 모델의 행동을 일관된 고수준 설명으로 통합하기 어려움.
외부 의존성: 모델 자체의 구조가 아닌 외부 대리 모델 (Surrogate) 에 의존함.
이에 따라, 모델의 아키텍처와 학습 과정 자체에 투명성을 내재화하는 본질적 해석 가능성 (Intrinsic Interpretability) 이 새로운 대안으로 부상했으나, 관련 연구가 파편화되어 있어 통합된 프레임워크가 부재한 상태였습니다.
2. 방법론 및 분류 체계 (Methodology & Taxonomy)
저자들은 본질적 해석 가능성을 달성하기 위한 5 가지 핵심 설계 원칙 (Design Principles) 을 기반으로 기존 접근법들을 체계적으로 분류하고 분석했습니다.
5 가지 설계 원칙
기능적 투명성 (Functional Transparency):
개념: 계산 과정이 구조적으로 명시적이고 수학적으로 의미 있는 방식으로 조직화됨.
방법: 일반화 가법 모델 (GAM), 신경 가법 모델 (NAM), 자기 설명 신경망 (SENN), B-cos 네트워크, 콜모고로프 - 아르논 네트워크 (KAN) 등.
특징: 각 특징의 기여도가 명확히 분리되어 계산 경로가 읽을 수 있는 알고리즘처럼 동작함.
개념 정렬 (Concept Alignment):
개념: 잠재 변수가 인간이 이해할 수 있는 개념과 직접적으로 대응하도록 설계.
방법: 개념 병목 모델 (CBM), 하이브리드 CBM, 개념 임베딩 모델 (CEM), 비지도 이산 병목 (Codebook Features).
특징: 예측이 사전 정의된 개념 집합에 기반하도록 구조를 제한하여 추론 과정을 개념 기반으로 만듦.
표현 분해 가능성 (Representational Decomposability):
개념: 잠재 공간의 기하학적 구조를 제어하여 서로 다른 의미 요인을 직교하는 부분 공간이나 병렬 스트림으로 분리.
방법: 백팩 언어 모델 (BLM, 단어의 다양한 의미를 벡터로 분리), CoCoMix (SAE 를 통합하여 개념 표현을 명시화).
특징: 중첩된 (Polysemantic) 표현을 방지하고 제어 가능한 생성을 가능하게 함.
명시적 모듈화 (Explicit Modularization):
개념: 단일 블록이 아닌 독립적으로 작동하는 모듈 (전문가) 로 계산을 분해하고, 라우팅 메커니즘을 통해 입력에 맞는 모듈을 명시적으로 선택.
방법: 전문가 혼합 (MoE) 아키텍처의 변형 (MoE-X, MONET, MxD 등).
특징: 라우팅 경로를 통해 계산 흐름을 추적 가능하게 하며, 전문가 간 기능적 분리를 강조.
잠재 희소성 유도 (Latent Sparsity Induction):
개념: 수동으로 모듈을 설계하는 대신, 희소성 유도 훈련 목표 (L0 정규화, 경쟁적 게이트 등) 를 통해 표준 아키텍처 내에서 모듈성과 해석 가능성의 발현을 유도.
방법: 가중치 희소성 훈련 (Weight Sparsity), 조건부 활성화 게이트 (GLU, SwiGLU).
특징: 밀집 네트워크의 중첩 현상을 줄이고 작업별 서브회로 (Subcircuits) 를 형성.
3. 주요 기여 (Key Contributions)
개념적 구분 명확화: 사후 설명 (Post-hoc) 과 본질적 해석 가능성 (Intrinsic) 의 차이를 '신뢰성 (Faithfulness)', '범위', '설계 철학' 측면에서 명확히 구분했습니다.
체계적인 분류 체계 제시: 본질적 해석 가능성 방법론을 5 가지 설계 원칙 (기능적 투명성, 개념 정렬, 표현 분해, 명시적 모듈화, 잠재 희소성) 으로 재구성하여 통합된 프레임워크를 제공했습니다.
연구 동향 및 과제 분석: 다양한 아키텍처와 학습 전략을 종합 분석하고, 현재 직면한 주요 도전 과제와 미래 연구 방향을 제시했습니다.
4. 결과 및 논의 (Results & Discussion)
성능과 해석 가능성의 상충 관계 극복: 과거에는 투명성을 위해 성능을 희생해야 했지만, 최근 연구 (MoE, 희소성 유도 등) 를 통해 대규모 모델에서도 경쟁력 있는 성능을 유지하면서 내부 구조를 해석 가능하게 만들 수 있음을 보였습니다.
진화 경로: 초기의 경직된 인간 정의 구조 (GAM 등) 에서부터 데이터 주도적이고 확장 가능한 희소 아키텍처 (Specialized MoE 등) 로 진화하고 있음을 확인했습니다.
한계점:
정량적 평가 부재: 해석 가능성의 품질을 측정하는 표준 지표가 부족함.
확장성 문제: 대규모 모델 (수십억~수조 파라미터) 로의 확장에서 라우팅 복잡도, 메모리 오버헤드, 최적화 불안정성이 발생함.
훈련 비용: 희소성이나 모듈화 제약으로 인해 훈련 효율성과 안정성이 저하될 수 있음.
5. 의의 및 미래 방향 (Significance & Future Directions)
신뢰할 수 있는 AI 의 기반 마련: 고위험 분야에서 LLM 의 의사결정 과정을 투명하게 만들어 신뢰와 안전성을 확보하는 데 기여합니다.
연구 방향 제안:
평가 프레임워크 개발: 신뢰성, 인간 이해도, 실용성을 균형 있게 평가하는 새로운 지표 필요.
스케일링 연구: 대규모 LLM 에서 본질적 해석 가능성을 유지하는 아키텍처 및 최적화 기법 연구.
하이브리드 접근: 본질적 설계와 사후 분석 도구의 상호 보완적 활용 (사후 도구를 검증 도구로 사용, 본질적 구조가 사후 분석의 정확도 향상).
자원 제공: 관련 논문 리스트를 GitHub 에서 지속적으로 업데이트하여 연구 커뮤니티에 기여합니다.
이 논문은 LLM 의 '블랙박스' 문제를 해결하기 위해 모델 설계 단계부터 해석 가능성을 내재화하려는 다양한 시도들을 체계적으로 정리함으로써, 투명하고 신뢰할 수 있는 차세대 AI 모델 개발을 위한 중요한 로드맵을 제시합니다.