Tethered Reasoning: Decoupling Entropy from Hallucination in Quantized LLMs via Manifold Steering
이 논문은 양자화된 언어 모델에서 고온도 샘플링 시 발생하는 할루시네이션을 사전 계산된 진실성 매니폴드에 히든 상태 궤적을 고정하는 기하학적 프레임워크인 HELIX 를 통해 해결하여, 높은 엔트로피를 유지하면서도 논리적 일관성을 확보하고 창의적 다양성을 극대화하는 방법을 제시합니다.
일반적으로 AI(대형 언어 모델) 를 사용할 때, 우리는 **'온도 (Temperature)'**라는 설정을 조절합니다.
낮은 온도 (차가운 상태): AI 는 매우 신중하고 똑똑하지만, 똑같은 말만 반복하거나 창의성이 떨어집니다. (마치 꽁꽁 얼어붙은 물처럼 딱딱함)
높은 온도 (뜨거운 상태): AI 는 매우 창의적이고 다양한 말을 하지만, 엉뚱한 거짓말 (할루시네이션) 을 하거나 말이 통하지 않게 됩니다. (마치 끓는 물처럼 기포가 터져서 흩어짐)
기존의 문제점은 **"창의성을 높이려면 거짓말을 감수해야 한다"**는 것이었습니다. 하지만 이 논문은 **"아니, 그건 틀린 생각이다"**라고 말합니다.
1. 문제의 본질: "길 잃은 여행객"
논문은 AI 가 높은 온도에서 엉뚱한 말을 할 때, 그 이유가 AI 가 지식을 잃어서가 아니라 **"정해진 길 (진실의 지도) 에서 벗어났기 때문"**이라고 설명합니다.
비유: AI 를 한 명의 여행객이라고 상상해 보세요. 높은 온도는 여행객에게 "자유롭게 돌아다니라"는 명령입니다. 그런데 여행객이 너무 멀리 나가서 지도에서 벗어나면, 엉뚱한 곳 (거짓말) 에 도착하게 됩니다.
기존 방식: 여행객이 너무 멀리 가지 못하게 아예 발목을 묶어버리는 것 (온도를 낮춤). → 창의성이 사라짐.
이 논문의 방식 (Helix): 여행객이 자유롭게 돌아다니게 하되, "진실의 지도"와 연결된 아주 튼튼한 고무줄을 묶어주는 것입니다.
2. Helix 의 작동 원리: "스마트한 고무줄"
이 논문에서 개발한 '헬릭스 (Helix)' 시스템은 다음과 같이 작동합니다.
진실의 지도 (Manifold): AI 가 훈련받으며 배운 '올바른 논리와 사실'이 모여 있는 가상의 지도를 미리 만들어둡니다.
실시간 감시 (UTS): AI 가 말을 하나씩 뱉을 때마다, "이 말이 지도에서 너무 멀어지고 있나?"를 실시간으로 계산합니다.
미세한 교정 (Steering): 만약 여행객이 지도에서 너무 멀어질 것 같으면, 가장 중요한 말 (토큰) 중 0.2%~2.5% 만 아주 살짝 잡아당겨 다시 지도 쪽으로 돌려보냅니다.
결과: 여행객은 여전히 자유롭게 돌아다닐 수 있지만 (창의성 유지), 절대 지도 밖으로 나가지 못합니다 (거짓말 방지).
3. 놀라운 발견: "고온의 창의성 보물창고"
이 기술로 인해 가장 흥미로운 사실이 발견되었습니다.
기존의 오해: "온도를 높이면 AI 가 망가진다"고 생각했습니다.
실제 발견: "온도를 높이면 새로운 아이디어의 보물창고가 열린다"는 것입니다.
낮은 온도에서는 같은 이야기만 70~80% 반복합니다.
하지만 헬릭스 기술로 지도에 묶인 채 높은 온도를 사용하면, 아이디어의 중복이 5~20% 로 줄어듭니다.
비유: 마치 같은 공원에서도, 낮에는 사람들이 같은 벤치에 앉지만, 밤에는 (높은 온도) 사람들이 공원 구석구석 숨겨진 보물 (새로운 아이디어) 을 찾아다니는 것과 같습니다.
4. 양자화 (Quantization) 와의 만남: "작은 차도 고속도로를 달린다"
이 논문은 AI 모델을 압축해서 (4 비트 양자화) 작은 컴퓨터에서도 빠르게 돌릴 때 생기는 문제도 해결했습니다.
보통 압축하면 AI 지능이 떨어집니다.
하지만 헬릭스 기술을 적용하면, 압축된 작은 AI 가 원래의 큰 AI 보다 더 똑똑하게 수학 문제를 풀기도 했습니다.
비유: 소형 경차 (압축된 AI) 에 튜닝된 서스펜션 (헬릭스) 을 달면, 대형 SUV 보다 더 부드럽고 정확하게 달릴 수 있다는 뜻입니다.
📝 한 줄 요약
"AI 에게 '진실의 지도'만 연결해 주고, 나머지 모든 자유는 줘버려라. 그러면 AI 는 거짓말도 안 하고, 상상력이 무한히 펼쳐지는 창의적인 보물찾기를 할 수 있다."
이 기술은 AI 를 단순히 '정답을 맞추는 기계'가 아니라, **'안전하면서도 상상력이 풍부한 창의적인 파트너'**로 바꿔주는 혁신적인 방법입니다.
1. 연구 배경 및 문제 정의 (Problem Statement)
양자화 모델의 딜레마: 정량화 (Quantization, 예: 4-bit) 된 대규모 언어 모델 (LLM) 은 추론 시 두 가지 극단적인 문제에 직면합니다.
낮은 온도 (Low Temperature): 반복적이고 모드 붕괴 (Mode Collapse) 된 출력을 생성합니다.
높은 온도 (High Temperature, T>2.0): 기존 관념에서는 이를 '할루시네이션 (Hallucination)'으로 간주하여 의미론적 불일치와 사실 오류를 유발한다고 보았습니다.
현재의 한계: 대부분의 추론 프레임워크는 T=2.0을 상한선으로 설정하여 고온 영역의 탐색을 제한합니다. 또한, 양자화로 인해 모델이 더 일찍 붕괴하는 현상이 발생합니다.
핵심 가설: 저자는 고온에서의 '할루시네이션'이 지식의 손실 (Semantic Collapse) 이 아니라, **잠재 공간 (Representation Space) 내의 구조적으로 일관된 영역 (Manifold) 에서의 궤적 이탈 (Trajectory Divergence)**임을 주장합니다. 즉, 모델이 '진실성'을 가진 기하학적 영역을 벗어날 때 오류가 발생한다는 것입니다.
2. 제안 방법론: Helix 프레임워크
이 논문은 Helix라는 기하학적 프레임워크를 제안하여 출력 엔트로피와 할루시네이션을 분리합니다.
2.1. 통일된 진실 점수 (Unified Truth Score, UTS)
각 토큰 생성 단계에서 실시간으로 불확실성을 측정하는 지표입니다.
의미론적 엔트로피 (SE): 토큰 확률 분포의 불확실성을 측정합니다.
매니폴드 거리 (SD): 사전에 계산된 '진실성 매니폴드 (Truthfulness Manifold)'로부터의 마할라노비스 거리 (Mahalanobis Distance) 를 측정합니다.
적응형 가중치: 온도 (T) 에 따라 두 지표의 가중치를 동적으로 조정합니다.
낮은 온도: 엔트로피가 주된 지표 (정밀도 중시).
높은 온도: 매니폴드 거리가 주된 지표 (안정성 중시). 엔트로피가 포화 상태가 되어도 매니폴드 거리는 여전히 유효한 신호를 제공합니다.
2.2. 기하학적 매니폴드 스티어링 (Geometric Manifold Steering)
진실성 매니폴드 구축: TruthfulQA, WikiText, GSM8K 등의 데이터로 생성된 정답 응답들의 히든 상태 (Hidden States) 를 수집하여 평균과 공분산을 기반으로 저차원 서브매니폴드를 구성합니다.
점진적 개입 (Graduated Steering): UTS 가 임계값 이하로 떨어질 때 (궤적 이탈 신호), 활성화 (Activation) 를 구조적으로 일관된 영역으로 되돌리는 스티어링 벡터를 적용합니다.
효율성: 전체 토큰의 **0.2% ~ 2.5%**에만 개입이 발생하며, 나머지 97% 이상은 모델의 자연스러운 분포를 따릅니다. 이는 단일 프론트 패스 (Single Forward Pass) 에서 이루어져 오버헤드가 거의 없습니다.
2.3. 하이브리드 아키텍처 대응 전략
Granite 4.0 과 같은 Mamba-2(State-Space) 와 Transformer 의 하이브리드 아키텍처에서, 전체 레이어를 스티어링하는 대신 **희소 Transformer 어텐션 레이어 (약 10%)**를 타겟팅합니다.
이 레이어들이 '글로벌 통합' 체크포인트 역할을 하여, 스테이트 스페이스 (SSM) 모델의 드리프트를 효과적으로 보정합니다.
3. 주요 실험 결과 (Key Results)
실험은 4-bit 양자화된 Granite 4.0 H Small (32B/9B active) 모델을 기반으로 수행되었으며, Qwen3-30B-A3B MoE를 통해 아키텍처 독립성을 검증했습니다.
3.1. 온도에 강건한 추론 (Temperature-Robust Reasoning)
GSM8K (수학 추론):T=0.5에서 91.65%, T=3.0에서 **88.84%**의 정확도를 유지했습니다. (T=0.5→3.0으로 6 배 온도 증가 시 정확도 감소는 단 2.81%p).
양자화 회복:T=1.0에서 Helix 를 적용한 4-bit 모델은 풀-프레시전 (Full-precision) 베이스라인 (87.27%) 을 **91.80%**으로 능가했습니다.
MMLU (지식 추론): 14,042 개의 질문에서 T=3.0까지 **72.49%**의 정확도를 유지하며 가장 높은 온도 안정성을 보였습니다 (감소 1.24%p).
HumanEval (코드 생성):T=3.0까지 76.83% 를 유지하며 안정적인 성능을 입증했습니다.