← 최신 논문
🤖 AI

FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling

이 논문은 학습 가능한 양자화 스케일을 하드웨어 제약으로부터 분리하기 위해 결합 완화 스케일링(Coupled-Relaxation Scaling)을 채택하고, 더 미세한 가중치 적응을 위해 이중 입도 스케일링(Dual-Granularity Scaling)을 사용하여 추가적인 추론 오버헤드 없이 최첨단 성능을 달達成하는, 대규모 언어 모델의 FP4 정확도를 향상시키는 사후 학습 양자화 프레임워크인 FOCUS를 소개한다.

원저자: Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xianglong Yan, Hong Liu, Chengzhu Bao, Tianao Zhang, Guanghua Yu, Jianchen Zhu, Yulun Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 지식의 도서관을 아주 작고 휴대 가능한 배낭에 담으려 한다고 상상해 보세요. 이것이 바로 이야기를 쓰고, 수학 문제를 풀고, 인간처럼 대화할 수 있는 초지능형 컴퓨터 뇌인 '대규모 언어 모델(LLM)'이 매일 겪는 고군분투입니다. 문제는 이 뇌들이 너무 거대해서 엄청난 양의 메모리와 전력을 필요로 하며, 이로 인해 일상적인 기기에서 사용하기에는 비용이 많이 들고 속도가 느리다는 점입니다. 이를 해결하기 위해 과학자들은 '양자화(quantization)'라는 기술을 사용합니다. 이것은 마치 고화질 4K 영화를 오래된 스마트폰에 맞게 저해상도 형식으로 변환하는 것과 같습니다. 목표는 정보의 핵심(plot)을 잃지 않으면서 데이터를 축소하는 것입니다. 최근에는 현대적인 컴퓨터 칩에서 지원되는 'FP4'라는 새로운 초소형 형식이 등장하여 모델을 훨씬 더 작게 줄일 수 있음을 약속했습니다. 하지만 함정이 있습니다. 데이터를 이렇게 작게 압축하면 모델이 무언가를 '망각'하거나 혼란을 느껴 정확도가 떨어질 수 있다는 점입니다. 큰 질문은 이것입니다: 어떻게 하면 지능을 망가뜨리지 않고 모델을 이 작은 크기로 줄일 수 있을까요?

이 논문은 바로 그 문제를 해결하기 위한 영리하고 새로운 방법인 FOCUS를 소개합니다. 연구진은 기존의 모델 축소 방식이 너무 경직되어 있다는 사실을 깨달았습니다. 옷을 짐 가방에 싸는 상황을 상상해 보세요. 기존의 규칙은 다음과 같습니다: "당신은 반드시 똑같이 생긴 작은 미리 제작된 상자들을 사용하여 옷을 싸야 하며, 나중에 짐을 풀 때도 반드시 동일한 상자들을 사용해야 합니다." 논문은 이것이 어리석다고 주장합니다. 옷을 보관할 때는 작은 상자를 사용해야 하겠지만(그것이 배낭에 들어가는 방식이니까요), 처음에 옷을 어떻게 접을지 결정할 때까지 똑같은 작은 상자를 사용할 필요는 없다는 것입니다. 당신은 먼저 커다란 유연한 줄자를 사용하여 짐 싸는 계획을 세운 다음, 그 결과를 작은 상자에 딱 맞춰 넣을 수 있습니다.

FOCUS는 이러한 통찰력을 활용하여 FP4라는 아주 작은 형식에 맞춰 모델을 준비하는 과정을 개선합니다. 이 방식은 두 가지 주요 기술을 도입합니다:

  1. 결합 완화 스케일링 (Coupled-Relaxation Scaling, CRS): 이것은 '유연한 줄자'입니다. 기존 방식에서는 컴퓨터가 숫자를 줄이기로 결정할 때 매우 거친 저정밀도 자를 사용해야 했고, 다시 합칠 때도 그 거친 자를 사용해야 했습니다. FOCUS는 이렇게 말합니다. "숫자를 줄이는 계산을 할 때는 아주 정밀한 전체 크기의 자를 사용하고, 그 다음에 그 결과를 거친 상자에 꾹 눌러 담자." 이를 통해 컴퓨터는 작은 형식의 규칙을 어기지 않으면서도 데이터를 훨씬 더 잘 압축하는 방법을 찾을 수 있습니다.

  2. 이중 입도 스케일링 (Dual-Granularity Scaling, DGS): 이것은 더 작은 항목들을 채우는 것에 관한 것입니다. 기존 방식은 32개의 숫자 묶음을 하나의 큰 덩어리로 취급하여 모든 숫자에 하나의 자를 적용했습니다. 하지만 만약 그 그룹 안에 아주 큰 숫자와 아주 작은 숫자가 섞여 있다면 어떨까요? FOCUS는 이 큰 그룹을 더 작은 하위 그룹으로 나누고(마치 큰 피자를 조각내는 것처럼), 각 조각마다 고유한 맞춤형 자를 부여합니다. 이를 통해 컴퓨터는 모든 것을 하나의 규격화된 상자에 강제로 맞추는 대신, 데이터의 세부 사항에 적응할 수 있습니다.

결과는 인상적입니다. 연구진이 Qwen이나 LLaMA와 같은 여러 다양한 AI 모델에 대해 FOCUS를 테스트했을 때, 이 방식은 다른 모든 방법보다 일관되게 뛰어난 성능을 보였습니다. 예를 들어, Qwen3-4B 모델의 경우, FOCUS는 NVFP4 형식을 사용할 때 원래 모델 정확도의 **98.2%**를 회복했고, MXFP4로는 **96.2%**를 회복했습니다. 이는 기존 기술들이 종종 90%나 94%를 유지하는 데 어려움을 겪었던 것과 비교하면 상당한 도약입니다.

결정적으로, 논문은 FOCUS가 모델을 더 느리게 만들거나 사용하기 어렵게 만들지 않는다는 점을 보여줍니다. 컴퓨터가 모델을 준비하는 과정(학습 또는 보정 단계)에서 추가적인 계산을 수행함에도 불구하고, 최종 모델은 다른 모든 FP4 모델만큼 빠르게 실행됩니다. Qwen3-4B 모델을 준비하는 데 단일 고성능 GPU 한 대를 사용하여 약 19분이 소는데, 이는 경쟁하는 일부 방법들보다 오히려 더 빠릅니다. 연구진은 이것이 '사후 학습(post-training)' 방식임을 강조합니다. 즉, 모델을 처음부터 다시 가르칠 필요 없이, 단지 짐을 싸는 지침(packing instructions)만 미세하게 조정하면 된다는 뜻입니다.

요약하자면, FOCUS는 축소하는 '방법'에 대한 규칙을 완화함으로써(최종 저장 형식은 엄격하게 유지하면서), 거대한 AI의 두뇌를 지능을 잃지 않고도 아주 작은 공간에 담을 수 있다는 것을 시사합니다. 이것은 마치 셔츠를 완벽하게 접기 위해 큰 테이블을 사용할 수 있지만, 결국 보관은 작은 서랍에 해야 한다는 사실을 깨닫는 것과 같습니다. 이 논문은 이러한 접근 방식이 기존의 경직된 방식보다 더 효과적임을 증명하며, 현재는 감당할 수 없는 기기에서도 강력한 AI를 실행할 수 있는 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →