← 최신 논문
🤖 machine learning

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

이 논문은 비대칭 양자화 인식 훈련(asymmetric quantization-aware training)과 잔차 활성화 보상(residual activation compensation)을 통해 활성화 오차를 해결함으로써 Mixture-of-Experts 모델을 위한 NVFP4 강화 학습을 안정화하는 양방향 양자화 오차 정렬 방법인 QUADS를 제안하며, 이를 통해 FP8 대비 대폭 향상된 처리량을 달성함과 동시에 BF16 수준의 정확도를 구현한다.

원저자: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

게시일 2026-07-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 로봇에게 수학 문제나 코드 작성과 같은 복잡한 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 로봇이 정말 잘하게 되기 위해서, 로봇은 단순히 정답을 암기하는 것이 아니라, 수천 가지의 서로 다른 해결책을 시도해 보고, 무엇이 효과적이었는지에 대한 피드백을 받은 다음, 다음에 더 잘할 수 있도록 자신의 뇌를 조정하며 연습합니다. 이 과정을 강화 학습(Reinforcement Learning)이라고 부릅니다. 하지만 여기에는 함정이 있습니다. 로봇이 '생각'하고 배우는 부분(훈련기)은 정답을 '생성'하는 부분(롤아웃 엔진)과 종종 분리되어 있습니다. 학습이 제대로 이루어지려면 이 두 부분이 정확히 같은 언어로 대화해야 합니다. 만약 훈련기는 고화질(4K 영화와 같은)로 생각하는데, 생성기는 저해상도의 픽셀이 깨진 버전(8비트 게임과 같은)으로 말하도록 강요받는다면, 로봇은 혼란에 빠집니다. 행동의 '중요도'가 흐릿함에 의해 왜곡되기 때문에 로봇은 실수를 하기 시작합니다. 이 불일치는 거대한 문제이며, 로봇이 똑똑해지는 속도를 늦추어 학습하는 데 엄청난 시간을 소요하게 만듭니다.

이제 우리가 로봇을 더 빠르게 생각하게 만들고 싶다고 상상해 봅시다. 우리는 로봇의 뇌를 훨씬 더 작게 줄여서, "NVFP4"라는 초저해상도 포맷을 사용할 수도 있습니다. 이것은 마치 현재의 표준보다 훨씬 더 빠른, 아주 거친 자갈들로 만들어진 비포장도로 위에서 초고속 레이스카를 운전하는 것과 같습니다. 이것은 믿기 힘들 정도로 빠를 것을 약속하지만, 자갈이 너무 거칠어서 자동차의 바퀴(로봇의 논리)가 미끄러지고 통제력을 잃기 시작합니다. 로봇은 학습하려고 노력하지만, 거친 트랙 때문에 단 몇 바퀴만 돌아도 사고가 납니다. 큰 질문은 이것입니다. 이 초고속의 거친 트랙을 로봇이 충돌하지 않고 작동하게 만들 수 있을까요?

이것이 바로 이 논문의 연구자들이 해결하고자 했던 문제입니다. 그들은 단순히 로봇을 이 거친 트랙 위에 올려놓는 것만으로는 훈련 약 150단계 이내에 처참하게 실패한다는 것을 발견했습니다. 로бо트의 자신감 점수(로그 확률)가 너무 심하게 어긋나면서 학습이 완전히 중단되는 것입니다. 그들은 주의 깊은 실험을 통해 왜 이런 일이 발생하는지 알아냈습니다. 문제는 로봇의 저장된 지식인 '가중치(weights)'가 아니라, 바로 '활성화 값(activations)'—즉, 로봇이 생각하는 동안 실시간으로 만들어내는 신선한 계산들—에 있었습니다. 트랙이 너무 거칠기 때문에(NVFP4), 이 신선한 계산들은 훈련기가 가중치만을 보고는 수정할 수 없는 방식으로 왜곡됩니다.

이를 해결하기 위해, 팀은 QUADS(양측 간 양자화 오차 정렬, QUantization-error Alignment across Dual Sides)라고 불리는 영리한 2단계 전략을 발명했습니다. 이것은 훈련기와 생성기 사이의 춤과 같습니다. 훈련기 측에서는 "비대칭 양자화 인식 훈련(Asymmetric Quantization-Aware Training)"이라는 특별한 기술을 사용합니다. 훈련기에게 생성기의 거친 언어를 억지로 배우게 하는 대신, 훈련기의 '생각'(활성화 값)은 고화질로 유지하되 '기억'(가중치)은 생성기의 거친 포맷에 맞추도록 강제합니다. 이렇게 하면 훈련기는 가중치를 볼 때 생성기가 무엇을 보고 있는지 정확히 알 수 있어 혼란을 방지할 수 있습니다.

하지만 그것만으로는 충분하지 않았습니다. 생성기는 여데도 새로운 생각을 계산할 때 거친 자갈 위에서 여전히 비틀거리고 있었습니다. 그래서 생성기 측에는 "잔차 활성화 보정(Residual Activation Compensation)"을 추가했습니다. 생성기가 거친 트랙 위를 걷다가, "어라, 이 특정 자갈 때문에 발이 미끄러지네!"라고 깨닫는 상황을 상상해 보세요. 경주를 멈추고 트랙 전체를 고치는 대신, 생성기는 전체 경주를 매우 빠르게 유지하면서도, 그 미끄러운 부분에 대해서만 아주 빠르고 짧은 교정 동작을 취합니다. 그들은 계산 중 가장 미끄러지기 쉬운 부분("고잔차 채널")을 식별해 냈고, 나머지 경주는 매우 빠르게 유지하면서도 그 부분에 작은 추가적인 힘을 주어 궤도를 유지하게 했습니다.

결과는 인상적입니다. 이 이중적인 춤을 사용함으로써, 로봇은 단순히 거친 트랙에서 살아남은 것을 넘어, 마치 매끄러운 고화질 트랙 위를 달리는 것과 거의 비슷한 성능을 보여주었습니다. 테스트 결과, 이 새로운 방법은 아무런 도움 없이 거친 트랙을 사용했을 때보다 성공률을 약 21.5포인트 향상시켰습니다. 더욱 놀라운 점은, 이 방법이 기존의 표준 방식보다 약 16% 더 빠르게 달리면서도 그 속도 이점을 그대로 유지했다는 것입니다. 이 논문은 거친 트랙이 그 자체로는 위험하지만, 적절한 정렬과 미끄러운 지점에 대한 약간의 추가적인 보정이 있다면, 우리가 이 초고속 저정밀도 AI 모델들을 마침내 안정적으로 작동시킬 수 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →