← 최신 논문
💬 NLP

Efficient INT8 Inference of Small NLP Models on Server CPUs with PyTorch Native Stack

이 논문은 그래프 수준의 퓨전과 최적화된 커널 선택을 통해 정확도 손실을 거의 없이 서버 CPU 상의 소규모 NLP 모델을 위한 INT8 추론용 SmoothQuant의 네이티브 PyTorch 구현을 제시하며, 이를 통해 최대 5.8배의 처리량 향상을 달면, 해당 솔루션은 현재 PyTorch와 TorchAO에 업스트림되었습니다.

원저자: Weiwen Xia, Yuxin Cui, E Cao

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Weiwen Xia, Yuxin Cui, E Cao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서는 거대하고 모든 것을 아는 듯한 챗봇에 관한 요란한 헤드라인 옆에서 조용한 혁명이 일어나고 있습니다. 대중의 시선이 시를 쓰거나 복잡한 논리 퍼즐을 풀 수 있는 거대한 모델에 고정되어 있는 동안, 검색 결과, 제품 추천, 스팸 필터와 같이 인터넷의 일상적인 트래픽을 처리하는 엔진은 더 작고 전문화된 프로그램들에 의존합니다. 이 프로그램들은 흔로 BERT라고 알려진 설계 방식의 계열을 기반으로 하는 경우가 많으며, 디지털 경제의 일꾼 역할을 합니다. 이들은 특수하고 비싼 그래픽 카드가 아니라, 전 세계 데이터 센터에서 볼 수 있는 표준 컴퓨터 서버에서 구동됩니다. 이러한 시스템에는 가공할 만한 크기보다 속도와 비용이 더 중요합니다. 엔지니어들의 과제는 오랫동안 이 모델들이 유용성을 유지할 수 있는 정확도를 희생하지 않으면서 어떻게 더 빠르게 실행되도록 만드느냐는 것이었습니다. 이를 위한 강력한 방법 중 하나는 컴퓨터가 수행하는 수학 연산을 단순화하여, 아주 미세한 정밀도를 대가로 막대한 속도 향상을 얻는 것인데, 이를 양자화(quantization)라고 합니다.

인텔 코퍼레이션(Intel Corporation)의 연구진은 이제 이러한 작은 언어 모델들이 오늘날 개발자들이 사용하는 가장 대중적인 소프트웨어 도구 내에서 직접 이 단순화된 수학 연산을 사용하여 실행될 수 있도록 하는 가교를 구축했습니다. 그들의 작업은 SmoothQuant라고 불리는 특정 방법에 초점을 맞추고 있으며, 이는 모델이 언어를 이해하는 능력을 잃지 않으면서 단순화된 수학 연산을 처리할 수 있도록 준비시키는 과정입니다. 이 방법을 표준 PyTorch 소프트웨어 스택에 통합함으로써, 그들은 특별한 제3자 도구나 복잡한 재작성이 필요 없는 경로를 만들어냈습니다. 그 결과, 표준 언어 모델을 가져와 현대적인 서버 프로세서에서 훨씬 더 빠르게 실행하면서도, 그 모델이 내놓는 답변의 정확도는 이전과 동일하게 유지할 수 있는 시스템을 구축했습니다.

연구진은 흔한 문제에서부터 시작했습니다. 현대의 컴퓨터 프로세서에는 단순화된 수학 연산을 빠르게 처리할 수 있는 내장 명령어가 있음에도 불구하고, 모델을 구축하는 데 사용되는 소프트웨어 도구들이 이를 효율적으로 사용하는 방법을 모르는 경우가 많았습니다. 모델을 속도에 맞춰 준비할 때, 소프트웨어는 데이터를 변환하거나 단순화된 계산을 관리하는 단계에서 종종 막히게 되어, 하드웨어가 약속했던 바로 그 속도를 낭비하곤 했습니다. 이를 해결하기 위해 연구팀은 세 가지 서로 다른 기술적 요소를 하나의 매끄러운 워크플로우로 결합했습니다. 첫째, 그들은 모델을 준비하기 위해 TorchAO라는 도구를 사용하여 데이터를 매끄럽게 다듬음으로써(smoothing), 데이터가 안전하게 단순화될 수 있도록 했습니다. 다음으로, 그들은 TorchInductor라는 컴파일러를 사용하여 모델의 전체 계산 흐름을 살펴보고 이를 하나로 병합하여, 속도를 늦추는 데 흔히 쓰이는 불필요한 단계들을 제거했습니다. 마지막으로, 컴퓨터 프로세서가 고급 기능을 갖춘 최신 모델인지, 아니면 여전히 널리 쓰이는 신뢰할 수 있는 구형 모델인지에 따라 가장 빠른 핵심 수학 연산 방식을 선택하도록 시스템을 학습시켰습니다.

그들은 자신들의 창조물을 테스트하기 위해 두 세대의 인텔 서버 프로세서에서 실험을 진행했습니다. 연구팀은 크고 복잡한 버전부터 작고 압축된 버전까지 세 가지 유형의 언어 모델을 대상으로 시스템을 테스트했습니다. 결과는 놀라웠습니다. 최신 프로세서에서 이 시스템은 최적화되지 않은 표준 버전보다 최대 5.8배 더 빠르게 작동했습니다. 구형 프로세서에서도 거의 3배 가까이 빠르게 실행되었습니다. 아마도 가장 중요한 점은, 이 속도가 품질의 저하를 동반하지 않았다는 것입니다. 연구진이 텍스트로부터 질문에 답하거나 문장의 감정을 판단하는 것과 같은 실제 작업에 모델을 테스트했을 때, 단순화된 모델들은 원래의 느린 버전만큼이나 정답을 정확하게 맞혔습니다. 많은 경우, 정확도의 차이는 너무 미미하여 측정조차 불가능할 정도였습니다.

연구팀은 또한 컴퓨터가 데이터를 이동하는 속도와 계산하는 속도의 한계를 매핑하는 방법을 사용하여, 왜 이러한 속도 향상이 일어났는지 면밀히 조사했습니다. 그들은 최신 프로세서의 경우 속도가 데이터 이동 속도에 의해 제한되는 반면, 구형 프로세서의 경우 수학 연산 속도에 의해 제한된다는 것을 발견했습니다. 그들의 시스템은 두 가지 제한 사항을 모두 효과적으로 헤쳐 나갔습니다. 연구진은 데이터를 미리 준비하고, 컴퓨터가 작업 중에 멈춰서 정보를 재구성할 필요가 없도록 함으로써 하드웨어의 잠재력을 완전히 끌어낼 수 있다는 것을 발견했습니다. 심지어 단순화된 수학 연산을 위한 특정 명령어가 없는 구형 프로세서를 위해, 다른 사용 가능한 명령어를 사용하여 유사한 결과를 얻을 수 있는 영리한 우회책을 찾아내기도 했습니다.

이 연구가 중요한 이유는 기업들이 이러한 모델들을 효율적으로 배포하고자 할 때 마주하는 상당한 장벽을 제거해주기 때문입니다. 이전에는 이 정도 수준의 성능을 얻기 위해 유지 관리가 어렵거나 표준 소프트웨어 환경을 떠나야 하는 특수 도구를 사용해야만 했습니다. 이제 개발자들은 이미 알고 있는 도구들을 그대로 사용하여 동일한 고성능을 얻을 수 있습니다. 연구진은 코드를 광범위한 커뮤니티에 공유했으므로, 이 표준 도구들을 사용하는 사람이라면 누구나 즉시 이 속도 향상의 혜택을 누릴 수 있습니다. 이 연구는 모델의 근본적인 성격이나 실행되는 소프트웨어를 변경하지 않고도 인터넷의 일꾼들을 더 빠르고 효율적으로 만드는 것이 가능하다는 것을 입증합니다. 컴퓨터가 수학 연산을 처리하는 방식을 정교하게 최적화함으로써, 연구팀은 표준 서버에서 효율적인 인공지능의 미래가 단지 가능성에 그치는 것이 아니라, 오늘 바로 사용할 수 있는 현실임을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →