← 최신 논문
🤖 AI

Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets

본 논문은 단일 장치의 메모리 제한을 초과하는 대규모 LLM(최대 70B 파라미터)의 대화형 속도 실행을 가능하게 하기 위해, 여러 대의 유휴 Intel AI PC에 걸쳐 사전 컴파일된 OpenVINO 파이프라인 샤드를 활용하는 분산 추론 시스템을 제시하며, 최적화된 그래프 퓨전, 투기적 디코딩 및 요청 인터리빙을 통해 높은 처리량을 달성한다.

원저자: Tate Berenbaum, Muthaiah Venkatachalam

게시일 2026-08-20
📖 5 분 읽기🧠 심층 분석

원저자: Tate Berenbaum, Muthaiah Venkatachalam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 컴퓨팅의 세계에서, 인공지능을 위해 특별히 설계된 강력한 프로세서를 탑재한 새로운 종류의 개인용 컴퓨터가 등장했습니다. 주로 세련된 노트북 형태인 이 기기들은 거대 언어 모델(글을 쓰고, 추론하며, 대화할 수 있는 프로그램)을 실행할 수 있는 특화된 칩을 포함하고 있습니다. 그러나 단일 기기에는 한계가 있습니다. 그 메모리는 가장 진보된 모델들의 거대한 '두뇌'를 담기에는 너무 작아서, 개별 장치가 제공할 수 있는 것보다 훨씬 더 많은 저장 공간을 요구합니다. 전통적으로 이러한 거대 모델을 실행하기 위해 사용자들은 멀리 떨어진 비싼 클라우드 서버에 의존해야 했으며, 인터넷을 통해 질문을 보내고 답변을 기다려야 했습니다. 이는 외부 인프라에 대한 의존성을 만들고, 민감한 정보가 로컬 기기를 떠나야 한다는 점에서 데이터 프라이버시에 대한 우려를 불러일로합니다. 연구자들에게 주어진 과제는, 이 평범하고 유휴 상태인 개인용 컴퓨터 그룹이 표준 사무실 네트워크로 연결되어, 단일 기기에는 담을 수 없는 거대한 모델을 실행하면서도 데이터를 로컬에 유지하고 실제 대화가 가능할 만큼 빠른 응답 속도를 구현할 수 있는지 여부였습니다.

연구팀은 거대한 인공지능 모델을 더 작은 조각으로 나누어 소규모 함대의 각 컴퓨터에 할당하는 시스템을 구축함으로써 이 질문에 답하고자 했습니다. 거대하고 무거운 책을 혼자 들기 너무 무겁다고 상상해 보십시오. 대신 한 줄로 늘어선 사람들이 각자 한 장(chapter)씩 들고 있는 모습입니다. 이야기가 전개됨에 따라 첫 번째 사람이 자신의 장을 읽고 다음 사람에게 맥락을 전달하면, 그다음 사람이 자신의 장을 읽고, 이런 식으로 마지막 사람이 문장을 마칠 때까지 이어집니다. 이 시스템에서 '장'은 AI 모델의 레이어(층)이며, '전달'은 표준 네트워크 연결을 통해 일어납니다. 연구자들은 단순히 모델을 이렇게 나누는 것만으로는 충분하지 않다는 것을 발견했습니다. 컴퓨터 간의 인계 과정이 너무 느리고, 작업 내용을 확인하는 과정이 너무 번거로워 시스템이 느려졌기 때문입니다. 이를 해결하기 위해 그들은 느리고 실험적인 설정을 빠르고 사용 가능한 도구로 변화시킨 세 가지 구체적인 기술을 개발했습니다.

첫 번째 돌파구는 모델 조각들이 켜지기도 전에 어떻게 준비되는지에 대한 미묘한 변화와 관련이 있었습니다. 연구자들이 모델 레이어를 컴퓨터의 그래픽 칩에서 실행하기 위해 처음에 내보낼 때, 소프트웨어가 보통 속도를 높여주는 중요한 최적화를 놓쳤습니다. 각 조각의 코드에 특정하고 단순한 명령어를 주입함으로써, 그들은 그래픽 프로세서의 숨겨진 효율성을 끌어냈습니다. 이 작은 조정 덕분에 분할된 조각들은 단일 기기에서 실행되는 원래의 분할되지 않은 모델만큼 거의 빠르게 실행될 수 있었습니다. 이 수정 사항이 없었다면 시스템은 현저히 느려졌겠지만, 이 조치를 통해 성능 격차는 거의 사라졌으며, 모델을 분할하더라도 속도를 희생하지 않아도 된다는 것을 증명했습니다.

두 번째 과제는 AI의 사고 속도를 높이기 위해 사용되는 '초안 작성(drafting)' 과정을 처리하는 것이었습니다. 보통 더 작고 빠른 모델이 다음 몇 단어를 추측하면, 메인 모델이 이를 검증합니다. 만약 추측이 틀리면, 메인 모델은 잘못된 추측을 버리고 처음부터 다시 시작해야 합니다. 이 컴퓨터들에 사용되는 특화된 칩에서, 잘못된 추측을 버리는 표준 방식은 매우 느려서 매번 수정할 때마다 거의 0.5초가 걸렸고, 이는 대화의 흐름을 망치기에 충분한 시간이었습니다. 연구자들은 영리한 우회 방법을 찾아냈습니다. 잘못된 추측을 컴퓨터 메모리에서 물리적으로 삭제하는 대신, 단순히 AI에게 그것들을 무시하라고 지시하는 방식입니다. 배경 데이터에서 잘못된 추측을 보이지 않게 표시함으로써, 시스템은 삭제하는 것과 정확히 동일한 결과를 얻으면서도 훨씬 짧은 시간 안에 이를 수행했습니다. 이를 통해 시스템은 페널티 없이 더 빠른 초안 작성 기술을 사용할 수 있게 되었고, AI가 훨씬 더 반응성이 좋게 느껴지도록 만들었습니다.

세 번째 혁신은 여러 사람에게 동시에 서비스를 제공할 수 있게 해주었습니다. 표준 설정에서는 한 대의 컴퓨터가 작업하는 동안 다른 컴퓨터들은 자신의 차례를 기다리며 유휴 상태로 있는 경우가 많습니다. 연구자들은 컴퓨터들이 여러 사용자의 요청을 동시에 처리할 수 있는 방법을 설계했습니다. 한 컴퓨터가 사용자 A를 위한 문장을 마무리하는 동안, 라인의 다음 컴퓨터는 이미 사용자 B를 위한 문장을 시작할 수 있습니다. 이러한 작업의 인터리빙(interleaving, 교차 실행)은 함대의 모든 기기가 계속 작동하도록 유지하여, 그룹의 총 속도를 효과적으로 배가시켰습니다. 다른 두 가지 수정 사항과 결합되었을 때, 이 접근 방식은 두 대의 컴퓨터 함대가 단일 컴퓨터가 한 명의 사용자를 위해 작동할 때보다 거의 두 배 빠른 속도로 두 명의 사용자를 서비스할 수 있게 했습니다.

결과는 세 대의 고성능 노트북이 표준 Wi-Fi 네트워크로 연결된 함대에서 측정되었습니다. 테스트 결과, 인기 있는 80억 파라미터 모델을 실행하는 두 대의 컴퓨터 설정은 초당 거의 44단어의 속도로 두 명의 사용자를 서비스했으며, 이는 자연스럽고 상호작적인 대화가 가능한 속도입니다. 이는 단일 컴퓨터가 단 한 명의 사용자를 위해 동일한 모델을 실행할 때보다 1.79배 더 빨랐습니다. 더욱 인상적인 것은, 연구자들이 느리고 먼 거리의 인터넷 연결을 시뮬레이션했을 때도 시스템이 사용 가능한 상태를 유지한 반면, 최적화되지 않은 동일한 설정은 실용적으로 너무 느려졌다는 점입니다. 또한 시스템은 단일 컴퓨터가 보유할 수 없는 크기인 거대한 700억 파라미터 모델을 실행하기 위해 성공적으로 확장되었습니다. 이 거대한 모델을 네 대의 컴퓨터로 나누어 실행함으로써, 연구팀은 상호작용 가능한 속도를 달면서, 소비자용 기기 그룹이 과거에는 대규모 데이터 센터에나 예약되어 있던 작업들을 처리할 수 있음을 입증했습니다.

연구는 또한 이 시스템이 다양한 조건에서 어떻게 작동하는지 탐구했습니다. 그들은 네트워크 속도보다 컴퓨터 간의 인계 효율성이 더 중요하다는 것을 발견했습니다. 연결이 느려지면, 시스템은 한 번의 통과(pass)에서 더 많은 단어를 한꺼번에 처리함으로써 지연을 완화했습니다. 또한 연구팀은 인터넷을 통한 실제 광역 네트워크 연결에서 시스템을 테스트했으며, 그 결과 최적화가 이루어지면 함대가 컴퓨터들이 서로 떨어져 있더라도 안정적인 대화 속도를 유지할 수 있음을 확인했습니다. 연구자들은 이 시스템이 잘 작동하지만, 암호화나 인증과 같은 내장된 보안 기능을 포함하지 않으므로 신뢰할 수 있는 환경에 있는 컴퓨터에 의존한다는 점을 언급했습니다. 또한, 지속적인 사용 중에 발생하는 컴퓨터의 물리적 열이 결국 속도를 늦출 수 있다는 점을 관찰했으며, 이는 실제 배포 시 관리되어야 할 요소입니다.

궁극적으로 이 작업은 강력한 인공지능을 실행하는 장벽이 하드웨어뿐만 아니라 그 하드웨어를 사용하는 방식에 달려 있음을 보여줍니다. 모델을 나누는 방식, 오류를 수정하는 방식, 그리고 여러 사용자를 서비스하는 방식을 재고함으로써, 평범한 컴퓨터 그룹이 하나의 강력한 기계처럼 작동할 수 있습니다. 연구자들은 코드와 데이터를 공개하여 다른 사람들이 결과를 검증하고 시스템을 발전시킬 수 있도록 했습니다. 이 결과는 가까운 미래에 조직들이 이미 보유하고 있는 컴퓨터를 사용하여 자체적인 프라이빗 고속 AI 클러스터를 운영함으로써, 데이터를 로컬에 유지하고 외부 클라우드 서비스에 대한 의존도를 줄일 수 있음을 시사합니다. 이 시스템은 적절한 소프트웨어가 있다면, 유휴 상태인 기기 함대의 집단적 힘을 모아 한때 슈퍼컴퓨터가 필요하다고 생각되었던 문제들을 해결할 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →