← 최신 논문
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

본 논문은 기존 베이스라인 대비 대규모 언어 모델의 추론적 디코딩에서 최대 4.2×\times의 처리량 및 5.6×\times의 에너지 효율성 향상을 달성하기 위해 새로운 제어 메커니즘을 통한 NPU-PIM 협업을 활용하는 작업 수준 비동기 이종 모바일 아키텍처인 AHASD를 소개합니다.

원저자: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

긴 이야기를 쓰려는데 엄격한 규칙이 하나 있다고 상상해 보세요: 다음 단어를 쓰기 전에 작성한 모든 단어를 매우 지혜롭고 느리며 비싼 편집자 (타겟 모델) 가 반드시 확인해야 합니다. 이로 인해 작성이 극도로 느려집니다.

속도를 높이기 위해, 몇 단어를 미리 추측해 주는 빠르고 에너지가 넘치는 조수 (드래프트 모델) 를 고용합니다. 당신은 이 추측들을 적어두고, 그 지혜로운 편집자가 한꺼번에 모두 확인합니다. 추측이 좋으면 그대로 유지하고 다음 단계로 넘어갑니다. 나쁘면 버리고 처음부터 다시 시작합니다. 이를 Speculative Decoding(추측적 디코딩) 이라고 합니다.

하지만 모바일 폰에서는 이 과정에 두 가지 큰 문제가 있습니다:

  1. "기다림 게임": 때로는 조수가 2 단어를 추측하고, 때로는 20 단어를 추측합니다. 조수가 느리면 편집자는 다음 입력을 기다리며 가만히 앉아 있게 됩니다. 조수가 빠르면 편집자는 다음 배치의 입력을 기다리며 가만히 앉아 있게 됩니다. 서로가 서로의 완료를 기다리며 손을 잡고 끊임없이 대기하는 상황은 시간을 낭비합니다.
  2. "나쁜 추측" 문제: 때로는 조수가 지나치게 자신감을 가지고 맥락이 까다로울 때 한 문단 전체의 터무니없는 내용을 추측합니다. 편집자는 전체를 거부해야 하므로, 조수가 추측하는 데 쏟은 모든 에너지를 낭비하게 됩니다.

이 논문은 PIM(메모리 내 처리) 이라는 특수한 컴퓨터 칩과 표준 AI 칩인 NPU를 사용하여 모바일 폰에서 이러한 문제들을 해결하도록 설계된 새로운 시스템인 AHASD를 소개합니다.

다음은 간단한 비유를 통해 AHASD 가 작동하는 방식입니다:

1. "비동기 춤" (작업 수준 비동기 실행)

구식 시스템에서는 조수와 편집자가 완벽한 동조로 춤을 추어야 했습니다. 조수가 멈추면 편집자도 멈췄습니다.
AHASD는 이 연결고리를 끊습니다. 메모리 칩 (PIM) 에서 실행되는 조수와 프로세서 (NPU) 에서 실행되는 편집자가 독립적으로 작업할 수 있게 합니다.

  • 비유: 공장의 조립 라인을 상상해 보세요. 직원이 기계가 다음 단계를 시작하기 전에 이전 작업을 끝내기를 기다리는 대신, 직원은 바구니 (대기열) 에서 새로운 부품을 계속 꺼내 기계가 이전 배치를 처리하는 동안 작업합니다. 그들은 서로를 기다리지 않고 라인이 계속 움직이도록 할 뿐입니다. 이렇게 하면 한 장치가 아무것도 하지 않고 가만히 있는 "유휴 시간"이 사라집니다.

2. "자신감 레이더" (엔트로피 - 히스토리 인식 드래프팅)

조수는 때로 지나치게 자신감을 가지고 신중해야 할 때 광적으로 추측하기 시작합니다.
AHASD는 조수에게 "자신감 레이더"를 제공합니다. 이는 최근 추측들의 이력을 살펴봅니다.

  • 비유: 날씨 예보관을 생각해 보세요. 만약 그들이 지난 3 일 동안 비 예보를 틀렸다면, 구름이 비슷해 보이더라도 다음 날 비를 예측하는 것을 멈춥니다. 마찬가지로 조수의 추측이 낮은 "자신감"(높은 엔트로피) 을 보이면, 시스템은 이렇게 말합니다: "앞으로 추측하는 것을 멈추세요! 다음 단어를 추측하기 전에 편집자가 현재 단어를 확인할 때까지 기다리세요." 이렇게 하면 조수가 반드시 버려질 추측에 에너지를 낭비하는 것을 막습니다.

3. "스마트 타이머" (시간 인식 사전 검증)

때로는 조수가 작업을 끝내지만 편집자는 여전히 바쁩니다. 조수가 다시 추측을 시작할 수 있지만, 너무 많이 추측하면 편집자가 확인할 작업이 부족해져 가만히 앉아 있게 될 수 있습니다.
AHASD는 "스마트 타이머"를 사용하여 조수가 언제 멈추고 스스로 빠른 "미니 점검"(사전 검증) 을 해야 하는지 정확히 결정합니다.

  • 비유: 조수 (조수) 가 야채를 다듬는 동안 서브 셰프 (편집자) 가 소스를 만들고 있다고 상상해 보세요. 조수는 소스가 얼마나 걸릴지 정확히 압니다. 만약 조수가 소스가 5 초 안에 완성될 것이라고 보이면, 야채를 다듬는 것을 멈추고 야채가 준비되었는지 확인하기 위해 빠른 맛보기 (사전 검증) 를 합니다. 이렇게 하면 소스가 완성되는 순간 서브 셰프가 신선한 야채를 바로 사용할 수 있게 되어, 서브 셰프가 기다리며 서 있을 필요가 없습니다.

결과

저자들은 모바일 폰 칩에서 이 시스템의 시뮬레이션을 구축했습니다. 그 결과 다음과 같은 사실을 발견했습니다:

  • 속도: 표준 그래픽 카드 (GPU) 만 사용하는 것보다 최대 4.2 배 빠르며, 모바일 칩과 메모리 처리를 결합한 이전 시도들보다 1.5 배 빠릅니다.
  • 배터리 수명: 표준 GPU 보다 최대 5.6 배 더 에너지 효율적이며, 이전 최고의 모바일 시스템보다 1.24 배 더 우수합니다.
  • 비용: 이러한 모든 화려한 새로운 기능은 메모리 칩의 추가 공간 중 약 3% 만 차지합니다. 이는 이러한 큰 속도 향상을 얻기 위해 치르는 매우 작은 대가입니다.

요약하자면, AHASD 는 서로를 기다리지 않고, 추측하기 전에 자신의 자신감을 점검하며, 배터리를 낭비하지 않고 작업이 원활하게 흐르도록 휴식 시간을 완벽하게 조절하는 팀을你的手机의 AI 에게 제공하는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →