← 최신 논문
🤖 machine learning

DiLaServe: High SLO Attainment Serving for Diffusion Language Models

DiLaServe는 데드라인 인지 스케줄링, 신뢰도 임계값 조정을 통한 적응형 부하 제어, 그리고 근사 KV 캐싱으로 인한 스텝 수준의 이질성을 고려한 동적 클러스터 재구성을 통해, 정확도 손실을 최소화하면서 SLO 달성도를 최대 56.6%포인트 개선하고 지연 시간을 46% 감소시키는 디퓨전 언어 모델용 클러스터 수준 서빙 시스템이다.

원저자: Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham, Shivaram Venkataraman

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tzu-Tao Chang, Benjamin Yuanyang Hong, Kiet Pham, Shivaram Venkataraman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 바쁜 레스토랑을 운영하고 있다고 상상해 보세요. 이곳의 셰프들(AI 모델)은 이야기를 한 번에 한 단어씩 써 내려가야 합니다. 기존의 방식(이를 "자기회귀(autoregressive)" 모델이라고 부릅니다)에서는 셰프가 한 단어를 쓰고, 생각하고, 다음 단어를 쓰는 식으로 진행됩니다. 이는 한 번에 한 가지 일만 할 수 있기 때문에 매우 느립니다.

최근에는 새로운 유형의 셰프가 도착했습니다: 바로 **디퓨전 언어 모델(Diffusion Language Model, DLM)**입니다. 이 셰프는 한 단어씩 쓰는 대신, 페이지 전체의 횡설수설하는 내용(마스킹된 단어들)을 보고 한 번의 "스윕(sweep)" 안에 여러 단어를 동시에 수정하려고 노력합니다. 이는 마치 편집자 팀이 한 번에 문단 전체를 고치는 것과 같아서 훨씬 빠릅니다.

하지만 문제가 하나 있습니다. 이 새 셰프는 완벽주의자입니다. 단어를 수정하기 전에 스스로에게 묻습니다. "내가 이게 맞다고 90% 확신하나?" 만약 확신이 충분하지 않다면, 그 단어를 그대로 두고 다음 스윕에서 다시 시도합니다. 만약 매우 확신한다면, 즉시 수정합니다.

문제점:
만약 셰프가 너무 까다로우면(높은 확신도), 이야기를 완성하는 데 시간이 너무 오래 걸려 고객들이 기다리다 화가 납니다(높은 지연 시간/latency). 반대로 너무 성급하면(낮은 확신도), 빨리 끝내기는 하지만 엉뚱한 내용을 쓸 수 있습니다(낮은 품질).

게다가 레스토랑에는 셰프의 수가 제한되어 있습니다. 때로는 주방이 비어 있기도 하고, 때로는 주문이 밀려 정신없이 바쁘기도 합니다. 한 명의 셰프에게 너무 복잡한 주문을 맡기면 과부하가 걸립니다. 반대로 아주 빠른 셰프에게 너무 단순한 주문을 많이 맡기면 그들의 잠재력을 낭비하게 됩니다.

해결책: DiLaServe
이 논문은 이러한 새로운 디퓨전 셰프들을 위해 설계된 스마트한 "레스토랑 매니저"인 DiLaServe를 소개합니다. 이 시스템이 어떻게 작동하는지 일상적인 비유를 통해 설명하겠습니다.

1. "확신도 조절 다이얼" (속도 vs 품질)

셰프에게 "확신도"라고 적힌 다이얼이 있다고 상상해 보세요.

  • 10으로 돌리면 (높은 확신도): 셰프는 자신이 절대적으로 확신하는 단어들만 수정합니다. 이야기는 완벽해지겠지만, 시간이 오래 걸릴 것입니다.
  • 5로 돌리면 (낮은 확신도): 셰프는 단순히 추측하는 단어들까지도 수정합니다. 매우 빠르지만, 이야기가 이상해질 수 있습니다.

DiLaServe의 마법: 이 시스템은 단순히 하루 종일 하나의 설정만 고집하지 않습니다. 시계를 보며 상황을 파악합니다.

  • 만약 고객의 주문이 늦어지고 있다면, DiLaServe는 셰프에게 속삭입니다. "이봐, 지금 뒤처지고 있어! 좀 더 빨리 끝낼 수 있도록 확신도를 조금 낮춰!"
  • 만약 주방이 한가하다면, "천천히 해, 확신도를 높여서 완벽하게 만들어!"라고 말합니다.
  • 결과: 이는 속도와 품질 사이의 균형을 동적으로 조절하여, 이야기가 훌륭하게 유지되면서도 고객이 너무 오래 기다리지 않도록 보장합니다.

2. "로드 밸런서" (인파 관리)

당신에게 셰프 팀이 있다고 상해 보세요. 어떤 이들은 솔로 요리사(하나의 GPU 사용)이고, 어떤 이들은 하나의 거대한 주문을 처리하기 위해 함께 협력하는 슈퍼 팀(여러 개의 GPU를 사용하는 '텐서 병렬성' 활용)입니다.

  • 슈퍼 팀은 크고 복잡한 주문을 빠르게 끝내는 데 탁ual합니다.
  • 솔로 요리사는 수많은 작은 주문이 쏟아질 때 처리하기에 더 좋습니다. 왜냐하면 더 많은 인원을 동시에 투입할 수 있기 때문입니다.

DiLaServe의 마법: 이 시스템은 들어오는 주문 수를 끊임없이 계산합니다.

  • 레스토랑이 한가할 때는 주문을 슈퍼 팀에게 보내 빠르게 끝내도록 합니다.
  • 레스토랑이 북적거릴 때는 엄청난 양의 주문을 처리하기 위해 솔로 요리사 체제로 전환합니다. 비록 개별 주문은 조금 더 걸릴지라도 말이죠.
  • 또한 주방이 막히는 것을 방지합니다. 만약 너무 많은 사람이 동시에 요리하려고 하면, 전체 라인이 계속 돌아갈 수 있도록 셰프들에게 확신도를 낮추라고(더 빨리 작업하라고) 지시하여 전체적인 정체를 막습니다.

3. "스마트 스케줄러" (주문 옮기기)

일반적인 주방에서는 셰프가 일단 주문을 시작하면 끝낼 때까지 계속합니다. 하지만 DiLaServe는 셰프들이 중간에 주문을 교체할 수 있게 해줍니다.

  • 만약 A 셰프가 어려운 주문 때문에 쩔쩔매고 있고 B 셰프가 여유가 있다면, DiLaSere는 즉시 그 주문을 B 셰프에게 넘길 수 있습니다.
  • 디퓨전 모델은 "단계(step)" 단위로 작동하기 때문에(단어 묶음을 수정함), 이러한 인수인계는 매우 저렴하고 빠릅니다. 이는 마치 웨이터가 수프 한 방울도 흘리지 않고 느린 라인에서 접시를 가져와 빠른 라인으로 옮기는 것과 같습니다.

4. "재활용 함" (근사적 KV 캐싱)

보통 셰프가 이야기를 쓸 때, 맥락을 유지하기 위해 지금까지 쓴 모든 내용을 기억해야 합니다. 이는 많은 정신적 에너지(메모리)를 소모합니다.

  • DiLaServe는 **근사적 KV 캐싱(Approximate KV Caching)**이라는 기술을 사용합니다. 이는 "새로운 문장을 쓸 때마다 첫 번째 단락을 매번 다시 읽을 필요 없이, 그 핵심 내용만 기억하면 된다"라고 말하는 것과 같습니다.
  • 이는 엄청난 양의 시간을 절약해 줍니다. DiLaServe는 이야기가 혼란스러워지지 않도록 이 기억을 언제 "새로고침"해야 할지 정확히 알고 있으며, 이를 통해 셰프들이 효율성을 유지하도록 보장합니다.

결과

이 논문은 실제 데이터를 사용하여 기존의 경직된 시스템들과 이 시스템을 비교 테스트했습니다.

  • 성공률: DiLaServe는 기존 시스템보다 고객의 시간 제한(SLO)을 최대 56% 더 자주 충족했습니다.
  • 속도: 전체 대기 시간을 46% 단축했습니다.
  • 품질: 이야기는 아주 약간 덜 완벽해졌지만(품질 저하 1% 미만), 이는 고객을 영원히 기다리게 하지 않기 위해 지불할 수 있는 아주 작은 대가입니다.

요약하자면: DiLaServe는 셰프들에게 언제 더 빨리 움직이라고 압박하고, 언제 완벽을 기할지 아는 스마트한 매니저입니다. 또한 주방이 과부하에 걸리지 않으면서도 모두가 빠르게 음식을 받을 수 있도록 실시간으로 주방 인력을 재배치합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →