← 최신 논문
💻 computer science

HADIS: A Hybrid Architecture for Query-Aware Diffusion Model Serving

HADIS는 사전 생성 라우팅과 사후 생성 판별을 결합하여 모델 선택과 GPU 할당을 동적으로 최적화함으로써, 기존의 캐스케이드 방식에 비해 응답 품질을 크게 향상시키고 SLO 위반을 줄이는 하이브리드 확산 모델 서빙 시스템이다.

원저자: Qizheng Yang, Tung-I Chen, Siyu Zhao, Ramesh K. Sitaraman, Hui Guan

게시일 2026-09-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qizheng Yang, Tung-I Chen, Siyu Zhao, Ramesh K. Sitaraman, Hui Guan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 시대에 들어서며 컴퓨터는 그림 그리는 법을 배웠습니다. 수백만 개의 이미지와 사람들이 그것을 설명할 때 사용하는 단어들을 학습함으로써, 인공지능 시스템은 이제 단순한 텍스트 프롬프트로부터 완전히 새로운 이미지를 생성할 수 있게 되었습니다. 사용자가 "시간과 기억을 나타내는 초현실적인 도시 풍경"을 요청하면, 컴퓨터는 단순히 사진을 찾아오는 것이 아니라 픽셀 하나하나를 쌓아 올려 이미지를 구축합니다. 이 과정에는 엄청난 컴퓨팅 능력과 시간이 필요합니다. 이러한 능력은 연구실을 넘어 예술가와 디자이너들이 사용하는 일상적인 도구로 자리 잡았지만, 최종 이미지의 아름다움을 희생하지 않으면서 어떻게 이 요청들을 빠르고 저렴하게 처리할 것인가라는 고질적인 물류적 문제에 직면해 있습니다.

핵심적인 어려움은 작업의 예측 불가능성에 있습니다. "흰 접시 위의 바나나"처럼 컴퓨터가 빠르게 해결할 수 있는 단순한 요청이 있는가 하면, 복잡한 세부 사항과 추상적인 개념을 조율해야 하는 어려운 요청도 있는데, 후자는 훨씬 더 많은 시간이 소집됩니다. 모든 요청을 가장 강력하고 고품질인 버전의 소프트웨어로 실행한다면 아름다운 결과를 보장할 수 있겠지만, 이는 매우 느리고 비용이 많이 들며 불필요한 작업으로 시스템을 과부하 상태로 만들 것입니다. 반대로, 모든 것에 대해 더 빠르고 단순한 버전을 사용한다면 효율적이겠지만, 어려운 요청에 대해서는 종종 흐릿하거나 터무니없는 이미지를 만들어낼 것입니다. 엔지니어들의 과제는 어떤 요청이 쉽고 어떤 것이 어려운지 즉각적으로 인식하여, 시간과 돈을 낭비하지 않고 적절한 도구로 요청을 전달할 수 있는 시스템을 구축하는 것입니다.

매사추세츠 대학교 애머스트스트(University of Massachusetts Amherst)의 연구진은 바로 이 문제를 해결하기 위해 HADIS라고 불리는 새로운 시스템을 개발했습니다. 그들의 연구는 현재의 시스템이 이러한 요청을 처리할 때 발생하는 특정 결함을 다룹니다. 기존 방식은 종-종 모든 요청이 먼저 빠르고 가벼운 버전의 소프트웨를 거치게 한 뒤, 결과가 충분히 좋은지 사후에 확인하도록 강제합니다. 만약 결과가 좋지 않으면, 시스템은 이를 폐기하고 다시 느리고 강력한 버전으로 처음부터 시작합니다. 이 방식은 어차피 빠른 버전으로는 처리할 수 없었던 요청들에 대해 상당한 양의 컴퓨팅 전력을 낭비하게 만듭니다. 이는 마치 주니어 화가에게 걸작을 스케치하라고 시켰다가, 중간에 그 작업이 거장이 필요한 작업임을 깨닫고 나서 스케치를 버린 뒤 처음부터 다시 시작하는 것과 같습니다.

이를 해결하기 위해 연구팀은 두 가지 서로 다른 전략을 결합한 하이브리드 아키텍처를 설계했습니다. 첫 번째 부분은 이미지가 생성되기 전에 텍스트 프롬프트를 살펴보는 "라우터(router)"입니다. 사용된 단어를 바탕으로, 이 라우터는 해당 요청이 쉬울지 어려울지를 예측합니다. 만약 요청이 너무 복잡해 보이면, 시스템은 가볍고 빠른 버전을 아예 건너뛰고 요청을 직접 강력하고 고품질인 모델로 보냅니다. 이는 단순한 도구로 어려운 문제를 해결하려는 헛된 시도를 피함으로써 시간과 자원을 절약합니다. 두 번째 부분은 품질 검사관 역할을 하는 "디스크리미네이터(discriminator)"입니다. 만약 요청이 빠른 버전을 거치게 된 경우, 이 검사관은 최종 이미지를 확인합니다. 만약 이미지가 기준에 미치지 못하면, 시스템은 실수를 포착하여 사용자가 저급한 결과를 보기 전에 강력한 모델로 재라우팅합니다. 이 2단계 안전망은 쉬운 요청은 빠르게 처리하고, 어려운 요청은 헛된 시도로 인한 낭비 없이 필요한 주의를 기울일 수 있도록 보장합니다.

연구진은 16개의 강력한 그래픽 프로세서 클러스터를 사용하여 실제 수천 건의 이미지 요청 데이터를 바탕으로 이 시스템을 테스트했습니다. 그들은 HADIS를 빠른 모델만 사용하는 시스템, 느린 모델만 사용하는 시스템, 그리고 스마트한 라우터 없이 두 모델 사이를 전환하려고 시도하는 시스템을 포함한 여러 기존 방식들과 비교했습니다. 결과는 놀라웠습니다. 어떤 모델을 언제 사용할지 지능적으로 결정함으로써, HADIS는 다른 시스템들에 비해 생성된 이미지의 품질을 최대 35%까지 향 향상시켰습니다. 동시에, 제시간에 완료되지 못한 요청의 수를 27배에서 45배까지 줄였습니다. 이는 이 시스템이 더 나은 그림을 만들어낼 뿐만 아니라, 사용자의 속도 기대치를 충족하는 데 있어 훨씬 더 신뢰할 수 있다는 것을 의미합니다.

연구의 핵심 통찰 중 하나는 시스템에 더 많은 복잡한 계층을 추가하는 것이 불필요하다는 점이었습니다. 연구진은 자신들의 하이브리드 라우터와 검사관에 의해 관리되는 단순한 2단계 설정이 3개 이상의 모델을 가진 더 복잡한 구성만큼이나 효과적이라는 것을 발견했습니다. 이 발견을 통해 연구진은 의사 결정 과정을 단순화하여 변화하는 수요에 더 빠르게 적응할 수 있게 했습니다. 시스템은 요청의 흐름을 지속적으로 모니터링하고 설정을 실시간으로 조정하여, 항상 속도와 품질의 적절한 균형을 유지합니다.

HADIS의 성공은 인공지능을 서비스하는 미래가 단순히 더 큰 모델을 만드는 것이 아니라, 그것을 사용하는 더 스마트한 방법을 구축하는 데 있음을 보여줍니다. 요청의 성격을 처리하기 전에 이해하고 처리 후에 결과를 검증함으로써, 시스템은 현재 기술을 괴롭히는 낭비를 피합니다. 이러한 접근 방식은 동일한 양의 에너지와 하드웨어를 사용하여 더 많은 사용자에게 더 높은 품질의 결과를 제공할 수 있게 합니다. 생성형 AI가 일상생활에 통합됨에 따라, HADIS와 같은 시스템은 이러한 강력한 도구들이 모두에게 빠르고, 저렴하며, 신뢰할 수 있는 상태를 유지하도록 하는 데 필수적일 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →