← 최신 논문
🤖 machine learning

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

본 논문은 온디바이스 배포의 자원 제한과 클라우드 전용 솔루션의 통신 오버헤드를 극복하면서 응답 품질, 지연 시간 및 비용 사이의 균형을 맞추기 위해 멀티모달, 멀티태스크 및 멀티턴 대화 전반에 걸쳐 오프로딩 결정을 동적으로 최적화하는 자원 제약 강화 학습 전략을 활용하는 디바이스-클라우드 협업 LLM 추론 시스템인 TMO를 소개한다.

원저자: Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

게시일 2026-07-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

멀리 떨어진 클라우드에 살고 있는 거대하고 똑똑한 뇌와, 당신의 주머니 속에 들어있는 작고 재빠른 두뇌를 상상해 보세요. 거대 뇌는 모든 것을 보고 듣고 불가능한 퍼즐도 풀 수 있지만, 당신과 대화하는 데 시간이 오래 걸리고 사용하는 데 많은 "디지털 코인"이 듭니다. 주머니 속 뇌는 매우 빠르고 무료로 사용할 수 있지만, 조금 건망증이 있고 사진이나 복잡한 장면이 아닌 단어들만 이해할 수 있습니다.

이것이 바로 TMO(Three-M Offloading)를 개발한 연구자들이 해결하려고 하는 정확한 문제입니다. 그들은 당신이 질문을 던질 때마다, 그 질문을 주머니 속 뇌가 처리하게 할지 아니면 거대한 클라우드 뇌로 보낼지를 결정하는 스마트한 "교통 관제사"를 만들었습니다. 하지만 여기서 반전은, 당신은 단순히 질문 하나만을 던지는 것이 아니라는 점입니다. 당신은 긴 다회차 대화(예를 들어 "저녁 메뉴가 뭐야?"라고 물은 뒤 "접시는 어디 있어?"라고 묻고, 이어서 "불 좀 켜줄래?"라고 묻는 것과 같은 대화)를 나누고 있습니다. 게 plus, 뇌가 상황을 이해할 수 있도록 사진이나 비디오를 찍어 보낼 수도 있습니다.

연구자들은 단순히 추측하거나 항상 큰 뇌를 사용하는 것이 나쁜 아이디어라는 것을 발견했습니다. 대신, 그들은 강화 학습(Reinforcement Learning, AI가 빠르고, 저렴하며, 정확하게 점수를 얻기 위해 노력하는 비디오 게임과 같은 것)을 사용하여 특별한 의사 결정자를 훈련시켰습니다. 이 AI는 "자원 관리"라는 고도의 심리전을 수행하는 법을 배웠습니다.

주요 발견
주요 결과는 이 스마트한 컨트롤러가 세 가지 까다로운 요소인 멀티모달(텍스트, 사진, 비디오), 멀티태스크(메시지 편집, 분실물 찾기, 추천 제공), 그리고 멀티턴(대화를 지속하는 것)을 동시에 조절할 수 있다는 것입니다.

M4A1이라는 커스텀 데이터셋과 함께 21,000회 이상의 대화 턴을 대상으로 진행된 테스트에서, TMO 시스템은 다른 방법들을 능가할 수 있음을 보여주었습니다. 이 시스템은 응답 품질을 높게 유지(그들의 척도에서 약 1.06점)하면서도, 대기 시간을 약 13.07초로 줄이고 비용을 0.01371 달러(또는 13.71 센트)로 낮게 유지했습니다. 가장 중요한 것은, 이 과정에서 규칙을 어기지 않았다는 점입니다. 즉, 30초의 시간 제한과 0.05 달러의 지출 제한을 한 번도 초과하지 않았습니다.

그들이 "아니오"라고 말한 것들
이 논문은 무엇이 효과가 없는지에 대해서도 명확히 밝히고 있습니다. 그들은 단순히 정답을 추측하기만 하는 또 다른 AI인 "라우터(Router)"를 테스트했고, 그것이 실패했다는 것을 발견했습니다. 어떤 라우터들은 너무 게을러서 모든 사진을 무시했고, 어떤 라우터들은 너무 탐욕스러워서 모든 질문에 대해 모든 사진을 보내느라 돈과 시간을 낭비했습니다. 또한 연구자들은 "전문가(Expert)" 데이터(사람이 AI에게 완벽한 정답을 보여주는 방식)에 대해서도 반론을 제기했습니다. 그들은 심지어 인간조차도 긴 대화 중에 사진을 보내거나 뇌를 교체해야 하는 완벽한 타이밍을 아는 데 어려움을 겪는다는 것을 발견했기에, 대신 **무작위 행동(randomized actions)**을 사용하여 시스템을 구축했습니다. 이를 통해 AI가 인간을 단순히 모방하는 것이 아니라, 게임의 규칙 자체를 스스로 배우도록 강제했습니다.

얼마나 확신하는가?
저자들은 자신들의 결과에 확신을 가지고 있지만, 이것이 세상의 모든 상황을 해결하는 마법 같은 해결책이 아니라 자신들의 특정 데이터셋에 기반한 시뮬레이션 및 실험임을 신중하게 밝히고 있습니다. 그들은 수천 번의 시행착차를 통해 자신들의 시스템이 테스트된 AIwRGPerLLM과 같은 "최첨단(State-of-the-Art, SOTA)" 방식보다 더 잘 작동한다는 것을 증명했습니다.

예를 들어, 클라우드가 매우 느려져서 대기 시간이 10배 더 길어지는 상황을 테스트했을 때, 그들의 시스템은 시간 제한을 어기지 않기 위해 스마트하게 다시 주머니 속 뇌로 전환했습니다. 또한 **라즈베리 파이(Raspberry Pi)**부터 강력한 **아이폰 15 프로(iPhone 15 Pro)**에 이르기까지 다양한 유형의 기기를 테스트했을 때, 시스템은 완벽하게 적응하며 하드웨어가 무엇인지와 상관없이 규칙만 알면 된다는 것을 보여주었습니다.

"불확실성" 기법
AI의 답변이 다소 예측 불가능할 수 있다는 점을 처리하는 방식 중 가장 멋진 부분은 다음과 같습니다. 가끔 동일한 질문이 약간 다른 점수를 받을 수 있습니다. 이를 해결하기 위해 그들은 "최근접 이웃(nearest neighbor)" 전략을 사용했습니다. 새로운 질문의 점수를 추측하려고 할 때, 무턱대고 추측하는 대신 시스템은 이전에 보았던 5개의 가장 가까운 질문들(이웃들)을 살펴보고 그 점수들을 평균 냅니다. 이 방식은 데이터가 다소 혼란스러울 때도 시스템이 안정성을 유지하도록 도왔습니다.

결론
이 논문은 이러한 스마트하고 자원을 고려한 학습 방법을 사용함으로써, 우리는 장치의 속도와 저렴한 비용, 그리고 클라우드의 초지능적 멀티 비전 능력을 모두 가질 수 있는 최선의 조합을 얻을 수 있다고 시사합니다. 아직 전 세계를 위한 완벽한 해결책은 아니지만, 시뮬레이션에서 TMO는 사진, 비디오, 그리고 긴 대화를 다루면서도 예산이나 인내심을 소진하지 않고 현실 세계의 복잡한 문제를 처리할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →