Hera: Learning Long-Horizon Coordination for Device-Cloud Collaborative LLM Agents
헤라는 장기 범위의 LLM 에이전트를 위한 새로운 단계 수준의 디바이스-클라우드 조정기로, 모방 학습과 비용 인식 강화 학습의 2 단계 훈련 패러다임을 활용하여 작업 성공과 계산 비용 간의 균형을 최적화함으로써 클라우드 전용 성능에 근접하는 성과를 내면서도 클라우드 사용량을 획기적으로 줄입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하지만 비싼 비서 (클라우드) 와 빠르고 저렴하지만 때로는 잊어버리는 비서 (장치) 가 있다고 상상해 보세요. 여러분은 이 둘이 협력하여 일주일 간의 휴가 계획을 세우거나 미로를 헤쳐 나가는 것처럼 길고 복잡한 퍼즐을 해결해야 합니다.
문제는 다음과 같습니다.
- 장치가 모든 일을 하도록 하면 빠르고 무료이지만, 퍼즐의 어려운 부분에서 길을 잃거나 실수를 할 수 있습니다.
- 클라우드가 모든 일을 하도록 하면 완벽하지만, 비용이 많이 들고 멀리 떨어져 있어 소통하는 데 시간이 오래 걸립니다.
대부분의 기존 시스템은 "이 전체 작업에 클라우드를 사용해야 할까?"라고 결정하려 합니다. 작업이 어려워 보이면 클라우드 비용을 지불하고, 쉬워 보이면 장치를 사용합니다. 하지만 이는 메뉴가 복잡하다는 이유만으로 마스터 셰프가 일주일 치 모든 야채를 다 다지게 고용하는 것과 같습니다. 셰프는 사실 어려운 가니시 작업에만 도움이 필요할 뿐입니다.
헤라 (Hera) 의 등장입니다.
헤라는 전체 작업을 대신 결정하는 것이 아니라, 단계별로 작업을 지켜보며 순간적인 결정을 내리는 새로운 "팀 캡틴"입니다. "이 특정 동작은 쉬운가? 장치가 하도록 하자. 이 동작은 까다로운가? 도움을 위해 클라우드를 호출하자."
헤라가 훌륭한 캡틴이 되는 법
헤라는 스포츠 코치가 선수를 훈련시키듯, 두 단계의 훈련 과정을 통해 이 캡틴이 됩니다.
1 단계: "섀도잉 (Shadowing)" 단계 (모방 학습)
먼저 헤라는 클라우드가 전체 작업을 완벽하게 수행하는 것을 지켜봅니다. 그런 다음 클라우드의 답변을 가이드로 하여 장치가 정확히 같은 단계를 시도하도록 요청합니다.
- 장치가 스스로 단계를 올바르게 수행하면, 헤라는 이렇게 배웁니다. "좋습니다, 장치는 여기서 능력을 발휘합니다. 비싼 클라우드를 호출할 필요가 없습니다."
- 장치가 혼란을 겪거나 다른 선택을 하면, 헤라는 이렇게 배웁니다. "아, 이 단계는 장치에게는 너무 어렵습니다. 여기서 클라우드의 도움이 필요합니다."
이를 통해 헤라는 장치가 어디서 어려움을 겪는지에 대한 기본 규칙을 습득합니다.
2 단계: "전략" 단계 (강화 학습)
이제 헤라는 직접 게임을 플레이합니다. 장치와 클라우드 단계를 혼합하여 작업을 해결해 보며, 다음 두 가지 기준에 따라 점수를 받습니다.
- 우리가 이겼는가? (작업이 완료되었는가?)
- 너무 많이 썼는가? (클라우드를 너무 자주 호출했는가?)
헤라는 모든 어려운 단계에 클라우드가 필요하지 않음을 배웁니다. 긴 여정 중간에 단 하나의 결정적인 단계만 클라우드에 요청해도 전체 계획이 제자리를 잡을 수 있음을 깨닫습니다. 헤라는 실패를 피하기 위해 절대적으로 필요할 때만 클라우드를 호출함으로써 비용을 절약하는 법을 배웁니다.
결과: 양쪽 세계의 장점을 모두 누림
연구진들은 헤라를 세 가지 다른 "퍼즐"에서 테스트했습니다.
- ALFWorld: 집을 정리하려는 로봇.
- WebShop: 웹사이트에서 특정 상품을 구매하려는 에이전트.
- AppWorld: 앱을 관리하는 코드를 작성하려는 에이전트.
마법 같은 숫자들:
- 성공률: 헤라는 클라우드를 항상 사용했을 때의 성공률의 **92.5%**를 달성했습니다. 거의 실패하지 않습니다.
- 비용 절감: 헤라는 단계의 **46.3%**에서만 비싼 클라우드를 사용했습니다. 나머지는 장치가 처리했습니다.
- 속도: 로컬 장치를 많이 사용했기 때문에, 매번 클라우드를 기다리는 것보다 전체 과정이 훨씬 빨랐습니다.
핵심 교훈
헤라는 일상적인 업무는 주니어 직원 (장치) 에게 맡기고, 어려운 문제는 시니어 전문가 (클라우드) 를 불러들이는 시기를 정확히 아는 똑똑한 관리자라고 생각하세요. 이렇게 함으로써 팀은 전문가가 모든 일을 했을 때와 거의 똑같은 결과로 일을 끝내지만, 비용은 절반으로, 속도는 두 배로 단축합니다.
이 논문은 전체 작업이 아닌 단계별로 이러한 결정을 내리는 최초의 시스템이라고 주장하며, 복잡한 문제를 해결하기 위해 매번 슈퍼컴퓨터가 필요하지 않음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.