← 최신 논문
🤖 AI

AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery

이 논문은 LLM 플래너, 타입된 도구 에이전트, 적응형 복구 기능을 통해 데스크톱 상호작용을 조율하기 위해 사용자 기기에서 완전히 실행되는 로컬 우선 방식의 멀티 에이전트 음성 비서인 AnovaX를 소개하며, 동시에 컴패니언 휴대폰 인터페이스를 통한 실시간 원격 제어 및 모니터링을 가능하게 한다.

원저자: Raunak B Sinha

게시일 2026-07-20
📖 5 분 읽기🧠 심층 분석

원저자: Raunak B Sinha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 기계 속에 살아있는 목소리

당신의 주머니 속에 아주 똑똑한 비서가 살고 있다고 상상해 보세요. 그 비서는 당신의 목소리를 듣고, 복잡한 요청을 이해하며, 심지어 당신의 컴퓨터를 제어할 수도 있습니다. 수년 동안 이 개념은 시리(Siri)나 알렉사(Alexa)와 같은 "클라우드" 기반 어시스턴트들이 주도해 왔습니다. 이러한 클라우드 어시스턴트들을 당신의 목소리를 가져가서 수 마일 떨어진 거대한 서버 팜으로 달려가 답을 얻어온 뒤 다시 돌아오는 메신저라고 생각하면 됩니다. 속도는 빠르지만, 이는 당신의 사적인 대화가 집 밖으로 나간다는 것을 의미하며, 어시스럼트는 이미 프로그래밍된 정해진 기능만을 수행할 수 있다는 뜻입니다. 이는 마치 문을 열 수는 있지만, 당신을 위해 메모를 적기 위해 펜을 집어 들 수는 없는 집사와 같습니다.

인공지능(AI) 분야는 최근 대규모 언어 모델(LLM)이 인간의 언어를 이해하는 데 매우 뛰어나다는 사실을 발견했습니다. 그러나 새로운 질문이 등장했습니다. 우리의 비밀을 로컬에 유지하면서, 단순히 상식을 답변하는 수준을 넘어 데스크톱에서 앱을 열거나, 텍텍스트를 입력하거나, 버튼을 클릭하는 등의 '실제 작업'을 수행할 수 있는, 컴퓨터 '내부'에 머무는 어시스턴트를 구축할 수 있을까? 이 논문은 "로컬 우선(local-first)" 음성 어시스턴트를 구축하려는 AnovaX라는 프로젝트를 탐구합니다. AnovaX는 당신의 목소리를 클라우드로 보내는 대신, 전체 과정을 당신의 노트북에서 실행합니다. 이 시스템은 무엇을 할지 결정하기 위해 스마트한 플래너(planner)를 사용하지만, 실제로 키보드와 마우스를 조작하는 데는 미리 프로그래밍된 전문적인 "작업자(workers)" 팀에 의존합니다. 목표는 거대 IT 기업들과 게임에서 승리하는 것이 아니라, 모든 움직임에 클라우드 연결이 필요하지 않은, 단 한 명의 개인에 의해 구축될 수 있는 작고, 읽기 쉬우며, 안전한 시스템을 만들 수 있음을 보여주는 것입니다.


AnovaX: 클라우드가 필요 없는 로컬 집사

AnovaX를 만나보세요. 이것은 거대한 클라우드 기반 어시스턴트의 투명하고 안전하며 로컬 중심적인 대안이 되도록 설계된, 당신의 노트북에서 완전히 실행되는 음성 어시스턴트입니다. 제작자들은 컴퓨터를 제어하기 위해 거대하고 불투명한 시스템이 필요한 것이 아니라, 단지 작고 잘 조직된 디지털 작업자 팀만 있으면 된다는 것을 증명하기 위해 이를 만들었습니다.

핵심 아이디어: 플래너와 전문가 팀
당신이 바쁜 사무실의 상사라고 상상해 보세요. 당신은 모든 일을 직접 하고 싶지 않고, 업무를 위임하고 싶어 합니다. AnovaX에서 "상사"는 스마트한 AI 플래너(Gemini 모델 사용)입니다. 당신이 "메모장을 열고 이야기를 써줘"라고 말하면, 플래너는 직접 타이핑을 시도하지 않습니다. 대신, 특수한 코드(JSON)로 빠른 계획을 작성하여 **멀티 에이전트 오케스트레이터(Multi-Agent Orchestrator)**에게 전달합니다.

오케스트레이터를 빠르고 효율적인 무대 감독이라고 생각하세요. 그것은 플래너의 목록을 받아 각 작업을 특정 "자식 에이전트(child agent)"에게 할당합니다.

  • AppAgent는 프로그램을 실행하는 방법을 아는 존재입니다.
  • TypingAgent는 실제로 키보드에 글자를 입력하는 존재입니다.
  • BrowserAgent는 웹 검색을 처리합니다.
  • MediaAgent는 스크린샷을 찍습니다.

각 에이전트는 자신만의 규칙을 가진 작고 전문화된 로봇입니다. 예를 들어, TypingAgent는 엄격한 규칙을 가지고 있습니다. 다른 에이전트가 키를 누르려고 하는 것과 충돌하지 않도록, 타이핑을 시작하기 전에 반드시 키보드가 자유로운 상태인지 확인해야 합니다. 이 시스템을 통해 어시스턴트는 여러 가지 일을 동시에 수행할 수 있습니다. 만약 당신이 "스크린샷을 찍고 시간을 알려줘"라고 요청하면, 오케스트레이터는 두 작업을 서로 다른 에이전트에게 동시에 보내어 시간을 절약합니다.

최우선 과제, 안전: 더블 체크 게이트
AI에 대한 가장 큰 우려 중 하나는 AI가 파일을 삭제하는 것과 같이 위험한 행동을 할 수 있다는 점입니다. AnovaX는 "2단계 안전 필터"로 이 문제를 해결합니다.

  1. 소프트 필터(Soft Filter): AI 플래너에게 "삭제(delete)"나 "포맷(format)"과 같은 "금지된" 단어 목록이 주어지며, 이 단어들을 사용하지 말라는 지시를 받습니다.
  2. 하드 필터(Hard Filter): 어떤 에이전트도 컴퓨터에 손을 대기 전에, 파이썬(Python) 프로그램이 계획을 엄격한 "화이트리스트"(승인된 도구만 허용) 및 "데닐리스트(denylist)"(금지된 키워드)와 대조하여 검사합니다. 만약 계획이 위험한 명령을 몰래 끼워 넣으려 한다면, 전체 과정이 즉시 차단되며 사용자에게 정중한 거절 메시지가 전달됩니다.

이 과정은 AI가 계획을 더 작은 하위 작업으로 나누려고 시도하더라도 매번 발생합니다. 이는 건물에 들어가기 전 신분증을 확인하는 보안 요원이 있고, 특정 방에 들어가기 전 다시 한번 신분증을 확인하는 것과 같습니다.

"복구 루프(Recovery Loop)": 상황이 잘못되었을 때
때로는 최선의 계획조차 실패할 수 있습니다. 요청한 앱이 설치되어 있지 않거나, 팝업 창이 포커스를 뺏어갈 수도 있습니다. 기존 시스템에서는 이로 인해 전체 프로세스가 중단됩니다. AnovaX에는 영리한 "복구 루프"가 있습니다.
단계가 실패하면 시스템은 포기하지 않습니다. 시스템은 탐정처럼 행동하는 두 번째의 더 빠른 AI 루프를 깨웁니다. 이 루프는 무엇이 잘못되었는지 살펴보고, 새로운 계획(예: "아, 앱 이름이 틀렸구나, 다시 검색해 보자")을 세운 뒤 다시 시도합니다. 이 과정이 즉각적으로 느껴지도록, 탐정이 생각하는 동안 시스템은 백그로데에서 안전한 읽기 전용 작업(예: 시간 확인)을 "투기적(speculatively)"으로 실행하여, 새로운 계획이 준비되었을 때 해당 부분들이 이미 완료되어 있도록 합니다.

폰으로 관찰하기
이 프로젝트에는 노트북을 휴대폰으로 제어할 수 있는 멋진 기능도 포함되어 있습니다. 휴대폰에 대고 말하면 명령이 홈 와이파이(Wi-Fi)를 통해 노트북으로 전송됩니다. 더 놀라운 점은, 노트북이 실시간으로 화면을 휴대폰으로 스트리밍한다는 것입니다. 당신은 다른 방에 서서 노트북이 스스로 앱을 열고 타이핑하는 것을 지켜볼 수 있으며, "에이전트"들이 작업하는 동안 정확히 무엇을 하고 있는지 볼 수 있습니다.

할 수 있는 것과 할 수 없는 것
논문은 AnovaX가 성공적으로 수행할 수 있는 작업을 보여줍니다:

  • 데스크톱 애플리케이션 실행 (예: 메모장).
  • 텍스트 입력 및 키 누르기.
  • 웹 및 유튜브 검색.
  • 스크린샷 촬영 및 시간 알려주기.
  • 복잡한 다단계 요청 처리 (예: "메모장을 열고, 한 단락을 타이핑하고, 저장해줘").
  • 위험한 명령 거부 (예: "내 다운로드 폴더를 삭제해줘").

하지만 저자들은 그 한계에 대해서도 매우 명확하게 밝히고 있습니다. 이 시스템은 "눈이 멀어(blind)" 있습니다. 창이 제대로 열렸는지 알기 위해 화면을 실제로 보는 것이 아니라, 명령을 보내고 잘 되기를 바랄 뿐입니다. 만약 팝업창이 화면을 가리면, 에이전트는 잘못된 곳에 계속 타이핑을 할 수도 있습니다. 또한 초기 "사고(thinking)" 과정(AI 플래너)과 당신의 목소리를 듣는 데는 클라우드에 의존하지만, 저자들은 향-후 완전한 오프라인 구현을 위해 이를 로컬 버전으로 교체할 수 있다고 제안합니다.

결론
AnovaX는 차세대 시리가 되려는 것이 아닙니다. 이것은 작고, 읽기 쉬우며, 안전한 로컬 어시스턴트가 가능하다는 것을 보여주는 개념 증명(proof-of-concept)입니다. 문제를 플래너, 안전 가드, 그리고 전문화된 타입 에이전트 팀으로 분리함으로써, 제작자들은 투명하고 통제 가능한 시스템을 구축했습니다. 이는 컴퓨터를 제어하기 위해 클라우드의 블랙박스가 필요한 것이 아니라, 단지 당신의 책상 위에서 실행되는 잘 조직된 디지털 조력자 팀이 필요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →