X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
본 논문은 직관적인 상호작용을 통해 효율적이고 신뢰할 수 있는 복잡한 작업 수행을 가능하게 하기 위해 다중 모달 인식, 개인화된 기억, 그리고 하이브리드 행동 전략을 통합한 안드로이드 생태계를 위한 통합형 모바일 에이전트인 X-OmniClaw를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신의 스마트폰이 단순히 당신이 들고 있는 도구가 아니라, 대신 보고, 듣고, 기억하고, 행동할 수 있는디지털 신체라고 상상해 보세요. 이것이 OPPO 연구원들이 개발한 새로운"모바일 에이전트"인 X-OmniClaw의 핵심 아이디어입니다.
X-OmniClaw 를 클라우드가 아닌 바로 당신의 폰 안에 거주하는 초지능 개인 디지털 비서로 생각하세요. 이 비서는 화면에서 보는 것, 카메라를 통해 보는 것, 그리고 당신이 말하는 것을 결합하여 복잡한 작업을 처리하도록 설계되었습니다.
다음은 이를 세 가지 간단한 부분으로 나누어 설명한 작동 방식입니다:
1. 눈과 귀:"Omni Perception(범용 지각)"
대부분의 비서는 당신이 명령을 입력할 때까지 기다립니다. X-OmniClaw 는 다릅니다. 이는 모든 것을 동시에 듣는 통합 게이트웨이를 갖추고 있습니다.
- 유추: 범죄 현장 (당신의 화면) 을 바라보고, 증인 (당신의 목소리) 을 경청하며, 창밖의 실제 세계 (당신의 카메라) 를 동시에 바라볼 수 있는 형사를 상상해 보세요.
- 작동 원리: 단순히"가격이 얼마야?"라는 말만 듣는 것이 아닙니다. 카메라로 가리키는 물체를 보고, 당신의 질문을 듣고, 즉시"아, 당신은 타오바오의 이 특정 병의 가격을 알고 싶어 하는구나"라고 이해합니다. 작업을 시작하기 전에 실제 세계와 디지털 세계 사이의 연결고리를 찾아냅니다.
2. 뇌와 일기:"Omni Memory(범용 기억)"
오래된 비서들은 통화가 끝나는 순간 모든 것을 잊어버립니다. X-OmniClaw 는 맥락을 유지하는 이중 기억 시스템을 갖추고 있습니다.
- 유추: 이를 단기 작업대와 장기 도서관으로 생각하세요.
- 작업대 (작업 기억): 지금 당신이 하고 있는 일을 보관합니다. 양식 작성 중 앱이 충돌하더라도, 비서는 당신이 정확히 어디에 있었는지 기억하므로 처음부터 다시 시작할 필요가 없습니다.
- 도서관 (장기 기억): 이는 과거의 경험에서 배웁니다. 당신이 앵무새 사진을 찍으면, 비서는 단순히 사진을 저장하는 것이 아니라"사용자는 앵무새를 좋아한다"는 의미적 메모를 생성합니다. 나중에 앵무새에 대한 동영상을 요청하면, 수백 개의 파일을 검색할 필요 없이 즉시 어떤 사진을 가져와야 할지 알게 됩니다.
- 개인정보 보호 우선: 이 기억은 당신의 폰 (에지 네이티브) 에 거주하기 때문에, 당신의 개인 사진과 데이터가 이해되기 위해 먼 서버로 전송될 필요가 없습니다.
3. 손:"Omni Action(범용 행동)"
이곳이 마법이 일어나는 곳입니다. X-OmniClaw 는 단순히 당신과 대화하는 것이 아니라 실제로 당신을 위해 무언가를 수행합니다.
- 유추: 탭, 스와이프, 타이핑을 할 수 있는 로봇 손이지만, 동시에 스마트한 학습자라고 상상해 보세요.
- 하이브리드 손: 때로는 앱이 지저분합니다 (광고가 많고 레이아웃이 이상함). X-OmniClaw 는"하이브리드 전략"을 사용합니다. 앱의 코드 (XML) 를 읽어서 버튼이 있어야 할 위치를 파악하지만, 코드가 혼란스러울 경우 인간처럼"눈 (시각 지각)"을 사용하여 버튼을 찾습니다.
- 복제"기법: 이것이 가장 멋진 부분입니다. 앱 (예: 메이투안) 에서 특정 세일 페이지를 찾기 위해 복잡한 경로를 수동으로 탐색했다면, 비서에게"이것을 지켜봐"라고 말할 수 있습니다. 그러면 당신의 행동을 복제합니다. 다음에"플래시 세일로 가줘"라고 말하면 단순히 검색하는 것이 아니라, 모든 지루한 클릭과 스크롤을 건너뛰고 즉시 그 정확한 페이지로 이동합니다. 이는 당신의 수동 탐색을 재사용 가능한"스킬 카드"로 변환합니다.
이것이 왜 중요한가요?
대부분의 현재"스마트"비서는 원격 서버 (클라우드) 에서 실행됩니다. 이는 수 마일 떨어진 관제탑에서 비행기를 조종하는 조종사와 같습니다. 그들은 난기를 느끼거나 비행기의 로컬 센서에 직접 접근할 수 없습니다.
X-OmniClaw 는 에지 네이티브입니다.
- 자동차 유추: 스마트폰은 자동차입니다. 클라우드는 필요한 경우 연료 (추론 능력) 를 제공하는 주유소일 뿐입니다. 엔진 (에이전트) 은 차 안에 있습니다.
- 엔진이 차 안에 있기 때문에, 교통 상황 (화면 변경) 에 즉시 반응하고, 차의 자체 센서 (카메라/마이크) 를 사용하며, 먼 탑에서 신호를 기다릴 필요가 없습니다.
논문에서 제시된 실제 사례
- 카메라 코파일럿: 카메라로 제품을 가리키며"이거 얼마야?"라고 묻습니다. 비서는 물건을 식별하고 쇼핑 앱을 열어 가격을 찾아 당신에게 읽어줍니다.
- 원터치 비디오: "내 앵무새 사진으로 비디오 만들어줘"라고 말합니다. 비서는 도서관에서 어떤 사진이 앵무새인지 기억하고, 비디오 편집 앱을 열어 해당 사진들을 자동으로 선택하여 비디오 제작을 시작합니다.
- 순간 포털: 찾기 어려운 특정 세일 페이지로 가고 싶다면, 한 번만 비서에게 경로를 가르쳐 주면 됩니다. 이제"플래시 세일"이라고 말하기만 하면, 비서는 즉시 당신을 그곳으로 순간이동시킵니다.
결론
X-OmniClaw 는 단순히 당신과 대화하는 것이 아니라, 당신의 폰을 능동적으로 관리하고, 당신의 습관을 배우며, 보고, 듣고, 기억하는 것을 결합하여 복잡한 작업을 수행하는 차세대 개인 비서의 청사진입니다. 이는 당신의 폰을 당신이 조작하는 도구가 아니라 당신의 삶을 이해하는 파트너처럼 느끼게 하는 것을 목표로 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.