← 최신 논문
💬 NLP

VisualClaw: A Real-Time, Personalized Agent for the Physical World

VisualClaw는 하이브리드 인코딩을 활용하여 API 비용과 지연 시간을 획기적으로 줄이는 동시에 실패로부터 지속적으로 학습하여 정확도를 개선하는 자기 진화형 실시간 멀티모달 에이전트이며, 이는 표준 비디오-QA 벤치마크와 VisualClawArena라고 불리는 새로운 에이전트 워크스페이스 벤치마크를 통해 검증되었습니다.

원저자: Haoqin Tu, Jianwen Chen, Zijun Wang, Siwei Han, Juncheng Wu, Hardy Chen, Haonian Ji, Kaiwen Xiong, Jiaqi Liu, Peng Xia, Jieru Mei, Hongliang Fei, Jason Eshraghian, Zeyu Zheng, Yuyin Zhou, Huaxiu Yao
게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haoqin Tu, Jianwen Chen, Zijun Wang, Siwei Han, Juncheng Wu, Hardy Chen, Haonian Ji, Kaiwen Xiong, Jiaqi Liu, Peng Xia, Jieru Mei, Hongliang Fei, Jason Eshraghian, Zeyu Zheng, Yuyin Zhou, Huaxiu Yao, Cihang Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 비디오를 보고, 문서를 읽고, 컴퓨터 도구를 사용하여 문제를 해결할 수 있는 초지능형 비서(AI)가 있다고 상상해 보세요. 이 논문은 이 비서의 새로운 버전인 VisualClaw를 소개합니다.

이 저자들이 해결하려는 주요 문제는 현재의 AI 비서들이 마치 의욕만 앞선 관광객 같다는 점입니다. 그들은 비디오의 모든 초를 보려고 하고, 매뉴얼의 모든 단어를 읽으려 하며, 아주 사소한 디테일에 대해서도 "두뇌"(AI 모델)에 도움을 요청합니다. 이는 엄청나게 비용이 많이 들고 느리며, 정보가 너무 많아 AI를 혼란스럽게 만듭니다.

VisualClaw는 무엇에 집중해야 할지 정확히 알고 시간이 지남에 따라 더 똑똑해지는 법을 아는 스마트하고 숙련된 가이드처럼 행동함으로써 이 문제를 해결합니다. 작동 방식은 세 가지 간단한 부분으로 나뉩니다.

1. "스마트 필터" (비용과 시간 절약)

당신이 숲속을 걷는 30분짜리 영상을 보고 있다고 상상해 보세요.

  • 기존 방식: AI는 모든 프레임(매 순간의 이미지)을 분석하려고 시도합니다. 이는 마치 사람에게 카메라가 움직이지 않을 때조차 나무에 달린 모든 잎사귀를 묘사하라고 요구하는 것과 같습니다. 이는 엄청난 컴퓨팅 자원을 소모합니다.
  • VisualClaw 방식: VisualClaw는 영상이 클라우드에 도달하기 전, 당신의 기기(안경이나 스마트폰 등)에서 실행되는 "스마트 필터"를 가지고 있습니다. 이것은 박물관의 보안 요원처럼 작동합니다.
    • 카메라가 약간 흔들리거나 장면이 정지해 있다면, 보안 요원은 "이 부분은 건너뛰세요, 새로운 내용이 없습니다"라고 말합니다.
    • 카메라가 코너를 돌거나 중요한 일이 발생하면, 보안 요원은 "멈추세요! 이것은 핵심적인 순간입니다. 이 프레임을 상사에게 보내세요"라고 말합니다.
    • 결과: 30분짜리 영상에서 1,800개의 프레임을 보내는 대신, 단 5~6개만 보낼 수 있습니다. 이는 비용을 98% 절감하며, AI 안경과 같은 실시간 기기에서 실행될 수 있을 만큼 시스템을 빠르게 만듭니다.

2. "살아있는 핸드북" (재설계 없이 똑똑해지기)

대부분의 AI 모델은 얼어붙은 조각상과 같습니다. 일단 만들어지면, 완전히 새로 구축하지 않고서는 실수로부터 배울 수 없습니다(이는 어렵고 비용이 많이 듭니다).

  • 기존 방식: AI가 작업에 실패하면, 그냥 실패한 채로 남습니다. 다음번에도 똑같은 일을 시도하고 다시 실패합니다.
  • VisualClaw 방식: VisualClaw는 살아있는 핸드북("기술 뱅크")을 보관합니다.
    • AI가 실수를 하면, 별도의 "코치"(오프라인 진화기)가 무엇이 잘못되었는지 살펴봅니다.
    • 코치는 새로운 규칙이나 팁을 핸드북에 작성합니다 (예: "로프를 잡을 때는 항상 안정성을 먼저 확인하세요").
    • 다음번에 AI는 답변하기 전에 이 핸드북을 확인합니다. 뇌를 바꿀 필요 없이, 그저 더 나은 지침서를 읽는 것입니다.
    • "핫/콜드(Hot/Cold)" 기술: 핸드북이 너무 무거워지는 것을 방지하기 위해, VisualCl우는 지금 당장 가장 관련성이 높은 상위 5개의 팁(Hot)만을 AI에게 보여주고, 나머지는 만약을 대비해 선반 위에**(Cold)** 둡니다. 이를 통해 AI를 빠르고 집중력 있게 유지합니다.

3. "연습 경기장" (실제 세상에서의 테스트)

저자들은 이러한 AI를 위한 표준 테스트들이 단순히 답을 고르는 객관식 퀴즈와 같다는 점을 깨달았습니다. 하지만 실제 세상에서 AI는 파일을 열고, 문서를 편집하고, 자신의 작업이 올바른지 확인하는 등 실제로 무언가를 해야 합니다.

  • 이를 해결하기 위해, 그들은 VisualClawArena라는 새로운 테스트를 만들었습니다.
  • 이것을 AI가 다음을 수행해야 하는 비디오 게임 레벨이라고 생각하세요:
    1. 비디오 클립을 시청한다.
    2. 채팅 로그나 문서를 읽는다.
    3. 컴퓨터의 파일을 연다.
    4. 실수를 수정하거나 보고서를 작성한다.
    5. 일을 제대로 수행했음을 증명하는 "체크"를 통과한다.
  • 이것은 AI가 단순히 정답을 맞히는 것이 아니라, 비디오 증거를 사용하여 실제 문제를 해결할 수 있는지 테스트합니다.

결과: 어떤 일이 일 있었나?

VisualClaw를 테스트했을 때:

  • 더 똑똑해졌습니다: 과거의 실패로부터 배우는 "살아있는 핸드북" 덕분에 대부분의 테스트에서 AI의 정확도가 높아졌습니다.
  • 더 저렴해졌습니다: "스마트 필터"가 쓸모없는 비디오 프레임을 보내지 않도록 차단했기 때문에, 긴 영상을 실행하는 데 드는 비용이 거의 99% 감소했습니다.
  • 실제 세상에서 작동합니다: 새로운 "Arena" 테스트에서, 배우고 진화할 수 있는 AI(VisualClaw)가 표준 AI를 상당한 차이로 앞질렀으며, 이는 이 방법이 복잡하고 다단계적인 작업을 처리하는 데 도움이 된다는 것을 입증했습니다.

요약하자면: VisualClaw는 모든 것을 쳐다보지 않고(비용 절감), 실수로부터 얻은 교훈을 노트에 기록하며(학습), 자신이 실제 업무를 처리할 수 있음을 증명하기 위해 현실적인 시뮬레이션에서 연습하는 AI 비서입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →