← 최신 논문
🤖 AI

MMSkills: Towards Multimodal Skills for General Visual Agents

본 논문은 텍스트 기반 기술 표현의 한계를 극복하기 위해 텍스트 절차와 상태 조건부 시각 증거를 결합하여 재사용 가능한 멀티모달 절차적 지식을 형식화하고 구현함으로써 일반 시각 에이전트의 런타임 의사결정 능력을 향상시키는 MMSkills 라는 프레임워크를 제시합니다.

원저자: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "MMSkills: 범용 시각 에이전트를 위한 멀티모달 기술" 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어낸 것입니다.

핵심 아이디어: 로봇에게 인간처럼 '보는' 법을 가르치기

로봇에게 컴퓨터 사용법을 가르친다고 상상해 보세요.

  • 옛날 방식 (텍스트만 있는 기술): 로봇에게 글로 된 레시피를 줍니다. "'파일' 메뉴를 클릭한 다음 '새로 만들기', 그다음 '시트'를 선택하세요."
    • 문제점: 로봇이 잘못된 화면에 있거나, 팝업 창이 메뉴를 가리고 있다면 로봇은 텍스트를 맹목적으로 따릅니다. 메뉴가 없는데도 '파일'을 클릭하고, 멈춰서 실패합니다. 로봇은 무엇을 해야 하는지는 알지만, 언제 해야 하는지, 혹은 완료되었을 때 어떻게 보이는지는 모릅니다.
  • 새로운 방식 (MMSkills): 로봇에게 '스마트 가이드'를 줍니다. 이 가이드에는 텍스트뿐만 아니라 각 단계에서 화면이 어떻게 보여야 하는지에 대한 사진과 로봇이 올바른 길에 있는지 확인하는 체크리스트도 포함되어 있습니다.

이 논문은 이러한 '스마트 가이드'를 컴퓨터를 사용하거나 게임을 하는 AI 에이전트 (로봇) 를 위한 재사용 가능한 도구로 변환하는 시스템인 MMSkills를 소개합니다.


그들이 해결한 세 가지 주요 문제

저자들은 이러한 스마트 가이드가 작동하도록 만드는 데 있어 세 가지 큰 장애물을 파악했습니다.

  1. 패키지 안에 무엇이 들어갈까요?

    • 비유: 누군가에게 케이크 굽는 법을 가르친다면, 글로 된 레시피만으로는 부족합니다. 반죽이 준비되었는지 알기 위한 반죽 사진, 오븐이 뜨겁다는 것을 알기 위한 오븐 사진, 그리고 계란을 잊지 않았는지 확인하는 체크리스트가 필요합니다.
    • 해결책: MMSkill 패키지에는 세 가지 요소가 포함됩니다.
      • 텍스트: 단계별 지시사항.
      • 상태 카드 (State Cards): '교통 신호등' 시스템입니다. 에이전트에게 "파란색 단추를 볼 때만 진행하세요" 또는 "빨간색 오류 메시지가 보이면 멈추세요! 클릭하지 마세요"라고 알려줍니다.
      • 시각적 증거: 중요한 순간에 화면이 정확히 어떻게 보여야 하는지를 보여주는 사진 (키 프레임) 입니다. 예를 들어 '전'과 '후' 샷입니다.
  2. 이러한 가이드를 어디서 구할까요?

    • 비유: 케이크 하나하나마다 새로운 레시피를 작성할 인간을 고용하고 싶지 않습니다. 대신 사람들이 케이크를 굽는 것을 관찰하고, 공통된 단계를 파악한 뒤, 일반적인 레시피를 직접 작성하고 싶을 것입니다.
    • 해결책: 그들은 자동화된 '생성기 (Generator)'를 구축했습니다. 이 생성기는 사람들이 컴퓨터를 사용하는 수천 개의 공개 영상 (궤적) 을 관찰하고, 유사한 작업들을 그룹화한 뒤, 자동으로 이러한 스마트 가이드를 작성합니다. 단순히 영상을 복사하는 것이 아니라, 논리시각적 단서를 추출합니다.
  3. 로봇이 혼란스러워지지 않고 이를 어떻게 사용할까요?

    • 비유: 차를 운전하면서 50 페이지 분량의 거대한 사진 앨범을 읽으려 한다고 상상해 보세요. 산만하고 위험합니다. 로봇이 옛날 사진에 너무 집중하다 보면 실제 세계와 충돌할 수 있습니다.
    • 해결책: 그들은 **'분기 로딩 (Branch Loading)'**을 고안했습니다.
      • 전체 사진 앨범을 로봇의 주뇌에 밀어 넣는 대신, 로봇은 **임시 사이드 창 (분기)**을 엽니다.
      • 이 사이드 창에서 로봇은 결정을 내리기 위해 지금 당장 필요한 특정 사진만 빠르게 살펴봅니다.
      • 그런 다음 사이드 창을 닫고 주 로봇에게 말합니다. "알겠습니다, 사진을 확인했습니다. 당신은 올바른 길에 있습니다. 이제 단추를 클릭하세요."
      • 이렇게 하면 주 로봇은 과거의 참조 사진이 아닌 실시간 화면에 집중하게 됩니다.

실제 생활에서의 작동 방식 (예: '차트' 만들기)

이 논문은 이것이 왜 더 나은지 보여주기 위해 구체적인 예를 사용합니다: 스프레드시트에서 차트 만들기.

  • 상황: 작업은 "시트 2에서 차트 만들기"입니다.
  • 텍스트만 있는 에이전트: "차트 만들기"를 읽습니다. 차트가 만들어지는 것을 보고 "완료"를 클릭합니다.
    • 결과: 텍스트가 어떤 시트가 활성화되어 있는지 확인하라고 말해주지 않았기 때문에 시트 1에 차트를 만들었습니다 (잘못된 시트). 점수: 0.
  • MMSkills 에이전트:
    1. "차트 만들기" 기술을 로드합니다.
    2. 상태 카드는 이렇게 말합니다: "확인: 활성 시트 이름이 '시트 2'인가요?"
    3. 시각적 증거는 올바른 시트 탭의 사진을 보여줍니다.
    4. 로봇은 현재 시트 1 에 있음을 발견합니다. '분기'는 말합니다: "기다려! 당신은 잘못된 시트에 있습니다. 먼저 시트 2 로 전환하세요."
    5. 로봇은 전환하고, 차트를 만든 뒤, 제목이 사진과 일치하는지 확인합니다.
    • 결과: 올바른 시트에 완벽한 차트가 생성됨. 점수: 1.

결과가 보여준 것

연구자들은 두 가지 유형의 작업에서 이를 테스트했습니다.

  1. 데스크톱 작업: 엑셀, 크롬, 워드 사용 (OSWorld, macOSWorld).
  2. 게임 작업: 마인크래프트나 슈퍼 마리오 브라더스 플레이.

주요 발견:

  • 더 높은 성공률: MMSkills를 사용하는 로봇은 기술이 없거나 텍스트 기술만 있는 로봇보다 훨씬 더 많은 작업을 성공적으로 해결했습니다.
  • 작은 로봇도 도움됨: 시각 가이드를 제공받으면 작고 덜 강력한 AI 모델들도 작업 수행 능력이 크게 향상되었습니다.
  • 오류 감소: 로봇은 같은 단추를 10 번 클릭하는 것과 같은 반복적인 실수를 줄이고 작업을 더 빠르게 완료했습니다.
  • 컴퓨터뿐만이 아님: 이 시스템은 비디오 게임에서도 똑같이 잘 작동했습니다. 이는 파일을 관리하든 장애물을 뛰어넘든 '상태를 보는 것'이 중요하다는 것을 증명합니다.

요약

MMSkills는 AI 에이전트에게 무엇을 해야 하는지뿐만 아니라, 올바르게 하고 있는지 어떻게 인식할지를 가르치는 방법입니다. 텍스트 지시사항과 '교통 신호등' 체크리스트 및 특정 사진을 결합하고, 이를 보기 위해 '사이드 창' 방식을 사용함으로써, 이 시스템은 로봇이 길을 잃거나 혼란스러워하거나 잘못된 화면에 갇히는 것을 방지합니다. 이는 명령을 맹목적으로 따르는 로봇을, 작업 중인 시각적 세계를 실제로 이해하는 로봇으로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →