← 최신 논문
💬 NLP

MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

원저자: Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신의 삶을 관리해 줄 개인 비서를 채용한다고 상상해 보십시오. 당신은 그들에게 아무런 파일도, 사진도, 당신이 누구인지에 대한 기억도 없는, 완전히 비어 있는 새 책상을 주지는 않을 것입니다. 그렇지 않나요? 당신은 그가 당신이 가장 좋아하는 커피숍, 당신의 은행 잔고, 다가오는 휴가, 그리고 친구의 생일을 알고 있기를 기대할 것입니다.

문제점: "빈 책상" 테스트
현재 우리가 AI 컴퓨터가 개인 비서로서 충분히 똑똑한지 확인하기 위해 사용하는 테스트들은 마치 그 빈 책상을 주는 것과 같습니다. AI는 기록도 없고, 로그인된 계정도 없으며, 개인 데이터도 없는 컴퓨터에서 작업을 수행하도록 요청받습니다. 이는 누군가에게 "평소 먹던 저녁을 주문해 줘"라고 요청하면서, 정작 그 사람이 누구인지, 평소에 무엇을 주문하는지는 전혀 모르는 상태와 같습니다.

이 논문은 이것이 거대한 간극이라고 주장합니다. 진정한 개인 비서는 복잡하고, 서로 연결되어 있으며, 개인적인 역사가 가득한 디지털 삶을 탐색해야 합니다.

해결책: MYPCBENCH (The "Michael Scott" 시뮬레이션)
이를 해결하기 위해 연구진은 MYPCBENCH라는 새로운 테스트를 구축했습니다. 빈 책상 대신, 그들은 특정 캐릭터의 완전히 채워진 디지털 삶을 만들었습니다. 바로 드라마 *더 오피스(The Office)*의 캐릭터인 **마이클 스콧(Michael Scott)**입니다.

이것을 다음과 같은 거대하고 상호작용적인 비디오 게임 세계를 구축하는 것이라고 생각하십시오:

  • 캐릭터: 마이클 스콧은 "사용자"입니다.
  • 데이터: 컴퓨터에는 1,812건의 은행 거래 내역, 2,398통의 이메일, 679개의 캘린더 일정, 그리고 수천 개의 채팅 메시지가 미리 로드되어 있습니다.
  • 앱: 17개의 서로 다른 "가짜" 웹사이트(가짜 은행, 가짜 항공사, 가짜 음식 배달 앱 등)가 모두 연결되어 있습니다. 만약 마이클이 가짜 항공사에서 항공권을 예약하면, 그의 가짜 은행 내역에 자동으로 결제 내역이 나타나고, 확인 이메일이 그의 가짜 편지함에 도착합니다.
  • 목표: AI는 마이클의 비서로서 행동하며, 그의 특정 이력을 사용하여 문제를 해결하기 위해 이 앱들을 탐색해야 합니다.

테스트: 184가지의 현실 세계 도전 과제
연구진은 사람들이 실제로 AI 비서에게 요청하는 실제 요청들을 바탕으로 184개의 구체적인 과제를 만들었습니다. 이 과제들은 단순한 것부터 매우 복잡한 것까지 다양합니다:

  • 단순 작업: "Zelle을 통해 팜(Pam)에게 100달러를 보내줘." (AI는 먼저 연락처에 팜이 있는지 확인해야 합니다).
  • 복잡한 작업: "자메이카와 바베이도스 여행이 예약되어 있어. 현재 내 신용카드 잔액으로 둘 다 갈 수 있을까?" (AI는 은행 앱, 여행 앱을 살펴보고 수학 계산을 해야 합니다).
  • 패턴 찾기: "내가 음식 배달을 시킬 때 보통 팁을 얼마나 주지?" (AI는 수백 개의 과거 주문 내역을 스캔하여 패턴을 찾아야 합니다).

결과: AI는 "현실 세계"에서 고전하다
연구진은 현존하는 가장 똑똑한 AI 모델 6개(Anthropic, OpenAI 등의 기업 제품)를 이 테스트로 테스트했습니다. 결과는 다음과 같았습니다:

  1. 최고의 성과: 가장 뛰어난 모델(Claude Opus 4.6)은 약 **55%**의 과제를 완벽하게 해결했습니다. 수치상으로는 좋아 보이지만, 기억하십시오, 이것이 현재 사용 가능한 최고의 AI라는 점입니다. 즉, 여전히 거의 절반의 과제에서 실패했다는 뜻입니다.
  2. "멀티 앱" 문제: AI는 여러 개의 앱을 사용해야 할 때 성능이 현저히 떨어졌습니다. 과제를 수행하기 위해 7개 이상의 서로 다른 앱(예: 이메일 확인, 그다음 캘린더, 그다음 은행, 그다음 여행 사이트 순으로 이동)을 넘나들어야 할 때, 대부분의 모델의 성공률은 **0%**로 떨어졌습니다.
  3. "긴 기억력" 문제: AI는 긴 일련의 동작들을 추적하는 데 어려움을 겪었습니다. 만약 과제가 50단계를 요구한다면, AI는 종종 길을 잃거나 포기했습니다.
  4. 서로 다른 실패 유형:
    • 일부 AI(GPT 등)는 실제로 일을 끝내기도 전에 "다 했습니다"라고 말하며 너무 일찍 포기하는 경향이 있었습니다.
    • 일부 AI(Qwen 등)는 마이클 스콧에 대한 데이터를 조작하여, 데이터에 없는 사실을 지어내는 등 내용을 꾸며내기 시작했습니다.
    • 최고의 AI(Claude)는 일반적인 사람처럼 메뉴를 클릭하는 대신, 컴퓨터의 명령줄(Command Line)을 사용하는 해커처럼 지름길을 택하기도 했습니다.

핵심 요약
이 논문은 AI가 컴퓨터를 사용하는 능력은 향고 있지만, 아직 진정한 "개인적" 비서가 되기에는 준비가 되지 않았다고 결론짓습니다. AI는 깨끗하고 단순한 작업은 처리할 수 있지만, 개인적인 역사가 담긴 복잡하고 서로 연결된 현실 세계의 디지털 삶을 탐색해야 할 때는 무너집니다.

연구진은 다른 과학자들이 실제 인간의 디지털 삶의 복잡성을 처리할 수 있는 더 나은 비서를 만들 수 있도록, 이 테스트 환경(마이클 스콧의 컴퓨터)을 대중에게 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →