← 최신 논문
🤖 AI

Computer Use at the Edge of the Statistical Precipice

본 논문은 비원칙적인 환경 설계와 방법론으로 인해 발생한 현재 컴퓨터 사용 에이전트 평가의 치명적 결함을 규명하고, 의미 있는 연구의 전제 조건을 확립하기 위해 PRISM 설계 프레임워크, DigiWorld 벤치마크, 그리고 엄격한 통계적 집계 방법을 제안합니다.

원저자: Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tighe

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tighe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 직원을 고용하여 바쁜 사무실을 관리하게 하려 한다고 상상해 보세요. 당신은 그 사람이 실제로 똑똑하고 적응력이 뛰어난지, 아니면 특정 연습 시험의 답을 단순히 외워 두었을 뿐인지 알고 싶어 합니다.

메타의 연구원들이 작성한 이 논문은 '컴퓨터 사용 에이전트'(마치 인간처럼 버튼을 클릭하고, 타이핑하며, 앱을 탐색할 수 있는 AI) 를 평가하는 현재의 방식이 결함이 있다고 주장합니다. 이는 미리 정답 키를 훑어볼 수 있는 시험을 바탕으로 사람을 채용하는 것과 같습니다.

여기서 간단한 비유를 통해 문제와 그들의 해결책을 살펴보겠습니다.

문제: '치트 시트'의 함정

1. '맹목적 재생' 속임수
연구원들은 현재 시험에 치명적인 결함이 있음을 발견했습니다. 그들은 심지어 화면을 '보지'도 않는 매우 간단한 컴퓨터 스크립트 (크기가 1MB 로 단일 사진보다 작음) 를 사용했습니다. 이 스크립트는 이전에 초지능 AI 가 시험을 통과할 때 사용한 순서와 정확히 동일한 버튼을 정확히 동일한 순서로 맹목적으로 클릭했을 뿐입니다.

  • 결과: 현재 인기 있는 시험들에서, 이 '맹목적 스크립트'는 최첨단 AI 모델들보다 실제로 더 높은 점수를 받았습니다.
  • 비유: 한 학생이 수학 시험을 치른다고 상상해 보세요. 문제를 풀지 않고, 이전 버전의 시험에서 작동했던 계산기의 버튼 누름 순서만 외웠다면, 시험 문제가 결코 변하지 않는다면 그 학생은 수학을 전혀 모른 채 100% 를 받을 수 있습니다. 현재의 AI 벤치마크는 바로 그런 변하지 않는 시험과 같습니다. AI 가 '생각'하는 것이 아니라 단지 경로를 '기억'하고 있을 뿐입니다.

2. '동전 던지기' 오류
두 번째 문제는 연구원들이 점수를 계산하는 방식입니다. 그들은 종종 모든 시험 시도를 동전 던지기처럼 완전히 독립적인 사건으로 취급합니다.

  • 비유: 만약 10 개의 서로 다른 앱을 탐색하도록 한 사람에게 3 번 실패했다면, 단순 평균은 그 사람이 70% 는 잘한다고 말합니다. 하지만 그 3 번의 실패가 모두 혼란스러운 그 특정 앱 때문이었다면, 단순 평균은 그 사람이 사실은 그 특정 앱에서는 매우 형편없다는 사실을 숨깁니다. 현재의 방법들은 이러한 패턴을 무시하여 순위 매기기를 신뢰할 수 없게 만듭니다.

해결책: PRISM 과 DigiWorld

이를 해결하기 위해 팀은 PRISM이라는 새로운 규칙 세트를 제안하고 DigiWorld라는 새로운 시험장을 구축했습니다.

PRISM: 공정한 시험을 위한 다섯 가지 규칙
PRISM 을 공정한 AI 시험을 구축하기 위한 '헌법'으로 생각하세요.

  1. 특권 검증: 인간 (또는 다른 AI) 에게 스크린샷을 보여주고 작업이 완료되었는지 추측하게 하는 대신, 시험은 컴퓨터의 내부 메모리를 직접 확인합니다. 이는 은행 점원에게 일이 일어났는지 물어보는 것이 아니라, 돈이 이체되었는지 확인하기 위해 은행 장부를 직접 확인하는 것과 같습니다.
  2. 현실적인 환경: 시험은 만화처럼 단순화된 버전이 아닌 실제 세계의 앱을 사용해야 합니다. 장난감 자동차 트랙에서 운전자를 테스트하고 실제 고속도로를 다룰 수 있을 것이라고 기대할 수는 없습니다.
  3. 무결성 확인 구성: 시험이 시작되기 전에 시스템이 자동으로 작업이 실제로 가능한지 확인합니다. 이는 '은행 계좌'에 이체할 돈이 있거나 보낼 '이메일'이 존재하는지 보장합니다. 고장 난 작업은 허용되지 않습니다.
  4. 샌드박스 실행: 시험은 밀폐되고 통제된 상자 내에서 이루어져야 합니다. 매일 변하는 라이브 인터넷에 의존해서는 안 됩니다. 만약 시험이 라이브 웹사이트에 의존한다면, 웹사이트 디자인이 업데이트될 때마다 결과도 변하게 됩니다.
  5. 다요인 변이성: 이것이 가장 중요한 규칙입니다. 시험은 매번 변수를 바꿔야 합니다.
    • 비유: 맑은 날 직선 도로에서만 운전을 테스트한다면, 비가 오거나 구불구불한 산길에서 운전할 수 있는지 알 수 없습니다. DigiWorld 는 모든 시도마다 '날씨'(시각적 테마), '교통'(데이터 내용), 그리고 '시작점'(화면 상태) 을 변경합니다. 이는 AI 가 경로를 외우는 것이 아니라 실제로 보고 추론하도록 강제합니다.

DigiWorld: 새로운 시험 트랙
연구원들은 15 개의 현실적인 모바일 앱 (뱅킹, 쇼핑, 여행 등) 으로 구성된 벤치마크인 DigiWorld를 구축했습니다.

  • '다요인' 규칙 덕분에 그들은 모든 작업의 320 만 개 이상의 고유한 버전을 생성할 수 있습니다.
  • 결과: 그들이 '맹목적 재생' 스크립트를 DigiWorld 에서 실행했을 때, 그 스크립트는 처참하게 실패했습니다 (점수 6.9%). 스크립트는 320 만 개의 서로 다른 경로를 외울 수 없었습니다. 이는 DigiWorld 가 AI 가 단순히 '기억'할 수 있는지 여부가 아니라 실제로 '생각'할 수 있는지 여부를 실제로 테스트한다는 것을 증명했습니다.

점수를 계산하는 새로운 방법

마지막으로, 이 논문은 최종 등급을 계산하는 더 나은 방법을 소개합니다. 단순 평균 대신 계층적 부트스트랩을 사용합니다.

  • 비유: 15 명의 다른 심사위원이 있는 요리 대회를 심사한다고 상상해 보세요. 모든 점수의 단순 평균만 내면, 한 심사위원은 '엄격한 채점자'이고 다른 한 명은 '관대한 채점자'라는 사실을 놓칠 수 있습니다.
  • 새로운 방법은 시험의 구조를 살펴봅니다: 점수를 앱별로, 그다음 시나리오별로, 그리고 특정 설정별로 그룹화합니다. 이는 단일 숫자 대신 '신뢰 구간'을 생성하기 위해 통계적 기법 (윌슨 점수 구간) 을 사용합니다. 이는 "이 AI 가 45% 잘한다"라고 말하는 대신, "우리는 이 AI 가 40% 에서 50% 사이에서 잘한다는 것을 95% 확신한다"라고 알려줍니다.

결론

이 논문은 현재 AI 순위는 신뢰할 수 없다고 결론 내립니다. 왜냐하면 시험은 사기 치기 너무 쉽고, 이를 채점하는 수학은 너무 단순하기 때문입니다. AI 가 실제로 현실 세계에 준비되었는지 알기 위해서는 DigiWorld(암기 실패를 유도하기 위해 끊임없이 변하는 시험) 와 PRISM(시험이 공정하고, 현실적이며, 통계적으로 타당하도록 보장하는 규칙 세트) 이 필요합니다. 이 것들이 없다면, 우리는 AI 가 얼마나 잘 일할 수 있는지 측정하는 것이 아니라, 얼마나 잘 사기를 칠 수 있는지 측정하는 것뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →