OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
본 논문은 계획 및 반성을 위한 과도한 모델 호출로 인해 현재 컴퓨터 사용 에이전트가 인간에 비해 2.7 배에서 4.3 배 더 많은 단계를 소요하여 작업을 완료하는 등 금지적 수준의 지연과 비효율성을 겪고 있음을 드러내는 수동으로 주석된 벤치마크인 OSWorld-Human 을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
가정해 보세요. 매우 똑똑하지만 놀라울 정도로 느린 개인 비서를 고용하여 문서의 글꼴 크기를 변경하는 것과 같은 간단한 작업을 컴퓨터에서 수행하도록 시켰다고 말입니다. 30 초가 걸릴 것으로 예상했는데, 대신 비서는 12 분을 소요합니다. 왜일까요?
이 논문인 OSWorld-Human은 정확히 그 문제를 조사합니다. 이 연구는 "컴퓨터 사용 에이전트"(마우스와 키보드를 제어하는 AI 프로그램) 를 살펴보고 **"왜 그들이 그렇게 느린가, 그리고 어떻게 더 빠르게 만들 수 있는가?"**를 묻습니다.
다음은 그들의 발견 사항을 간단한 비유로 정리한 것입니다.
1. 문제: "과도하게 생각하는" 비서
연구자들은 이러한 AI 에이전트들이 일을 수행하는 능력(정확도) 은 나아지고 있지만, 얼마나 빠르게 수행하는가(효율성) 에 대해서는 매우 형편없다는 사실을 발견했습니다.
- 인간 대 로봇: 인간 전문가는 문서의 줄 간격을 30 초 미만으로 변경할 수 있습니다. 반면 AI 에이전트는 12 분이 걸립니다.
- 병목 현상: 지연은 AI 가 마우스를 천천히 클릭하기 때문이 아닙니다. AI 가 끊임없이 생각하기 위해 멈추기 때문입니다.
- 비유: 당신이 식료품점에 운전하고 있다고 상상해 보세요. 인간 운전자는 그냥 운전합니다. 하지만 이 AI 운전자는 모든 교차로마다 멈춰서 초지능 컨설턴트에게 전화를 걸어 "이게 올바른 방향인가? 왼쪽으로 돌아야 하나? 왼쪽으로 올바르게 돌아갔는가? 다음 방향은 어떨까?"라고 묻습니다.
- 현실: AI 는 다음 행동을 계획하고, 그 행동이 성공했는지 판단하며, 무슨 일이 있었는지 반성하기 위해 거대한 "두뇌"(대규모 언어 모델) 에 전화를 겁니다. 이러한 전화 통화가 가장 많은 시간을 차지합니다. 실제로 "계획"과 "판단" 단계만으로도 전체 시간의 약 **75% 에서 96%**를 차지합니다!
2. 조사: 단계별 분석
연구자들은 두 가지 인기 있는 AI 에이전트 (Agent S2 와 GTA1) 가 39 가지의 다양한 컴퓨터 작업을 해결하는 과정을 지켜보며, 과정의 모든 초를 세분화했습니다.
- "생각" 세금: AI 가 한 걸음을 내디딜 때마다 거대한 메시지를 두뇌로 보내야 합니다. 작업이 길어질수록 메시지도 커지는데, 이는 이전에 수행한 모든 작업의 기록을 포함해야 하기 때문입니다.
- 비유: 일기를 쓰는 것과 같습니다. 1 일차에는 한 문장을 씁니다. 하지만 50 일차에는 새로운 문장을 하나 추가하기 위해 1 일차부터 전체 책을 다시 써야 합니다. 이로 인해 후속 단계는 초기 단계보다 3 배 더 오래 걸립니다.
- "잘못된 방향" 루프: 때때로 AI 는 무엇을 해야 하는지 (예: "열기 버튼 클릭") 는 알지만, 화면에서 어디를 클릭해야 하는지 찾지 못합니다. 잘못된 곳을 클릭하고, 그것이 잘못임을 깨닫고 다시 시도합니다.
- 비용: 이러한 "막히기"는 자주 발생합니다. 한 사례에서 AI 는 폴더를 열려고 시도했다가 27 분 동안 루프에 갇혔으며, 화면의 올바른 위치를 찾지 못해 단순히 8.47 달러의 컴퓨팅 비용을 낭비했습니다.
3. 해결책: "인간 벤치마크" (OSWorld-Human)
이러한 로봇들이 얼마나 비효율적인지 증명하기 위해 연구자들은 OSWorld-Human이라는 새로운 벤치마크를 만들었습니다.
- 그것은 무엇인가? 연구자들은 369 개의 모든 작업을 수동으로 수행하며 인간이 완료하기 위해 취할 가장 짧고 논리적인 경로를 기록했습니다.
- "그룹화" 트릭: 연구자들은 인간이 종종 멈춰서 생각하지 않고 여러 가지를 한 번에 수행한다는 사실을 발견했습니다.
- 비유: 인간은 텍스트 상자를 보고 이름을 입력한 후 "Enter"를 누르는 것을 하나의 매끄러운 동작으로 수행합니다. 반면 AI 는 상자를 본 후 멈춰서 두뇌를 불러와 입력을 계획하고, 다시 멈춰서 "Enter" 누르기를 계획하며, 다시 두뇌를 부릅니다.
- 발견: 연구자들은 많은 동작들을 "그룹화"할 수 있음을 발견했습니다. 만약 AI 가 세 번의 클릭을 하나의 "생각"으로 수행할 수 있다면 막대한 시간을 절약할 수 있을 것입니다.
4. 결론: 로봇들은 불필요한 단계를 낭비하고 있습니다
연구자들은 16 가지의 서로 다른 AI 에이전트를 새로운 "인간 벤치마크"와 비교하여 테스트했습니다.
- 결과: 가장 뛰어난 AI 에이전트조차도 인간이 동일한 작업을 완료하는 데 필요한 단계보다 2.7 배에서 4.3 배 더 많은 단계를 사용했습니다.
- 점수: 연구자들은 **가중 효율성 점수 (Weighted Efficiency Score, WES)**라는 새로운 점수를 만들었습니다.
- AI 가 일을 완료하더라도 필요한 시간보다 4 배 더 오래 걸리면 점수가 급격히 떨어집니다.
- 기존 테스트에서는 훌륭해 보였던 리더보드 상위 AI 는 이 새로운 효율성 테스트에서 **15.6%**의 점수만 받았습니다. 이는 불필요한 작업을 많이 수행하고 있다는 의미입니다.
요약
이 논문은 현재의 AI 컴퓨터 에이전트들을 훌륭하지만 서투른 학생들과 같다고 결론 내립니다. 그들은 정답을 알고 있지만, 손을 들고, 선생님을 기다리고, 노트를 다시 읽는 데 너무 많은 시간을 보내서 시험을 제시간에 끝내지 못합니다.
이를 해결하기 위해 논문은 세 가지 주요 사항을 제안합니다:
- 과도한 생각 멈추기: AI 가 "두뇌"를 불러와 계획하고 판단하는 횟수를 줄입니다.
- 동작 그룹화: AI 가 입력과 엔터 키 누르기 같은 여러 단계를 하나의 생각으로 수행하도록 합니다.
- 찾기 능력 향상: AI 가 어디를 클릭해야 하는지 정확히 파악하여 루프에 갇히지 않도록 능력을 개선합니다.
목표는 단순히 AI 를 더 똑똑하게 만드는 것이 아니라, 실제 세계에서의 사용을 위해 더 빠르고 실용적으로 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.