← 최신 논문
🤖 AI

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

본 논문은 애플리케이션별 상태 검증기, 자기 진화형 검증 계층, 작업 생성 파이프라인, 그리고 평가 하네스를 통합하여 컴퓨터 사용 에이전트를 위한 검증 가능한 소프트웨어 세계를 구축하는 검증기 기반 프레임워크인 OpenComputer 를 소개하며, 이를 통해 부분적인 진전에도 불구하고 현재 최첨단 및 오픈소스 에이전트의 견고성에서 상당한 격차가 있음을 드러냅니다.

원저자: Jinbiao Wei, Qianran Ma, Yilun Zhao, Xiao Zhou, Kangqi Ni, Guo Gan, Arman Cohan

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinbiao Wei, Qianran Ma, Yilun Zhao, Xiao Zhou, Kangqi Ni, Guo Gan, Arman Cohan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매일의 일상 업무를 수행하도록 로봇을 가르친다고 상상해 보세요. 예를 들어 디지털 파일을 정리하거나, 사진을 편집하거나, 이메일을 보내는 것처럼요. 당신은 로봇이 완벽하기를 원하지만, 어떻게 로봇이 실제로 일을 올바르게 수행했는지 알 수 있을까요?

이것이 바로 OpenComputer 논문이 다루는 문제입니다. 저자들은 컴퓨터를 사용하는 AI 에이전트를 위한 새로운 "훈련 체육관"을 구축했지만, 매우 구체적인 비틀기를 가했습니다: 그들은 로봇의 작업 결과만 보는 것이 아니라, 로봇의 숙제를 엄격하고 눈을 깜빡이지 않는 눈으로 점검합니다.

여기서 OpenComputer 가 어떻게 작동하는지 간단한 비유로 설명하겠습니다:

1. 문제: "만들기 전까지 속여라" 함정

과거에는 컴퓨터에서 AI 를 테스트하는 것이 학생의 에세이 표지판만 보고 채점하는 것과 같았습니다. 표지가 예쁘다면, 교사 (AI 심판) 가 A 를 줄 수도 있습니다. 하지만 학생은 실제 에세이를 비워두거나 뜬구름 잡는 말로 채웠을 수 있습니다.

디지털 세계에서는 AI 가 완성된 것처럼 보이는 문서의 스크린샷을 찍을 수 있지만, 파일 내부가 실제로 비어 있거나 설정이 잘못되었다면, "AI 심판"은 화면이 아닌 데이터만 보기 때문에 실수를 놓칠 수 있습니다.

2. 해결책: "디지털 검사관"

OpenComputer 는 검증 가능한 소프트웨어 세계를 구축함으로써 게임을 바꿉니다. 화면을 단순히 지켜보는 대신, AI 가 사용하는 모든 애플리케이션 내부에 전문 "검사관" ( 검증기라고 함) 팀을 설치합니다.

  • 검사관의 역할: 책 표지만 보는 도서관 사서가 아니라, 책을 열고 페이지 번호를 확인하며 저자 이름을 검증하고 텍스트가 도서관 데이터베이스와 일치하는지 확인하는 사서를 상상해 보세요.
  • 작동 방식: 웹 브라우저, 사진 편집기, 스프레드시트와 같은 각 앱마다 OpenComputer 는 앱의 "두뇌"와 직접 "대화"할 수 있는 맞춤형 스크립트를 구축합니다. *"파일이 실제로 저장되었는가?", "사용자가 정말로 그 버튼을 클릭했는가?", "텍스트가 올바른 셀에 있는가?"*와 같은 질문을 던집니다.

3. 4 단계 구축 과정

이 논문은 이러한 완벽한 테스트 시나리오를 구축하기 위한 4 단계 공장 라인을 설명합니다:

  • 1 단계: 검사관 구축. 그들은 모든 앱에 대한 "열쇠"를 만들어 시스템이 화면에서 추측하는 대신 소프트웨어의 숨겨진 상태 (파일, 설정, 기록) 를 엿볼 수 있게 합니다.
  • 2 단계: 자기 개선 루프. 그들은 이 검사관들을 "강력한" AI 로 테스트합니다. 검사관이 "잘했다"고 말하지만 AI 가 실제로 실수를 저지르면 시스템이 그 오류를 잡아냅니다. 그런 다음 검사관의 코드를 수정하여 다음을 위해 더 똑똑하게 만듭니다. 이는 코치가 선수가 연습하는 것을 지켜보다가 훈련 장비를 더 정확하게 조정하는 것과 같습니다.
  • 3 단계: 작업 생성. 검사관이 신뢰할 수 있게 되면, 시스템은 1,000 개의 현실적인 작업 (예: "이 50 개 파일을 정리하라" 또는 "이 사진을 편집하라") 을 생성합니다. 검사관이 준비되어 있기 때문에 모든 작업은 명확하고 기계가 확인할 수 있는 "합격" 또는 "불합격" 기준을 갖습니다.
  • 4 단계: 최종 시험. 그들은 AI 에이전트를 깨끗하고 새로운 디지털 방에서 실행합니다. 에이전트들이 작업을 해결하려 하면, 검사관들은 단순히 그림이 아닌 실제 데이터를 기반으로 즉석에서 채점을 합니다.

4. 발견한 점

이 새로운 체육관에서 GPT-5.4 와 Claude 와 같은 최첨단 AI 모델들을 테스트했을 때, 그들은 몇 가지 놀라운 사실을 발견했습니다:

  • "거의" 문제: 가장 똑똑한 AI 들조차 작업을 완벽하게 끝내는 데 어려움을 겪습니다. 그들은 종종 80% 는 성공하지만, 파일을 잘못된 폴더에 저장하는 것과 같은 사소한 마지막 세부 사항에서 실패합니다.
  • "가짜" 성공: 과거의 판단 방식 (AI 가 스크린샷을 보는 방식) 은 너무 관대했습니다. 성공한 것처럼 보이지만 실제로 데이터 검사를 통과하지 못한 에이전트들에게 높은 점수를 주었습니다. 새로운 "하드코딩된 검증기"는 훨씬 더 엄격하며 인간이 말할 것과 더 잘 부합했습니다.
  • 오픈소스 격차: 다른 테스트에서는 훌륭해 보였던 일부 오픈소스 모델들이 여기서는 갑자기 매우 나쁘게 수행했습니다. 이는 그들이 간단한 테스트에 대한 정답을 "추측"하는 데는 능숙했지만, 실제이고 복잡한 컴퓨터 소프트웨어의 복잡성을 처리하지는 못했다는 것을 시사합니다.

5. 큰 교훈

OpenComputer 는 단순히 작업 목록이 아닙니다. 그것은 진실에 대한 새로운 표준입니다.

AI 가 "내가 했다!"라고 말하는 "명예 시스템" 테스트에서, 로봇 감독이 정답 키와 모든 답을 하나씩 확인하는 "감독 시험"으로 이동하는 것이라고 생각하세요. 이 논문은 결론적으로 AI 가 화면을 보는 데는 점점 더 나아지고 있지만, 미묘하지만 치명적인 실수 없이 복잡한 현실 세계의 컴퓨터 작업을 신뢰할 수 있게 수행하기까지는 아직 갈 길이 멀다고 결론지었습니다.

간단히 말해: OpenComputer 는 추측이 아닌 코드로 규칙이 확인되는 디지털 놀이터를 구축하여, 오늘날의 AI 에이전트들이 여전히 진정한 신뢰할 수 있는 디지털 근로자가 되는 법을 배우고 있음을 드러냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →