TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
이 논문은 AI 에이전트를 평가하기 위해 80,870 개의 실제 기록에서 1,530 개의 고품질 터미널 작업을 자동으로 역공학하여 확장 가능한 데이터 엔진인 TerminalWorld 를 소개하며, 이는 최신 최첨단 모델이 실제 워크플로우를 처리하는 데 어려움을 겪고 기존 전문가가 선별한 벤치마크에 비해 성적이 낮음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터의 "명령줄"(명령 프롬프트)—아이콘을 클릭하는 대신 텍스트 명령어를 입력하는 검은색 화면—을 사용하는 방법을 로봇에게 가르치려 한다고 상상해 보세요. 오랫동안 이러한 로봇을 테스트하는 방식은 엄격한 선생님이 만든 퍼즐을 주는 것과 같았습니다. 선생님은 "이 까다로운 수수께끼를 풀어보세요!"라고 말했고, 로봇이 수수께끼를 풀면 우리는 그것이 똑똑하다고 생각했습니다.
하지만 이 논문의 저자들, TERMINALWORLD는 한 가지 문제를 깨달았습니다: 실제 생활은 수수께끼가 아닙니다. 실제 생활은 messy(지저분하고) 예측 불가능하며, 사람들이 매일 실제로 사용하는 구체적인 도구들로 가득 차 있습니다. 수수께끼를 풀 수 있는 로봇이라도 실제 사무실에서 서버를 수리하거나 파일을 정리하라고 요청받으면 여전히 실패할 수 있습니다.
그들이 이를 어떻게 해결했는지 간단히 설명해 드리겠습니다:
1. "벽에 붙은 파리" 접근법
가짜 작업을 고안하는 대신, 연구원들은 asciinema라는 공개 웹사이트로 갔습니다. 이는 컴퓨터 화면을 위한 유튜브 채널과 같습니다. 개발자들이 자발적으로 실제 작업 세션의 녹화를 업로드합니다.
- 비유: 학생에게 요리하는 법을 가르치고 싶다면, 처음부터 요리책(너무 완벽하거나 기이할 수 있는)을 쓰는 대신 부엌으로 가서 실제 셰프들이 실제 요리를 하는 8만 시간 분량의 녹화를 촬영한 뒤, "자, 방금 그들이 무엇을 했을까?"라고 묻는 것과 같습니다.
- 결과: 그들은 개발자들이 작업하는 80,870개의 실제 녹화를 수집했습니다.
2. "로봇 셰프" 엔진
원본 녹화는 지저분합니다. 오타, 실패한 시도, 그리고 중요하지 않은 시스템 메시지들의 긴 목록이 포함되어 있습니다. 연구원들은 이를 정리하기 위한 특수한 "데이터 엔진"(지능형 소프트웨어 시스템)을 구축했습니다.
- 1 단계: 목표 이해하기. 엔진은 지저분한 녹화를 보고 초지능 AI 에게 "이 사람이 실제로 무엇을 달성하려 했을까?"라고 묻습니다. 이를 통해 지저분한 로그를 명확한 지시로 변환합니다: "이 나쁜 IP 주소들을 차단하고 이 목록을 이 파일에 저장해라."
- 2 단계: 부엌 구축하기. 녹화는 셰프가 어떤 도구를 가지고 있었는지 알려주지 않습니다. 엔진은 어떤 소프트웨어와 파일이 필요할지 추측해야 하며, "Docker 컨테이너"라는 것을 사용하여 해당 컴퓨터 환경의 완벽한 디지털 복제본을 구축하고, 원래 명령어가 실제로 그곳에서 작동할 수 있도록 해야 합니다.
- 3 단계: 안전망. 작업을 채점할 선생님이 없기 때문에, 엔진은 자체적인 "테스트"를 생성합니다. 솔루션을 실행하고 확인합니다: "파일이 나타났는가? 목록이 정확한가?" 테스트가 실패하면 완벽해질 때까지 테스트를 수정합니다.
3. 새로운 "실제 세계" 시험
이 8 만 개의 녹화물에서 그들은 TERMINALWORLD라는 거대한 새로운 시험 은행을 만들었습니다.
- 1,530개의 검증된 작업이 포함되어 있습니다.
- 클라우드 서버 설정부터 데이터베이스 오류 수정까지 18 가지의 다양한 실제 직업을 다룹니다.
- 1,280개의 서로 다른 컴퓨터 명령어를 사용하며, 그중 91% 는 이전 시험에서는 결코 보지 못한 것들입니다.
또한 인간이 100% 정확성을 보장하기 위해 이중 확인한 TERMINALWORLD-VERIFIED(200 개 작업) 라는 더 작고 매우 어려운 버전도 만들었습니다.
4. 충격적인 결과
그들은 세계 최고의 AI 모델들 (최신 버전의 Claude, GPT, Gemini 등) 과 그들의 "에이전트" 프레임워크 (AI 가 컴퓨터를 사용하는 데 도움을 주는 소프트웨어) 를 이 새로운 시험에 통과시켰습니다.
그들이 발견한 바는 다음과 같습니다:
- "효율 역설": AI 가 더 똑똑할수록 때로는 더 고생합니다. 최고의 AI 는 작업의 **62.5%**만 통과했습니다. 실패했을 때 그들은 단순히 포기하지 않았습니다; 잘못된 경로를 탐색하며 막대한 시간과 돈을 낭비하며 계속 시도했습니다. 도움을 요청하는 대신 같은 혼란스러운 단락을 반복해서 다시 읽는 학생과 같습니다.
- "퍼즐 대 현실" 격차: 기존 "수수께끼" 시험 (Terminal-Bench) 에서 AI 가 얼마나 잘 수행했는지와 이 새로운 "실제 생활" 시험에서 얼마나 잘 수행했는지 사이에는 거의 연관성이 없었습니다.
- 비유: AI 는 스도쿠 퍼즐을 푸는 데는 챔피언일 수 있지만 (기존 시험), 실제 교통 체증 속에서 차를 운전하는 데는 완전히 실패할 수 있습니다 (새로운 시험). 기존 시험들은 실제 작업과 너무 달랐습니다.
- 에이전트 대 인간: AI 가 작업을 해결했을 때, 그것은 녹화물 속 인간이 한 방식과 거의 같지 않았습니다. 그들은 같은 목적지에 도달하기 위해 다른 경로를 택했습니다. 이는 실제로 좋은 일입니다! 이는 AI 가 단순히 복사하는 것이 아니라, 그 길이 인간보다 길더라도 스스로의 방법을 찾아내고 있다는 뜻입니다.
결론
이 논문은 실험실에서 전문가들이 고안한 시험은 더 이상 신뢰할 수 없다고 주장합니다. AI 가 실제 세계에서 진정으로 일할 준비가 되었는지 알기 위해서는 지저분하고 복잡하며 끊임없이 변화하는 실제 인간 워크플로우로 테스트해야 합니다.
TERMINALWORLD는 실제 인간의 작업을 시험으로 자동 변환하는 도구로, 개발자들이 작업 방식을 변경함에 따라 우리의 AI 시험도 그들과 함께 진화하도록 보장합니다. 이는 "퍼즐을 풀 수 있는가?"를 테스트하는 것에서 "일을 할 수 있는가?"를 테스트하는 것으로의 전환입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.