Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
본 논문은 AI 에이전트의 워크스페이스 학습 능력을 평가하기 위해 현실적인 파일 의존성과 다양한 작업을 포함한 대규모 벤치마크인 Workspace-Bench 를 소개하며, 현재 모델들은 복잡한 파일 간 추론과 의사결정 처리에서 인간 수행력에 비해 현저히 뒤처진다는 사실을 밝힙니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 직장에서 업무를 도와줄 초지능 로봇 비서를 고용한다고 상상해 보세요. 당신은 스프레드시트, 이메일, PDF, 코드, 그리고 오래된 초안으로 가득 찬 폴더를 그에게 건넵니다. 당신의 목표는 로봇이 올바른 정보 조각들을 찾아내고, 그것들이 어떻게 연결되는지 파악한 뒤 보고서를 작성하게 하는 것입니다.
Workspace-Bench는 오늘날의 AI 로봇들이 길을 잃거나 혼란에 빠지거나 사실을 지어내지 않고 실제로 이 일을 수행할 수 있는지 확인하기 위해 고안된 방대하고 현실적인 테스트입니다.
다음은 이 논문의 발견 사항을 간단한 비유로 정리한 내용입니다:
1. 문제: "청정실" 대 "지저분한 책상"
AI 에 대한 대부분의 이전 테스트는 학생에게 완벽한 교과서 한 권을 주고 질문을 던지는 것과 같았습니다. AI 는 단순히 페이지를 읽고 답변하기만 하면 되었습니다.
- 현실: 실제 업무는 지저분한 책상과 같습니다. 엑셀, 코드, PDF, 이메일 등 74 가지 다른 형식으로 흩어진 2 만 개의 파일이 있습니다. 일부 파일은 오래된 초안이고, 일부는 최종 버전이며, 일부는 단순한 메모일 뿐입니다.
- 테스트: 연구진은 (물류 관리자, 연구원, 개발자 등을 위한) 5 개의 서로 다른 "디지털 사무실"을 구축했습니다. 각 사무실은 수천 개의 파일이 있는 거대하고 지저분한 디지털 공간입니다. 그런 다음 연구진은 "지난해 판매 데이터와 이번 주 이메일을 바탕으로 전략 보고서를 작성하라"와 같은 388 개의 서로 다른 작업을 AI 에게 부여했습니다.
2. 큰 발견: AI 는 여전히 길을 잃고 있습니다
연구진은 AI "두뇌"(모델) 와 AI "몸체"(AI 가 도구를 사용할 수 있게 해주는 소프트웨어 프레임워크) 의 28 가지 서로 다른 조합을 테스트했습니다.
- 점수: 가장 뛰어난 AI 조합은 세부 사항의 약 69% 만 정확히 맞췄습니다. 평균적인 AI 는 50% 미만을 달성했습니다.
- 인간과의 비교: 실제 인간이 도구 도움을 받아 동일한 테스트를 수행했을 때 점수는 81% 였습니다.
- 비유: 인간 달리기 선수가 10 분 안에 결승선에 도착하는 반면, 가장 빠른 로봇은 20 분이 걸리고도 여전히 제 발에 걸려 넘어지는 경주를 상상해 보세요. 이 논문에 따르면 현재의 AI 는 실제 사무실 업무에 대해 "아직 신뢰할 수 없는 수준"입니다.
3. 왜 실패할까요? (세 가지 주요 병목 현상)
이 논문은 AI 가 어려움을 겪는 세 가지 구체적인 이유를 발견했습니다:
- "시간 여행" 문제 (계보 추적):
실제 작업 공간에는report_v1,report_reviewed,report_final과 같이 이름이 붙은 파일들이 있습니다. AI 는 종종 잘못된 버전을 가져옵니다 (최종 버전 대신 오래된 초안을 사용하는 것). 이는 파일의 "가족 관계도"를 이해하지 못하기 때문입니다. - "번역" 문제 (이질적 이해):
AI 는 텍스트 읽기는 뛰어나지만, 파워포인트의 차트를 엑셀 시트의 원시 데이터와 연결하거나 회의 전사본과 코드 파일을 함께 이해하는 데 어려움을 겪습니다. AI 는 서로 다른 파일 유형을 서로 번역할 수 없는 별도의 언어로 취급합니다. - "건초더미 속의 바늘" 문제:
작업이 어려워질 때 (6 개 이상의 서로 다른 파일 간의 연결을 찾아야 하는 경우), AI 의 성능은 급격히 떨어집니다. AI 는 방대한 양의 데이터에 압도되어 중요한 연결 고리를 놓칩니다.
4. 시도하는 "비용"
이 논문은 AI 가 문제를 해결하는 방식에 대해 흥미로운 점을 발견했습니다:
- "바퀴 돌리기" 효과: 일부 AI 설정은 60 단계 이상 스스로 대화하며 컴퓨터 자원 (토큰) 을 대량으로 사용하는 등 정말 열심히 노력했습니다. 하지만 그 모든 노력에도 불구하고 정답을 틀렸습니다.
- "똑똑하고 빠른" 효과: 가장 성능이 뛰어난 AI(OpenClaw + Opus-4.7) 는 더 적은 단계와 더 적은 컴퓨터 자원으로 문제를 빠르게 해결하고 정답을 맞췄습니다. 이는 단순히 더 열심히 노력하는 것보다 추론의 질이 더 중요함을 시사합니다.
5. 미래: 성장의 다섯 단계
저자들은 AI 가 사다리를 오르는 것처럼 사무실에서 일하는 법을 다섯 단계로 학습한다고 상상합니다:
- L0 (수동 조언자): AI 는 단순히 조언을 제공하며, 인간이 업무를 수행합니다.
- L1 (수동 실행자): 인간이 "파일 A 를 열고 파일 B 로 복사해"라고 말합니다. AI 는 수행하지만 왜 수행하는지 이해하지는 못합니다.
- L2 (의존성 추론자): AI 는 파일 A 가 파일 B 에 의존한다는 것을 이해하기 시작합니다. (현재 AI 는 여기서 벗어나는 데 어려움을 겪고 있습니다.)
- L3 (적극적 탐험가): AI 는 사무실 전체를 둘러보고 필요한 파일을 스스로 찾아 문제를 해결할 수 있습니다. (이는 이 논문이 아직 도달하지 못했다고 말하는 "기능 특이점"입니다.)
- L4 (자기 진화 파트너): AI 는 모든 작업에서 배우고, 당신의 습관을 기억하며, 시간이 지남에 따라 당신의 특정 업무에 더 능숙해집니다.
요약
Workspace-Bench는 현실적인 점검입니다. 이 테스트는 AI 가 대화하고 작성하는 능력은 향상되고 있지만, 실제 인간의 사무실이라는 지저분하고 상호 연결되며 버전 관리가 필요한 세계를 탐색하는 데는 여전히 매우 미숙함을 보여줍니다. AI 가 파일 이력을 신뢰할 수 있게 추적하고 서로 다른 유형의 문서를 연결할 수 있을 때까지는, AI 가 길을 잃지 않도록 유지하기 위해 인간 "파일럿"이 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.