← 최신 논문
🤖 AI

WorkBench Revisited: Workplace Agents Two Years On

이 논문은 WorkBench 벤치마크의 초기 평가 2년 후 이를 재검토하며, Claude Opus 4.8과 같은 최첨단 에이전트들이 훨씬 더 높은 작업 완료율(43% 대 89%)과 급격히 감소한 유해한 오류(26% 대 2.5%)를 달성했음을 입증하는 동시에, 능력과 안전성이 함께 향상되고, 오픈 웨이트 모델들이 고성능 접근을 민주화했으며, 돌이킬 수 없는 피해로 이어지는 특정 기초적 오류 유형들은 여전히 지속되고 있음을 보여준다.

원저자: Olly Styles

게시일 2026-06-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Olly Styles

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

WorkBench를 거대한 시뮬레이션 사무실 놀이터라고 상상해 보세요. 이 놀이다터지 안에는 캘린더, 이메일 수신함, 고객 명단, 그리고 프로젝트 보드의 디지털 버전이 들어 있습니다. 이 논문의 목표는 AI "에이전트"(똑똑한 컴퓨터 프로그램)가 인간 직원처럼 이메일을 읽고, 회의 일정을 잡고, 고객 기록을 망가뜨리지 않고 수정하는 일을 얼마나 잘 수행하는지 테스트하는 것입니다.

저자들은 이 놀이터를 처음 개장한 지 2년이 지난 시점에서 이곳을 다시 점검하기로 했습니다. 그들이 발견한 내용을 쉽게 설명해 드립니다.

1. "전과 후" 사진

2024년 (과거):
당시 사용 가능한 최고의 AI였던 GPT-4는 매우 의욕적이지만 서투른 인턴과 같았습니다. 690개의 작업 중 단 **43%**만을 완수했습니다. 더 심각한 것은, 도움을 주려다가 실수로 엉뚱한 사람에게 이메일을 보내는 등 문제를 일으킨 경우가 약 **26%**에 달했다는 점입니다. 열심히 노력은 했지만, 자주 혼란스러워하거나 위험한 상황을 만들었습니다.

2026년 (현재):
저자들은 최신 AI 모델들을 가지고 테스트를 다시 진행했습니다. 우승자인 Claude Opus 4.8은 수년간 현장에서 근무한 선임 임원과 같습니다. 이 모델은 작업의 **89%**를 완수했습니다. 더욱 인상적인 것은, 실수로 해를 끼친 경우가 **2.5%**에 불 মাত্র 했다는 점입니다. 단순히 더 빨라진 것이 아니라, 훨씬 더 안전해졌습니다.

2. 큰 발견: 안전과 기술은 함께 간다

보통 우리는 로봇을 더 빠르거나 똑똑하게 만들면 더 무모해질 것이라고 생각합니다. 하지만 이 논문은 이러한 AI 에이전트들에게는 그것이 사실이 아니라고 말합니다.

  • 비유: 레이싱 카를 생각해 보세요. 과거에는 가장 빠른 차가 사고가 날 확률도 가장 높았습니다. 하지만 이제 가장 빠른 차들은 최고의 브레이크와 안전 장치를 갖춘 차들입니다. 가장 많은 작업을 완수한 모델이 실수를 가장 적게 한 모델이기도 했습니다.

3. "오픈 소스 모델"의 마법

이 논문은 승리의 흐름이 어떻게 바뀌었는지 강조합니다.

  • 과거 방식: 오직 비싼 "독점적(proprietary)" 모델(대형 기술 기업의 모델들)만이 업무를 잘 수행할 수 있었습니다.
  • 새로운 방식: "오픈 웨이트(open-weight)" 모델(누구나 다운로드하고 개선할 수 있는 오픈 소스 소프트웨어와 같은 것)이 이제 훨씬 저렴한 가격으로 그만큼의 성능을 내고 있습니다.
  • 비유: 이제 대륙을 횡단하기 위해 고급 자동차가 필요하다고 가정해 봅시다. 이제 당신은 다른 제조사의, 운영 비용이 1/100 수준인 신형 고성능 전기차를 가질 수 있으며, 그 차는 목적지까지 똑같이 데려다줍니다. 논문은 오늘날 가장 저렴하면서도 유능한 AI는 중국의 오픈 소스 연구소에서 나오고 있으며, 절대적으로 가장 강력한 모델은 여전히 서구의 독점적 모델이라고 언급합니다.

4. 테스트 자체의 변화

저자들은 2024년의 원래 테스트에서 몇 가지 실수가 있었음을 인정했습니다. 이는 마치 정답지에 오타가 있는 수학 시험을 채점한 것과 같았습니다.

  • 수정 사항: 그들은 규칙을 바로잡았습니다. 예를 들어, 테스트는 "지난 5일간"을 요구했지만 정답지는 "지난 4일간"을 기준으로 계산되었던 버그를 수정했습니다.
  • 결과: 2024년의 챔피언인 GPT-4를 수정된 규칙으로 다시 테스트했을 때, 점수는 49%에서 57%로 뛰었습니다. 이는 AI가 갑자기 똑똑해진 것이 아니라, 테스트가 더 공정해졌음을 증명합니다.

5. 여전히 발생하는 실수들

AI가 훨씬 좋아졌지만, 완벽하지는 않습니다. 논문은 최고의 모델들조차 여전히 저지르는 몇 가지 고질적인 오류를 지적합니다.

  • "잘못된 날짜" 문제: 만약 AI에게 "오늘"에 대한 차트를 그리라고 요청했는데, 시스템이 오늘을 과거의 날짜로 인식하고 있다면, AI는 아직 오지 않은 날짜에 대한 데이터를 그리려고 시도할 수 있습니다. 이는 오늘 내일의 날씨에 대한 보고서를 쓰려는 것과 같습니다.
  • "검색 생략" 문제: 어떤 도구들은 상위 5개의 결과만 보여줍니다. AI는 가끔 5개의 결과만 보고 그것이 '전부'라고 가정하여 검색을 멈춰버리며, 6번째에 있는 정답을 놓치곤 합니다.
  • "문자 그대로 vs 논리적" 문제: 때때로 AI는 수학에서 혼란을 겪습니다. 만약 작업 내용이 "성장률이 평균보다 높다면"이라고 되어 있을 때, AI는 퍼센트(예: 5%)를 원시 숫자(예: 100시간)와 비교하여 논리적으로 틀린 결론을 내릴 수 있습니다.

요약

2년 전, AI 에이전트들은 물건을 망가뜨리곤 하는 서투른 인턴이었습니다. 오늘날 최고의 에이전트들은 주어진 일을 완수하며 해를 끼치는 일이 거의 없는 신뢰할 수 있는 전문가입니다. 가장 강력한 모델들은 여전히 비싸지만, 저렴한 오픈 소스 대안들이 많은 작업에 활용 가능할 정도로 따라잡았습니다. 테스트 자체도 더 공정하게 정비되었으며, 결과는 AI가 직장에서 실질적이고 측정 가능한 발전을 이루고 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →