← 최신 논문
💬 NLP

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

이 논문은 기업용 실제 에이전트 세션에서 파생된 벤치마크인 EnterpriseClawBench를 소개하며, 852개의 재현 가능한 태스크를 통해 현재 모델들이 제한적인 성공률(0.663)을 달성하고 있음을 입증하고, 향후 평가는 단일 점수에 의존하기보다 하네스-모델 조합, 결과물 전달, 시각적 품질, 비용, 실행 시간, 그리고 기술 전이 동작을 보고하는 다차원적 프레임워크를 채택해야 함을 보여준다.

원저자: Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 파일을 읽고, 도구를 사용하며, 보고서를 작성할 수 있는 매우 똑똑하고 새로운 직원이 생겼다고 상상해 보십시오. 당신은 이 직원이 실제로 일을 잘하고 있는지 알고 싶습니다.

기존의 AI "직원" 테스트들은 대부분 조용한 교실에서 퀴즈를 내는 것과 같았습니다. 질문에 답하거나 코드를 작성하도록 요구하는 식이었죠. 하지만 실제 업무는 조용한 퀴즈가 아닙니다. 그것은 엉망인 이메일을 읽고, 특정 첨부 파일을 열고, 깨진 링크를 수정하며, 하루가 끝나기 전까지 완성된 결과물(예: 스프레드 시트나 프레젠테이션)을 전달해야 하는 혼란스럽고 시끄러운 환경입니다.

이 논문은 가짜 연습 문제가 아니라, 한 기업의 실제 업무 세션을 기반으로 한 새로운 AI 에이전트 테스트 방식인 EnterpriseClawBench를 소개합니다.

다음은 그들이 수행한 작업과 발견한 내용을 쉬운 비유를 사용하여 정리한 내용입니다.

1. 실제 업무를 위한 "재활용 공장"

연구진은 자사에서 발생한 수천 건의 실제 업무 세션이 담긴 방대한 아카이브에서 시작했습니다. 이 세션들은 엉망이었습니다. 개인적인 채팅, 깨진 파일 경로, 모호한 지시사항 등이 포함되어 있었죠.

이 아카이브를 정제되지 않은 원석 더미라고 생각하십시오. 논문은 이 원석을 정제하는 "건설 파이프라인"(재활용 공장)을 설명합니다:

  • 필터(The Filter): 너무 짧거나, 파일이 누락되었거나, 깨진 링크에 의존하는 작업들을 걸러냈습니다.
  • 번역기(The Translator): 여러 차례 오고 간 복잡한 대화 내용을 명확한 단일 명령어로 재작성했습니다(예: 중구난방인 이메일 체인을 명확한 "할 일 목록"으로 바꾸는 것과 같습니다).
  • 안전 점검(The Safety Check): 모든 작업이 회사의 비밀 비밀번호 없이도 반복해서 실행될 수 있도록 만들었습니다.

5,291개의 가공되지 않은 시도 중에서, 그들은 852개의 고품질, 재현 가능한 작업을 추출해 냈습니다. 또한 품질을 완벽하게 보장하기 위해 인간이 직접 검수한 120개의 작은 "라이트(Lite)" 버전도 만들었습니다.

2. "운전자와 자동차" 테스트

이 논문의 주요 발견은 AI 모델(엔진)만 따로 떼어 테스트해서는 안 된다는 것입니다. 반드시 AI + 소프트웨어 프레임워크(자동차)를 함께 테스트해야 한다는 점입니다.

  • 비유: 페라리 엔진을 테스트한다고 상상해 보십시오. 만약 그 엔진을 녹슬고 망가진 트럭에 넣는다면 성능이 제대로 나오지 않을 것입니다. 하지만 매끈한 스포츠카에 넣는다면 날아다닐 것입니다.
  • 결과: 연구진은 32가지의 서로 다른 "엔진"(GPT-5.5, Sonnet 4.6 등)과 "자동차"(Claude Code, OpenClaw, Hermes 같은 소프트웨어 프레임워크)의 조합을 테스트했습니다.
  • 놀라운 사실: 강력한 엔진이라도 잘못된 프레임워크와 결합하면 형편없는 성적을 냈습니다. 예를 들어, 어떤 최상위 모델은 "Hermes" 프레임워크와 함께 사용했을 때 점수가 크게 떨어졌는데, 이는 해당 프레임워크가 모델이 수행해야 할 필수적인 동작들을 차단했기 때문입니다. 이는 소프트웨어 래퍼(wrapper)가 AI의 두뇌만큼이나 중요하다는 것을 증명합니다.

3. "성적표"는 단 하나의 점수로 끝나지 않습니다

학교에서는 최종 성적 하나를 받습니다. 하지만 이 벤치마크에서 연구진은 그것만으로는 부족하다고 말합니다. 그들은 에이전트에게 다차원적인 성적표를 부여합니다:

  • 업무를 완료했는가? (결과물 전달)
  • 얼마나 빨리 했는가? (실행 시간)
  • 비용이 너무 많이 들지는 않았는가? (비용)
  • 파일이 실제로 사용 가능한가? (시각적 품질)
  • 맥락을 이해했는가? (의미론적 품질)

현실 점검: 가장 좋은 조합(Codex와 GPT-5.5)조차도 **66.3%**의 점수를 기록하는 데 그쳤습니다. 이는 우리의 가장 똑똑한 AI 에이전트들조차 실제 사무 업무를 완벽하게 처리하는 데 여전히 어려움을 겪고 있음을 의미합니다. 그들은 종종 세부 사항을 놓치거나, 올바른 파일을 찾지 못하거나, 보기에는 좋지만 숫자가 틀린 보고서를 만들어냅니다.

4. "기술 전수" 실험

연구진은 AI가 한 작업에서 배운 기술을 유사한 다른 작업에 적용할 수 있는지 확인하고자 했습니다.

  • 실험: "프론트엔드 웹 페이지" 제작을 연습한 AI를 대상으로, 한 번도 본 적 없는 새로운 웹 페이지 작업 과제를 주었습니다.
  • "선생님" vs "학생": 그들은 "기술"의 품질이 전적으로 누가 가르치느냐에 달려 있다는 것을 발견했습니다.
    • 강력한 AI(예: GPT-5.5)가 기술을 전수(distill)하면, 학생 AI의 실력이 향상되었습니다.
    • 반면, 약한 AI가 기술을 가르치려 하면, 학생 AI의 실력은 오히려 악화되었습니다.
  • 교훈: AI가 기술을 "학습했다"고 무조건 가정해서는 안 됩니다. 가르치는 사람의 품질이 중요하며, 때로는 나쁜 선생님이 좋은 학생을 망칠 수도 있습니다.

5. "인간 vs 로봇" 판사 문제

이 작업들을 채점하기 위해 연구진은 AI 판사(로봇을 채점하는 로봇)를 사용했습니다.

  • 텍스트 작업: AI 판사들은 텍텍스트 보고서를 채점하는 데 꽤 능숙했으며, 인간 판사와도 유사한 결과를 보였습니다.
  • 시각적 작업: 스프레드시트, 슬라이드, 또는 이미지를 채점할 때 AI 판사들은 매우 신뢰할 수 없었습니다. AI 판사들은 인간이라면 거절했을 법한 엉망인 결과물에도 높은 점수를 주는 경우가 많았습니다.
  • 핵심 요점: 우리는 AI가 문장을 쓰는 능력은 테스트할 수 있지만, 전문적인 비즈니스 문서를 만드는 능력을 테스트하는 데는 아직 미흡합니다.

요약

EnterpriseClawBench는 AI 산업에 던지는 현실적인 경고입니다. 이 논문은 다음과 같이 말합니다:

  1. 깨끗하고 가공된 환경에서 AI를 테스트하지 말고, 지저식하고 실제적인 아카이브에서 테스트하십시오.
  2. 사용하는 소프트웨어 프레임워크는 AI 모델 자체만큼이나 중요합니다.
  3. 현재의 AI 에이전트는 복잡한 사무직 업무를 완전히 대체할 준비가 되지 않았습니다. 그들은 여전히 최종 결과물을 믿고 맡기기에는 너무 많은 실수를 저지릅니다.
  4. 텍스트뿐만 아니라 시각적 결과물을 평가하기 위한 더 나은 방법이 필요합니다.

논문은 결론적으로, AI가 발전하고는 있지만 "AI와 대화하는 것"과 "신뢰할 수 있는 비즈니스 부서를 운영하는 것" 사이의 간극은 여전히 넓다고 밝히고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →