← 최신 논문
💬 NLP

APEX-Agents

이 논문은 투자은행 분석가, 경영 컨설턴트, 기업 변호사가 생성한 장기간에 걸친 크로스 애플리케이션 작업을 수행하는 AI 에이전트의 능력을 평가하기 위해 APEX-Agents 벤치마크와 에이전트 실행 및 평가 인프라인 Archipelago를 오픈소스로 공개한 내용을 담고 있습니다.

원저자: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Rob
게시일 2026-02-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 시험의 목적: "실전 모의고사"

기존의 AI 평가는 마치 "사과를 찾아서 빨간색인지 확인해라" 같은 아주 단순한 퀴즈였어요. 하지만 현실의 전문가들은 "지난해 매출 데이터를 분석해서, 경쟁사 동향을 조사하고, 고객에게 제안할 PPT 를 3 장 만들어라"처럼 여러 가지 도구를 쓰며 긴 시간 동안 이어지는 복잡한 일을 합니다.

이 연구팀은 **"APEX-Agents"**라는 새로운 시험지를 만들었습니다.

  • 출제자: 실제 투자은행 분석가, 경영 컨설턴트, 기업 변호사들.
  • 시험 환경: 실제 업무처럼 이메일, 스프레드시트, 문서, 코드 실행 등 다양한 프로그램을 섞어놓은 '가상 사무실'을 제공했습니다.
  • 시험 문제: 480 개의 문제. 각 문제는 1~2 시간 정도 걸리는 진짜 업무 수준입니다.

2. 시험 결과: "아직은 초보 수준"

8 개의 최신 AI 모델이 이 시험을 치렀는데, 결과는 생각보다 낮았습니다.

  • 최고 점수: 1 등인 'Gemini 3 Flash'가 **24%**를 받았습니다. 즉, 100 문제 중 24 개만 완벽하게 해결했다는 뜻입니다.
  • 중간 점수: GPT-5.2 는 23%, 그다음 모델들은 18% 정도였습니다.
  • 하위 점수: 오픈소스 모델들은 5% 미만으로, 거의 답을 못 찾았습니다.

비유하자면:
AI 는 "사과를 찾아라"는 말은 잘 들지만, "냉장고에서 사과를 꺼내 씻고, 칼로 썰어서 접시에 담고, 친구에게 건네는 말까지 해라"라는 복잡한 지시에는 여전히 헷갈려서 실수한다는 뜻입니다.

3. 왜 점수가 낮을까? (실패 원인)

AI 들이 왜 실패했는지 분석한 결과는 다음과 같습니다.

  • 지치거나 멈춤 (Timeout): 250 단계 이상 걸리면 실패로 처리되는데, 많은 AI 가 생각하다 지쳐서 멈춰버렸습니다. 특히 'Kimi K2 Thinking'이라는 모델은 30% 가까이 멈춰서 버렸습니다.
  • 반복 실수 (Doom Loop): 같은 실수를 반복하며 제자리걸음을 하는 경우가 많았습니다.
  • 불완전한 결과: 100% 완벽하지는 않아도, 50% 는 채웠거나 부분적으로 도움이 되는 결과를 내놓는 경우는 꽤 많았습니다. (평균 점수는 30~40% 대로 Pass@1 점수보다 높았습니다.)

4. 흥미로운 발견들

  • 자원을 많이 쓴다고 좋은 게 아님: 'Gemini 3 Flash'가 가장 잘했지만, 다른 모델보다 **5 배나 많은 데이터 (토큰)**를 소모했습니다. 마치 "최고의 요리사가 재료를 5 배나 더 써서 요리를 했다"는 뜻인데, 효율성은 떨어집니다.
  • 파일 조작은 약점: 단순히 답을 말로 하는 것보다, 엑셀 파일을 직접 고치거나 PPT 를 만들어야 하는 문제에서는 점수가 더 떨어졌습니다.
  • 일관성 부족: 같은 문제를 8 번 풀면, 1 번은 성공하고 7 번은 실패하는 경우가 많았습니다. 즉, AI 는 "운이 좋을 때"만 일을 잘한다는 뜻입니다.

5. 결론: "미래는 밝지만, 아직 갈 길이 멀다"

이 연구는 AI 가 전문가들의 일을 완전히 대체할 준비가 아직 안 되었다는 것을 보여줍니다. 하지만 24% 라는 점수가 0% 가 아니라는 점은, AI 가 복잡한 일을 해낼 잠재력이 있다는 신호입니다.

연구팀은 이 시험 문제와 평가 도구 (Archipelago) 를 모두 공개했습니다. 마치 "누구나 이 시험을 보고 AI 를 더 똑똑하게 만들 수 있게 도와주겠다"는 의미입니다.

한 줄 요약:

"AI 는 이제 막 '인턴' 수준에서 '주니어'로 올라가는 중입니다. 복잡한 업무는 아직 혼자서 완벽하게 처리하지 못하지만, 우리가 도와주면 점점 더 잘할 수 있을 것입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →