APEX-Agents
이 논문은 투자은행 분석가, 경영 컨설턴트, 기업 변호사가 생성한 장기간에 걸친 크로스 애플리케이션 작업을 수행하는 AI 에이전트의 능력을 평가하기 위해 APEX-Agents 벤치마크와 에이전트 실행 및 평가 인프라인 Archipelago를 오픈소스로 공개한 내용을 담고 있습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
1. 시험의 목적: "실전 모의고사"
기존의 AI 평가는 마치 "사과를 찾아서 빨간색인지 확인해라" 같은 아주 단순한 퀴즈였어요. 하지만 현실의 전문가들은 "지난해 매출 데이터를 분석해서, 경쟁사 동향을 조사하고, 고객에게 제안할 PPT 를 3 장 만들어라"처럼 여러 가지 도구를 쓰며 긴 시간 동안 이어지는 복잡한 일을 합니다.
이 연구팀은 **"APEX-Agents"**라는 새로운 시험지를 만들었습니다.
- 출제자: 실제 투자은행 분석가, 경영 컨설턴트, 기업 변호사들.
- 시험 환경: 실제 업무처럼 이메일, 스프레드시트, 문서, 코드 실행 등 다양한 프로그램을 섞어놓은 '가상 사무실'을 제공했습니다.
- 시험 문제: 480 개의 문제. 각 문제는 1~2 시간 정도 걸리는 진짜 업무 수준입니다.
2. 시험 결과: "아직은 초보 수준"
8 개의 최신 AI 모델이 이 시험을 치렀는데, 결과는 생각보다 낮았습니다.
- 최고 점수: 1 등인 'Gemini 3 Flash'가 **24%**를 받았습니다. 즉, 100 문제 중 24 개만 완벽하게 해결했다는 뜻입니다.
- 중간 점수: GPT-5.2 는 23%, 그다음 모델들은 18% 정도였습니다.
- 하위 점수: 오픈소스 모델들은 5% 미만으로, 거의 답을 못 찾았습니다.
비유하자면:
AI 는 "사과를 찾아라"는 말은 잘 들지만, "냉장고에서 사과를 꺼내 씻고, 칼로 썰어서 접시에 담고, 친구에게 건네는 말까지 해라"라는 복잡한 지시에는 여전히 헷갈려서 실수한다는 뜻입니다.
3. 왜 점수가 낮을까? (실패 원인)
AI 들이 왜 실패했는지 분석한 결과는 다음과 같습니다.
- 지치거나 멈춤 (Timeout): 250 단계 이상 걸리면 실패로 처리되는데, 많은 AI 가 생각하다 지쳐서 멈춰버렸습니다. 특히 'Kimi K2 Thinking'이라는 모델은 30% 가까이 멈춰서 버렸습니다.
- 반복 실수 (Doom Loop): 같은 실수를 반복하며 제자리걸음을 하는 경우가 많았습니다.
- 불완전한 결과: 100% 완벽하지는 않아도, 50% 는 채웠거나 부분적으로 도움이 되는 결과를 내놓는 경우는 꽤 많았습니다. (평균 점수는 30~40% 대로 Pass@1 점수보다 높았습니다.)
4. 흥미로운 발견들
- 자원을 많이 쓴다고 좋은 게 아님: 'Gemini 3 Flash'가 가장 잘했지만, 다른 모델보다 **5 배나 많은 데이터 (토큰)**를 소모했습니다. 마치 "최고의 요리사가 재료를 5 배나 더 써서 요리를 했다"는 뜻인데, 효율성은 떨어집니다.
- 파일 조작은 약점: 단순히 답을 말로 하는 것보다, 엑셀 파일을 직접 고치거나 PPT 를 만들어야 하는 문제에서는 점수가 더 떨어졌습니다.
- 일관성 부족: 같은 문제를 8 번 풀면, 1 번은 성공하고 7 번은 실패하는 경우가 많았습니다. 즉, AI 는 "운이 좋을 때"만 일을 잘한다는 뜻입니다.
5. 결론: "미래는 밝지만, 아직 갈 길이 멀다"
이 연구는 AI 가 전문가들의 일을 완전히 대체할 준비가 아직 안 되었다는 것을 보여줍니다. 하지만 24% 라는 점수가 0% 가 아니라는 점은, AI 가 복잡한 일을 해낼 잠재력이 있다는 신호입니다.
연구팀은 이 시험 문제와 평가 도구 (Archipelago) 를 모두 공개했습니다. 마치 "누구나 이 시험을 보고 AI 를 더 똑똑하게 만들 수 있게 도와주겠다"는 의미입니다.
한 줄 요약:
"AI 는 이제 막 '인턴' 수준에서 '주니어'로 올라가는 중입니다. 복잡한 업무는 아직 혼자서 완벽하게 처리하지 못하지만, 우리가 도와주면 점점 더 잘할 수 있을 것입니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.