Agents' Last Exam
이 논문은 현재의 벤치마크 성공과 의미 있는 GDP 관련 배포 사이의 간극을 메우는 것을 목표로, 13개 산업 클러스터에 걸쳐 장기적이고 경제적 가치가 있는 실제 세계의 과업들을 대상으로 AI 에이전트를 평가하기 위해 250명 이상의 업계 전문가들과 함께 개발한 리빙 벤치마크인 Agents' Last Exam(ALE)을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 수년간 로봇 요리사를 훈련시켜 왔다고 상상해 보십시오. 당신은 레시피에 관한 퀴즈를 내고, 재료의 이름을 묻고, "양파를 다지라"는 식의 간단한 지시를 내리며 로봇을 테스트했습니다. 이 테스트에서 로봇은 만점을 받았습니다. 마치 요리의 천재처럼 보였습니다.
하지만 당신이 로봇에게 바쁜 레스토랑의 피크 타임에 실제로 복잡하고 완전한 저녁 식사를 요리하라고 시키자, 갑자기 로봇은 소스를 태우거나, 주문을 잊어버리거나, 가스레인지 조작에 혼란을 겪습니다. 알고 보니, 요리에 대해 '말하는 것'에 능숙한 것이 실제로 '일을 하는 것'에 능숙하다는 뜻은 아니었던 것입니다.
이것이 바로 "Agents' Last Exam" (ALE) 논문이 해결하고자 하는 문제입니다.
문제점: "퀴즈"의 함정
오랫동안 AI 연구자들은 여러 선택형 퀴즈와 같은 벤치마크로 AI 에이전트(똑똑한 컴퓨터 프로그램)를 테스트해 왔습니다. 이러한 테스트는 AI가 무엇을 '아는지' 측정하는 데는 훌륭하지만, AI가 현실 세계에서 무엇을 '할 수 있는지'는 측정하지 못합니다.
저자들은 AI가 수학 시험을 통과하거나 코딩 퀴즈를 통과한다고 해서, 그 AI가 실제로 사업을 운영하거나, 다리를 설계하거나, 병원 스케줄을 관리할 수 있다는 것을 의미하지는 않는다고 주장합니다. "시험을 통과하는 것"과 "수익을 창출하는 것" 사이의 간극은 매우 큽니다.
해결책: "마지막 시험 (The Last Exam)"
이를 해결하기 위해 연구팀은 **ALE (Agents' Last Exam)**를 만들었습니다. 이것을 단순한 퀴즈가 아니라, AI를 위한 실제적인 실무 면접이라고 생각하십시오.
ALE는 "프랑스의 수도는 어디인가요?" 또는 "Python 루프를 작성하세요"라고 묻는 대신, 인간 전문가가 실제로 수행할 법한 실제적이고 복잡하며 며칠이 걸리는 프로젝트를 부여합니다.
- 과업: 이 시험은 55가지의 다양한 직업 분야(엔지니어링, 의학, 금융, 비디오 게임 디자인 등)를 다룹니다.
- 난이도: 과업들은 "장기적 관점(long-horizon)"입니다. 즉, 완료하는 데 몇 시간 또는 며칠이 걸립니다. AI는 인간 직원처럼 다양한 소프트웨어 프로그램을 열고, 버튼을 클릭하고, 파일을 확인하고, 스스로의 실수를 바로잡아야 합니다.
- 출처: 이 과업들은 연구자들이 임의로 만들어낸 가짜 과업이 아닙니다. 250명 이상의 업계 전문가들이 실제로 수행했던 실제 프로젝트들입니다. 전문가들이 자신의 과거 작업물을 제출했고, 연구팀은 이를 테스트로 변환했습니다.
시험 방식
AI가 가상의 사무실에 있는 컴퓨터 앞에 앉아 있다고 상상해 보십시오.
- 과제 부여: AI는 "자동차 부품용 몰드 설계하기" 또는 "이 의료 X-ray 영상 분석하기"와 같은 실제 업무를 받습니다.
- 도구 활용: AI는 인간처럼 실제 소프트웨어(3D 모델링 도구, 재무 스프레드시트, 의료 영상 소프트웨어 등)를 사용해야 합니다. 메뉴를 클릭하고, 명령어를 입력하며, 파일을 관리해야 합니다.
- 채점: 이 부분이 영리한 대목입니다. 이 시험은 인간 교사가 결과를 보고 "좋아 보이네요!"라고 말하는 방식에 의존하지 않습니다. 그것은 너무 느리고 주관적이기 때문입니다. 대신, 시험은 **자동 검증기(automated checkers)**를 사용합니다.
- 만약 과업이 3D 모델을 만드는 것이었다면, 컴퓨터는 치수가 정확한지 확인합니다.
- 만약 과업이 재무 보고서를 작성하는 것이었다면, 컴퓨터는 숫자가 제대로 맞는지 확인합니다.
- 만약 AI가 특정 "게이트(gate)"(예: 기계를 고장 낼 수 있는 실수)에서 실패한다면, 나머지 작업이 아무리 보기 좋더라도 즉시 0점 처리됩니다.
결과: AI는 아직 학교에 다니는 중입니다
논문은 세계에서 가장 똑똑한 AI 에이전트들을 이 시험으로 테스트했습니다. 결과는 냉혹했습니다.
- "쉬운" 단계: 가장 뛰어난 AI 에이전트들도 "단기적(near-term)"인 것으로 간주되는 과업의 약 30%만을 통과했습니다.
- "어려운" 단계: 가장 어려운 과업(즉, "마지막 시험" 단계)에서 합격률은 **0%**였습니다. AI는 이를 전혀 수행하지 못했습니다.
- 격차: 표준 코딩 테스트(Terminal-Bench)에서 82%를 기록한 AI가 이 실제 세계 시험에서는 약 25%만을 기록했습니다.
저자들은 이를 "마지막 시험"이라고 부르는데, 이는 이것이 최종 관문이기 때문입니다. 만약 AI가 이를 통과할 수 있다면, 그것은 AI가 실제로 직무를 수행하고 인간 노동자를 대체할 준비가 되었음을 의미합니다. 현재로서는, 논문은 AI가 아직 통과하기에 갈 길이 멀다고 말합니다.
이것이 중요한 이유
이 논문은 단순히 더 어려운 테스트를 만드는 것이 아니라, 목표를 바꾸는 것에 관한 것입니다.
- 현재의 목표: AI가 퀴즈에서 100점을 맞게 하는 것.
- 새로운 목표: AI가 경제적 가치(GDP)를 창출하는 실제 직무에서 100점을 맞게 하는 것.
저자들은 이러한 실제적이고 검증 가능한 과업에 집중함으로써, 우리가 단순히 말을 잘하는 AI가 아니라 실제로 '일 잘하는' AI를 만들기 시작할 것이라고 믿습니다. AI가 이 "마지막 시험"을 통과할 수 있을 때까지, AI는 실제 노동 현장에 투입될 준비가 된 것이 아닙니다.
요약 비유
현재의 AI 벤치마크를 운전 이론 시험이라고 생각하십시오. 당신은 도로 규칙을 모두 암기하여 만점을 받을 수 있습니다. 하지만 ALE는 당신이 직접 자동차를 운전하여 교통 체증을 뚫고, 평행 주차를 하고, 충돌 없이 공사 구간을 통과해야 하는 실제 운전 시험입니다.
논문은 이렇게 말합니다: "우리 AI 운전자들은 이론 시험은 잘 치르지만, 실제 운전 시험에서는 여전히 사고를 내고 있습니다. 이제 이론 점수를 축하하는 것을 멈추고, 그들에게 운전하는 법을 가르치기 시작합시다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.