APEX-Accounting
APEX-Accounting은 Mercor와 Ramp가 실세계 회계 작업에서 프런티어 모델들을 평가하기 위해 개발한 새로운 벤치마크로, 현재 최고 성능을 보이는 모델들이 완만한 성공률을 보이며 토큰 예산의 증가가 전체 점수는 높이지만 특정 고비용 작업의 성능은 낮추는 심슨의 역설을 나타낸다는 사실을 밝혀냈습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: APEX–Accounting
문제 정의
대규모 언어 모델(LLM)이 전문 자격 시험(예: CPA, CMA)을 통과하고 전반적인 업무 품질을 개선하는 데 탁월한 능력을 입증해 왔으나, 회계사의 실제 일상 업무를 수행하는 능력을 평가하는 벤치마크는 부족한 실정이다. AuditBench, FinMaster, AccountingBench와 같은 기존 벤치마크들은 합성 트랜잭션, 텍스트 전용 시뮬레이터, 또는 단일 기업 사례 연구에 의존하는 경우가 많아, 월말 결산 및 기부킹(bookkeeping)의 반복적이고 절차적이며 문서 집약적인 특성을 포착하지 못한다. 저자들은 현재의 평가 방식이 계정 조정, 비용 미지급금 계상, 트랜잭션 전기(posting), 그리고 다양한 복잡한 비즈니스 맥락에서의 보고서 생성 등 회계사의 "실제 업무"를 충분히 테스트하지 못한다고 주장한다.
방법론
벤치마크 설계 (APEX–Accounting)
APEX–Accounting은 Mercor가 Ramp와 협력하여 개발한 폐쇄형 벤치마크로, 10개의 합성 생성된 기업 세계에 걸친 160개의 태스크로 구성된다.
- 세계 구축: 각 세계는 미국 GAAP 발생주의 회계 원칙을 준수하며 월말 결산 시점에 고정된 독립적인 기업을 나타낸다. 세계는 범위 설정(scoping), 상세 명세 작성(의도된 모순을 심기 위한 "트랩 레지스터" 포함), 스타일 가이드 도출, 파일 생성의 4단계로 구축되었다. 모든 파일(스프레드시트, PDF, 회계 소프트웨어 내보내기 파일)은 새롭게 생성되었으며, 암기 방지를 위해 공개 소스에 대한 검토를 거쳤다.
- 태스크 카테별: 160개의 태스크는 다음 네 가지 범주로 나뉜다:
- 조정 (Reconciliation, 61개 태스크): 두 소스를 연결하고, 차이(break)를 식별하며, 이를 설명하거나 수정함.
- 데이터 입력 (Data Entry, 26개 태스크): 트랜잭션, 분개(journal entries), 송장(invoices)을 전기함.
- 변동 분석 (Variance Analysis, 28개 태스크): 실제 수치를 예산 또는 기대치와 비교함.
- 스케줄 및 미지급/미수 계상 (Schedules & Accruals, 45개 태스크): 스케줄을 구축하고, 발생액을 계산하며, 잔액을 이월함.
- 전문가 참여: 42명의 회계 전문가(경력 중앙값 11년, 52%가 Big Four 회계법 출신)가 태스크를 작성하고, 이를 해결하여 "골든 응답(golden responses)"을 생성했으며, 이진(binary) 기반의 결과 중심 채점 루브릭을 작성했다. 각 태스크에는 프롬프트, 필수 입력 파일, 골든 응답, 그리고 평균 13.7개의 기준을 가진 루브릭이 포함되어 있다.
실험 설정
- 평가 모델: Claude-Fable-5, Muse-Spark-1.1, GPT-5.6-Sol 등을 포함한 9개의 프런티어 모델이 테스트되었다. 각 모델은 모든 태스크를 8번씩 실행하여 총 11,520개의 궤적(trajectories)을 생성했다.
- 하네스(Harnesses): 두 가지 에이전트 하네스가 사용되었다:
- 루프 하네스 (Loop Harness): 표준적인 canonical while-loop-with-tools 아키텍처.
- Ramp 하네스 (Ramp Harness): 실제 회계 제약 조건을 반영하기 위해 재시도 인지(retry-awareness), 도구 허용 목록(allowlists), 검증, 서브 에이전트 위임 기능이 포함된 Ramp 기반의 특화된 하네스.
- 채점: GEPA 프롬프트로 최적화된 DeepSeek-v4-Flash 모델이 판사 역할을 수행했다. 이 판사는 인간 전문가의 그라운드 트루스(1,687개 기준)와 비교 검증되었으며, 97.1%의 정확도(F1 = 0.970)를 달성했다. 판사는 중간 과정의 궤적 로그에 접근하지 않고 최종 출력물을 이진 루브릭 기준에 따라 평가한다.
- 지표:
- Mean Criteria@3: 3개의 무작위 실행당 충족된 루브릭 기준의 백분율을 평균한 주요 지표.
- Pass@k / Pass^k: 능력의 상한선(Pass@8: 8번의 시도 중 적어도 한 번 성공)과 일관성(Pass^8: 8번의 시도 모두 성공)을 측정함.
- 비용 절감 분석 (Cost Ablation): 토큰 예산을 태스크당 50까지 변화시키며 지출과 성능 간의 관계를 분석함.
주요 결과
리더보드 성적
- 최고 성능 모델: **Claude-Fable-5 (Max)**가 56.4%의 Mean Criteria@3를 기록하며 가장 높은 성적을 거두었으며, Muse-Spark-1.1(52.6%)과 GPT-5.6-Sol(51.5%)이 그 뒤를 이었다.
- 일관성 격차: 높은 Mean Criteria@3 점수에도 불구하고, 일관성은 매우 낮았다. 어떤 모델도 Pass^8 점수가 **2.6%**를 넘지 못했다(GPT-5..6-Sol). 가장 높은 Pass@8은 21.5%(Muse-Spark-1.1)로, 이는 모델들이 가끔 태스크를 해결할 수는 있지만, 끝까지 신뢰성 있게 수행할 수는 없음을 나타낸다.
- 범주별 난이도: "Schedules & Accruals" 범주가 가장 어려웠으며, 모든 모델이 다른 범주보다 7~21%포인트 낮은 점수를 기록했다. 이는 해당 범주가 다단계의 판단이 필요한 성격임을 반영한다.
비용 및 예산 분석
- 토큰 예산 영향: 예산을 50로 늘리면 고가의 모델(예: Claude-Fable-5는 +43.4%포인트 상승)의 점수는 크게 향상되었으나, 저렴한 모델(예: Muse-Spark-1.1)은 미미한 상승을 보였다.
- 심슨의 역설 (Simpson's Paradox): 연구 과정에서 심슨의 역설 사례가 관찰되었다. 전체 예산을 늘리면 점수가 올라갔지만, 고정된 예산 내에서 모델이 더 많은 토큰을 소비한 태스크일수록 오히려 점수가 낮게 나타났다. 이는 태스크의 난이도 때문으로, 어려운 태스크일수록 더 많은 토록을 소비하지만 여전히 해결하기 어렵기 때문이다.
- 하네스 영향: 표준 루프 하네스에서 특화된 Ramp 하네스로 전환했을 때 평균 변화는 미미했다(+1.2%포인트). 이는 이러한 태스크에서 모델의 역량이 특정 에이전트 아키텍처보다 성능의 더 강력한 동인임을 시사한다.
실패 분석
상위 3개 모델의 저득점 궤적을 분석한 결과, 놀라울 정도로 유사한 실패 프로필이 나타났다:
- 추론 (Reasoning): 추론 실패가 전체 주석 처리된 오류의 **59~79%**를 차지했다.
- 구체적 실패 모드: 가장 흔한 하위 실패 유형은 비수치적 추론(비수치 데이터에 잘못된 논리 적용)과 데이터 처리 오류(잘못된 필터링, 조인 또는 집계)였다.
- 정보 vs 논리: 모델들은 올바른 입력 파일을 찾는 데는 능숙했다(정보 수집 실패는 드물었다). 주요 실패 모드는 해당 입력값들에 대한 다단계 추론 처리 미흡이었다. 즉, 잘못된 승인 로직을 적용하거나, 올로된 중간 결과를 누락하거나, 최종 답변까지 결론을 유지하지 못하는 등의 문제가 발생했다.
- 도구 사용 (Tool Use): 주석 처리된 실패 중 도구 사용 오류는 없었다. 이는 현재의 에이전트 아키텍처가 도구 상호작용에는 충분하지만, 근본적인 추론 능력이 병목 구간임을 시사한다.
의의 및 주장
본 논문은 APEX–Accounting이 자격 시험을 넘어 실무 적용 측면에서 프런티어 모델을 엄격하게 평가하는 첫 번째 사례라고 주장한다.
- 현재의 한계: 결과에 따르면 프런티어 모델들이 정보를 검색하고 고립된 단계를 수행할 수는 있지만, 감독 없이 장부를 마감할 수 있는 수준은 아직 아니다. 낮은 Pass^8 점수(최대 2.6%)는 "역량의 상한선"과 "신뢰할 수 있는 배포" 사이에 상당한 격차가 있음을 보여준다.
- 향acy 방향: 저자들은 발전이 에이전트 하네스를 개선하는 것(효과가 미미했음)보다는 모델 자체를 개선하는 것에서 올 것이라고 주장한다. 구체적으로, 다단계 결과를 끝까지 유지하는 규율, 문서 내 모순을 찾아내는 능력, 충분한 증거 없이 전기를 거부하는 능력 등을 갖추기 위한 회계 특화 훈련이 필요하다고 제안한다.
- 벤치마크의 유용성: 폐쇄형 벤치마크로서 APEX–Accounting은 요청 시 모든 프런티어 모델을 평가할 수 있으며, 숙련된 지식 노동의 자동화를 추적하기 위한 산업 표준 지표을 제공한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.