← 최신 논문
💻 computer science

WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance

본 논문은 정확성, 수식, 포맷이라는 다차원 분류 체계를 활용하여 엔드투엔드 금융 스프레드시트 작업에서 LLM 에이전트를 평가하는 새로운 벤치마크인 WorkstreamBench 를 소개하며, 클로드와 같은 최상위 모델이 전문적으로 보이는 결과를 생성하지만 현재 에이전트들은 실제 금융 업무 워크플로우에 필요한 복잡성과 품질 기준을 신뢰성 있게 처리하는 데 여전히 어려움을 겪고 있음을 밝힙니다.

원저자: Thomson Yen, Julian Poeltl, Harshith Srinivas Gear, Yilin Meng, Joshua Fan, Adam Shen, Yili Liu, Ali Bauyrzhan, Siri Du, Haoyang Liu, Daniel Guetta, Hongseok Namkoong

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thomson Yen, Julian Poeltl, Harshith Srinivas Gear, Yilin Meng, Joshua Fan, Adam Shen, Yili Liu, Ali Bauyrzhan, Siri Du, Haoyang Liu, Daniel Guetta, Hongseok Namkoong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

귀하의 회사에 복잡한 재무 모델을 구축할 새로운 비서를 고용한다고 상상해 보세요. 단순히 하나의 수학 문제를 풀기를 원하는 것이 아니라, 귀하가 상사, 투자자, 감사자에게 전달할 수 있도록 처음부터 전문 수준의 스프레드시트 전체를 구축하기를 원합니다.

이 논문인 WorkstreamBench는 인공지능 에이전트 (지능형 컴퓨터 프로그램) 가 실제로 그 일을 해낼 수 있는지 확인하기 위한 essentially "최종 시험"입니다.

다음은 저자들이 수행한 작업을 단순한 비유를 사용하여 설명한 내용입니다:

1. 문제: "레고 벽돌" 대 "성"

이전 AI 테스트들은 건축가에게 "한 개의 레고 벽돌을 다른 벽돌 위에 올려놓으라"거나 "빨간 벽돌을 찾아라"고 요구하는 것과 같았습니다. 이러한 것들은 하나의 질문에 답하거나 하나의 숫자를 변경하는 것과 같은 단순하고 고립된 작업들입니다.

하지만 현실의 금융 세계에서는 전문가들이 단순히 벽돌 하나를 옮기지 않습니다. 그들은 전체 성을 건설합니다. 그들은 다음과 같은 스프레드시트가 필요합니다:

  • 세 가지 다른 보고서 (손익계산서, 대차대조표, 현금흐름표) 를 연결하여, 하나의 숫자를 변경하면 모든 것이 자동으로 업데이트되도록 합니다.
  • "만약에" 시나리오를 처리합니다 (예: "매출이 10% 떨어지면 어떻게 될까요?").
  • 전문적으로 보이고, 읽기 쉬우며, 나중에 사람이 수정하기 쉽습니다.

저자들은 기존 테스트들이 너무 쉬웠음을 깨달았습니다. 그들은 AI 가 몇 개의 벽돌을 놓을 수 있는지만 테스트했을 뿐, AI 가 전체 성을 구축할 수 있는지 테스트하지는 않았습니다.

2. 해결책: AI 를 위한 새로운 "체육관"

저자들은 전문 대회와 교육 과정에서 가져온 실제 금융 도전 과제로 가득 찬 새로운 테스트 환경인 WorkstreamBench를 만들었습니다.

최종 숫자가 맞는지 확인하는 것 (수학 선생님이 정답 키를 확인하는 것과 같음) 대신, 인간 상사가 보고서를 검토하는 방식과 유사하게 AI 의 작업 품질을 판단하기 위한 3 단계 채점 기준을 만들었습니다:

  • 정확성 (수학): 최종 숫자가 정확한가요? AI 는 요청된 시나리오 분석을 실제로 수행했나요?
  • 공식 (논리): 후드의 "엔진"이 잘 구축되었나요?
    • 비유: 자동차를 상상해 보세요. 나쁜 건축가는 엔진 부품을 순간접착제로 붙일 수 있습니다 (하드코딩된 숫자). 나중에 엔진을 변경해야 한다면 차를 분해해야 합니다. 좋은 건축가는 볼트와 나사를 사용합니다 (동적 공식) 그래서 차를 수리하고 업그레이드하기 쉽습니다. AI 는 접착제가 아닌 볼트를 사용해야 합니다.
    • 그들은 또한 논리가 읽기 쉬운지도 확인합니다. 거대하고 혼란스러운 공식은 꼬인 털실 뭉치와 같고, 단계별 공식은 명확한 설명서와 같습니다.
  • 형식 (프레젠테이션): 전문적으로 보이나요?
    • 숫자가 정렬되어 있나요? 음수는 마이너스 기호 대신 괄호 안에 표시되어 있나요 (금융 표준)? 글꼴은 일관되나요? 스프레드시트가 지저분해 보이면 수학이 맞더라도 인간 상사는 이를 거부할 수 있습니다.

3. 시험: 누가 시험을 보았나요?

저자들은 오늘날 이용 가능한 가장 똑똑한 AI 에이전트들, 즉 Claude, ChatGPT, Gemini 등의 버전을 포함한 여러 에이전트를 테스트했습니다. 일부는 브라우저에서 채팅하는 "웹" 버전이었고, 일부는 스프레드시트 소프트웨어 내부에 존재하는 플러그인인 "엑셀" 버전이었습니다.

4. 결과: "정직한" 성적표

결과는 "잠재력 있음"과 "주요 업무 수행 준비 부족"이 섞여 있었습니다.

  • 리더: Claude Web 에이전트가 가장 잘 수행했습니다. 인간이 읽고 편집하기 가장 쉬운 가장 전문적으로 보이는 스프레드시트를 구축했습니다.
  • 격차: 최고의 AI 라도 약 100 점 만점에 69 점만 받았습니다.
  • 고난: 작업이 더 어려워질수록 (더 긴 계산 체인을 요구할수록) AI 의 성능은 급격히 떨어졌습니다.
    • 비유: 간단한 덧셈 문제를 완벽하게 풀 수 있는 학생이 복잡한 대수학 응용 문제를 풀라고 하면 혼란을 겪고 실수를 하는 것과 같습니다.
  • 일반적인 실수:
    • 하드코딩: 숫자를 계산하는 공식을 작성하는 대신, AI 는 때때로 단순히 숫자를 입력했습니다. 이는 은행이 계산하도록 상자에 "100"을 적는 대신 수표에 "100"이라고 쓰는 것과 같습니다. 입력이 변경되면 AI 의 답변은 틀리게 됩니다.
    • 지저분한 형식: AI 는 종종 숫자를 정렬하는 것을 잊거나 잘못된 색상을 사용하여 스프레드시트가 전문적으로 보이지 않게 만들었습니다.
    • 포기: 매우 어려운 작업에서 일부 AI 는 스프레드시트 전체 섹션을 비워두거나 단순히 숫자를 만들어냈습니다.

5. 결론

이 논문은 AI 에이전트가 단순한 작업에는 능숙해지고 있지만, 스스로 전문 수준의 재무 모델을 신뢰할 수 있게 구축할 준비는 아직 되지 않았음을 결론지었습니다.

그들은 수학은 할 수 있지만, 형식을 확인하고 논리 오류를 수정하며 최종 산물이 고객이 실제로 신뢰할 수 있는 것인지 확인하기 위해 여전히 인간 감독자가 필요한 매우 재능 있는 인턴과 같습니다. 기술은 존재하지만, 인간 재무 분석가를 대체하기 위해서는 더 많은 작업이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →