← 최신 논문
🤖 AI

Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows

이 논문은 엔론 등 실제 기업 환경의 데이터로 구축된 'Finch'라는 벤치마크를 통해, 복잡한 스프레드시트 기반 재무 및 회계 워크플로우를 수행하는 AI 에이전트들의 현재 성능과 한계를 평가하고 있음을 제시합니다.

원저자: Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Zikun Zhu, Adina Yakefu, Shuxin Zheng

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haoyu Dong, Pengkun Zhang, Yan Gao, Xuanyu Dong, Yilin Cheng, Mingzhe Lu, Zikun Zhu, Adina Yakefu, Shuxin Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

📊 핀치 (FINCH): AI 가 진짜 회계 업무를 할 수 있을까?

이 논문은 **"AI 가 실제로 복잡한 회계와 금융 업무를 잘 해낼 수 있을까?"**라는 질문에 답하기 위해 만들어진 새로운 시험지, **FINCH**에 대한 이야기입니다.

기존의 AI 시험들은 마치 "1+1 은 몇?"이나 "간단한 표 정리" 같은 교과서 문제만 냈습니다. 하지만 현실의 기업 회계 업무는 교과서와 전혀 다릅니다. 이 논문은 그 현실의 혼란스러움을 그대로 옮겨온 시험지를 만들었습니다.


🏗️ 1. 현실은 '정리된 책상'이 아니라 '쓰레기 더미'입니다

상상해 보세요. 어떤 회계사가 업무를 처리할 때의 모습입니다.

  • 파일: 엑셀 파일 100 개가 서로 연결되어 있고, PDF 보고서, 이미지, 웹 검색 결과까지 섞여 있습니다.
  • 상태: 파일 이름은 엉망이고, 표는 깨져 있으며, 수식이 숨겨져 있고, 과거 버전과 현재 버전이 뒤죽박죽입니다.
  • 업무: "지난해 예산을 보고해서, 새로운 시장 데이터를 찾아서, 엑셀에 입력하고, 그래프를 그리고, PDF 로 보고서를 만들어줘."

이런 업무는 한 번에 끝나는 게 아니라, 수십 단계의 과정이 꼬리에 꼬리를 물고 이어집니다.

FINCH는 바로 이런 **'쓰레기 더미 같은 현실 업무'**를 시뮬레이션한 벤치마크입니다.

  • 출처: 실제 엔론 (Enron) 사의 이메일 50 만 개와 엑셀 파일 15,000 개, 그리고 실제 금융 기관들의 자료를 바탕으로 만들었습니다.
  • 특징: 단순히 숫자를 더하는 게 아니라, 문서와 표, 차트, 웹 검색, 코드 작성을 오가며 복잡한 논리를 추론해야 합니다.

비유: 기존 AI 시험이 **"정리된 도서관에서 책 한 권 찾아오기"**라면, FINCH 는 **"쓰레기장 같은 창고에서 100 개의 상자를 뒤져서, 찢어진 지도를 보고, 낡은 지도를 조합해 보물 지도를 완성하고, 그걸로 보고서를 쓰는 것"**과 같습니다.


🧪 2. 시험 결과: 최신 AI 들도 "아직 멀었다"

이 논문은 최신 AI 모델들 (GPT-5.1, Claude, Gemini 등) 을 이 FINCH 시험에 붙여봤습니다. 결과는 충격적이었습니다.

  • 성공률: 가장 강력한 AI 모델인 GPT-5.1 도 100 개 중 38 개 정도만 성공했습니다. (약 38.4%)
  • 소요 시간: 한 업무를 완료하는 데 평균 16 분 48 초가 걸렸습니다.
  • 패턴: 업무가 2 단계 이하로 짧으면 44% 정도 성공했지만, 3 단계 이상으로 길어지면 성공률이 23% 로 뚝 떨어졌습니다.

왜 실패할까요?

  1. 길어지면 망가짐: 첫 단계에서 작은 실수가 나면, 그 오류가 다음 단계로 전염되어 결국 완전히 엉망이 됩니다. (나비효과)
  2. 숨겨진 논리: 엑셀 표의 숫자만 보고 판단하지 않고, 그 숫자를 만든 **숨겨진 수식 (논리)**을 이해해야 하는데, AI 는 이를 놓칩니다.
  3. 혼란스러운 자료: PDF, 이미지, 엑셀이 섞여 있으면 AI 가 "어디서 데이터를 가져와야 하지?"라고 헷갈려 합니다.

비유: AI 는 재능 있는 요리사처럼 보이지만, FINCH 시험은 **"냉장고 안이 엉망진창이고, 레시피가 찢어져 있고, 재료가 100 개나 섞여 있는 상황에서 10 단계 요리"**를 시키는 것과 같습니다. AI 는 첫 단계에서 양파를 잘못 썰면, 그다음 단계부터 모든 요리를 망쳐버립니다.


🔍 3. 왜 이 시험이 중요한가?

이전까지의 AI 연구는 **"AI 가 얼마나 똑똑한가 (지식)"**를 측정하는 데 집중했습니다. 하지만 FINCH 는 **"AI 가 얼마나 오래, 얼마나 복잡하게 일할 수 있는가 (실무 능력)"**를 측정합니다.

  • 현실 반영: 실제 기업에서 일하는 회계사나 금융 전문가가 겪는 지루함, 복잡함, 혼란을 그대로 담았습니다.
  • 진정한 테스트: AI 가 단순히 말을 잘하는 게 아니라, 실제 파일을 만들고, 수식을 고치고, 보고서를 완성할 수 있는지 확인합니다.

💡 결론: AI 는 아직 '인턴' 수준입니다

이 논문의 핵심 메시지는 다음과 같습니다.

"최신 AI 모델들은 매우 똑똑하지만, 현실 세계의 복잡하고 messy(지저분한) 업무를 혼자서 완벽하게 처리할 수준에는 아직 도달하지 못했습니다."

AI 가 진짜 기업 업무의 '동료'가 되려면, 단순히 지식을 늘리는 것을 넘어 오래된 파일을 읽는 능력, 실수를 수정하는 능력, 여러 자료를 연결하는 능력을 키워야 합니다. FINCH 는 바로 그 다음 단계의 AI를 키우기 위한 나침반 역할을 합니다.

한 줄 요약:

"AI 가 학교 시험은 잘 보지만, 실제 직장의 '지저분한 업무'를 처리하려면 아직 갈 길이 멀다. FINCH 는 그 '갈 길이'를 정확히 보여주는 자석 같은 시험지다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →