← 최신 논문
🤖 AI

AUDITFLOW: Executable Symbolic Environments for Structured Financial Reporting Verification

AuditFlow는 기호적 환경을 적응형 탐색 및 결정론적 검증과 통합하여 보고된 사실을 분류 체계 개념에 연결하고 값을 재계산함으로써 구조화된 재무 감사 정확도를 크게 향상시키며, 벤치마크 데이터셋에서 82.09%의 정확도를 달성한 그래프 기반 멀티 에이전트 프레임워크입니다.

원저자: Yan Wang, Xuguang Ai, Jaisal Patel, Xueqing Peng, Fengran Mo, Yupeng Cao, Haohang Li, Mingyu Cao, Lingfei Qian, Víctor Gutiérrez-Basulto

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yan Wang, Xuguang Ai, Jaisal Patel, Xueqing Peng, Fengran Mo, Yupeng Cao, Haohang Li, Mingyu Cao, Lingfei Qian, Víctor Gutiérrez-Basulto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

화이트보드에 적힌 복잡한 수학 문제를 검증하려고 하는데, 숫자들이 여러 방에 흩어져 있고, 문제를 푸는 규칙은 거대하고 먼지 쌓인 백과사전에 적혀 있는 상황을 상상해 보십시오.

이것이 바로 AUDITFLOW가 해결하고자 하는 과제입니다. 다만, 수학 문제 대신 재무 보고서(상장 기업이 정부에 제출하는 것과 같은)를 확인하는 것입니다.

다음은 논문의 내용을 쉬운 개념으로 나누어 설명한 것입니다.

문제점: 왜 AI는 돈 계산에 어려움을 겪는가

현재의 AI 모델(에세이를 쓰거나 대화를 나누는 모델들)은 텍-스트를 읽는 데는 매우 뛰어납습니다. 하지만 재무 감사는 단순히 읽는 것이 아니라, 수학과 규칙에 관한 것입니다.

  • 문제점: 특정 숫자가 맞는지 확인하기 위해, AI는 문맥을 바탕으로 "추측"해서는 안 됩니다. AI는 공시 서류에서 특정 숫자를 찾아내고, 거대한 회계 백과사전(택소노미라고 불리는)에서 규칙을 찾아낸 다음, 직접 계산을 수행하고 그 결과를 비교해야 합니다.
  • 실패 원인: 일반적인 AI에게 이 작업을 시키면, AI는 텍스트를 통해 "추론"하려고 시도하느라 숫자를 "환각(hallucination)"하거나 규칙을 놓치게 됩니다. 논문에 따르면, 도움 없이 단독으로 수행할 경우 최고의 AI조차 정답률이 약 **14%**에 불과합니다.

해결책: AUDITFLOW (The "3인 감사 팀")

저자들은 AUDITFLOW라는 시스템을 구축했습니다. 하나의 AI에게 모든 것을 맡기는 대신, 심볼릭 환경(디지털 작업 공간)과 세 명의 특화된 에이전트로 구성된 팀을 만들었습니다.

건설 현장을 상상해 보십시오:

  1. 환경 (설계도와 도구):
    시스템은 디지털 지도를 만듭니다. 한 부분은 정적 지도(회계 규칙/백과사전)이고, 다른 한 부분은 동적 지도(실제 기업의 재무 보고서)입니다.
    결정적으로, AI는 수학을 "추측"하지 않습니다. AI는 완벽하게 작동하도록 하드코딩된 타입 도구(계산기나 자와 같은)를 사용합니다. AI는 어떤 도구를 사용할지 결정하지만, 실제 계산은 도구가 수행합니다.

  2. 팀 (에이전트):

    • 주니어 감사인 A (규칙 검사자): 이 에이전트는 규칙을 먼저 봅니다. "회계 백과사전에 이 숫자가 무엇이어야 한다고 적혀 있는가?"를 묻습니다. 이 에이전트는 정적 지도를 사용합니다.
    • 주니어 감사인 B (증거 탐색자): 이 에이전트는 사실을 먼저 봅니다. 실제 기업의 공시 서류를 뒤져 숫자를 찾고, 이 숫자가 작년과 일치하는지, 단위가 적절한지 확인합니다. 이 에이전트는 동적 지도를 사용합니다.
    • 시니어 감사인 (판사): 이 에이전트는 두 주니어의 말을 듣습니다. 만약 두 사람이 의견이 일치하면 업무가 완료됩니다. 만약 의견이 다르면(예: 한 명은 "위반"이라고 하고 다른 한 명은 "정상"이라고 하는 경우), 시니어 감사인은 그들에게 갈등이 있는 특정 부분을 더 깊이 조사하도록 요청합니다.

결론에 도달하는 방법

시스템은 단순히 AI에게 "어떻게 생각하니?"라고 묻지 않습니다.
대신, 증거 집계(Evidential Aggregation) 과정을 사용합니다.

  • 두 명의 주니어 감사인이 증거 카드를 들고 있다고 상상해 보십시오.
  • 두 카드 모두 "위반"이라고 적혀 있다면, 시스템은 100% 확신합니다.
  • 한 명은 "위반"이라고 하고 다른 한 명은 확신하지 못한다면, 시스템은 실제로 발견한 증거의 양을 바탕으로 "신뢰 점수"를 계산합니다.
  • 최종 답변은 판결(통과/실패), 기댓값(숫자가 되어야 하는 값), 그리고 신뢰 점수의 조합으로 이루어집니다.

결과: 이것이 중요한 이유

논문은 이 시스템을 실제 재무 공시 데이터셋으로 테스트했습니다.

  • 승자: AUDITFLOW는 정답을 **82%**의 확률로 맞혔습니다.
  • 패자: 그다음으로 우수한 방법(단일 AI 에이전트가 모든 것을 수행하는 방식)은 **67%**만 맞혔습니다.
  • "마법의" 요소: 가장 중요한 발견은, 만약 결정론적 도구(하드코딩된 수학 체크 도구)를 제거하고 AI가 수학을 추측하게 내버려 둔다면, 정확도가 **17%**로 폭락한다는 것이었습니다.

핵심 요약

이 논문은 재무 감사와 같이 이해관계가 걸린 고도의 작업에서는, AI의 "직관"이나 텍스트 기반의 추론에만 의존해서는 안 된다고 주장합니다. 탐색(정보 찾기)과 연산(수학 계산)을 분리해야 합니다.

AUDITFLOW가 성공적인 이유는, AI를 스스로 계산기가 되려고 노력하는 존재가 아니라, 계산기와 규칙 책을 사용할 줄 아는 스마트한 관리자로 취급하기 때문입니다. 이 시스템은 AI가 자신의 뇌가 아닌 코드로써 수학을 수행하는 "심볼릭 환경"을 사용하도록 강제합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →