← 최신 논문
🤖 machine learning

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

이 논문은 단 하나의 '정답'이 아닌 관찰된 애널리스트의 관행에 대비하여 AI가 구축한 금융 모델을 평가하는 새로운 벤치마크인 GAUGE를 소개하며, 현재의 에이전트들이 기계적인 모델 구축에는 뛰어나지만 가치 평가 판단에 있어서는 여전히 인간 전문가에 비해 크게 뒤처져 있음을 밝히고 있다.

원저자: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 요리 경연 대회의 심사위원이라고 상상해 보십시오. 보통 심사위원들은 단 하나의 '완벽한' 레시피 카드를 가지고 있습니다. 만약 참가자의 요리가 이 카드와 조금이라도 맛이 다르면 점수를 잃게 됩니다. 하지만 라자냐를 만드는 맛있는 방법이 열 가지나 있다면 어떨까요? 만약 '완벽한' 레시피가 그저 한 사람의 의견일 뿐이고, 참가자의 버전은 다른 향신료를 사용했을 뿐 똑같이 맛있다면 어떨까요? 이것이 바로 과학자들이 금융 모델링과 같은 복잡한 과제를 수행하는 AI를 테스트할 때 직면하는 문제입니다. 금융 모델링은 기업의 미래를 예측하는 상세한 예측 기계를 만드는 것과 같습니다. 여기에는 과거 매출과 같은 확고한 사실과, 기업이 얼마나 빨리 성장할 것인지에 대한 교육된 추측(예상치)이 혼합됩니다. 수십 년 동안 우리는 AI의 추측을 단 한 명의 전문가의 정답과 비교하여 테스트해 왔습니다. 하지만 전문가들 사이에서도 최선의 추측에 대해 의견이 갈린다면, AI가 합리적인 다른 답을 내놓았다는 이유로 벌을 주는 것은 불공평해 보입니다. 이 논문은 질문합니다: 정답이 하나가 아닐 때, 우리는 AI를 어떻게 채점해야 하는가?

이 연구의 저자들은 GAUGE라는 이름의 연구를 통해, 단 하나의 완벽한 금융 모델이 있는 척하는 것을 그만두기로 했습니다. 그들은 AI 에이전트가 이러한 복잡한 금융 '예측 기계'를 구축할 수 있는지, 그리고 더 중요하게는, 그 안에 담긴 판단을 인간 전문가처럼 내릴 수 있는지를 확인하기 위해 새로운 테스트 환경을 구축했습니다.

먼저, 그들은 기존의 채점 방식을 테스트했습니다. 그들은 동일한 기업에 대해 서로 다른 인간 전문가들이 만든 108쌍의 금융 모델을 가져왔습니다. 기존의 '단 하나의 완벽한 정답' 규칙을 사용하여 한 전문가의 모델을 다른 전문가의 모델과 대조하여 채점했을 때, 결과는 충격적이었습니다. 중앙값 점수는 1.0점 만점에 0.33점에 불과했습니다. 실제로 92.6%의 쌍이 0.70점 미만의 점수를 받았습니다. 이는 모두가 전문가인 전문 인력들조차 서로 너무나 다르게 의견을 내기 때문에, 만약 한 명을 '진실'로 간주한다면 다른 한 명은 낙제하게 된다는 것을 의미합니다. 결국 금융의 세계에서는 '다르다'는 것이 '틀렸다'는 것을 의미하지 않습니다.

이를 해결하기 위해 팀은 GAUGE(Golden Answer 없이 에이전트가 구축한 금융 모델 채점하기)를 만들었습니다. 단 하나의 레시피 카드 대신, 그들은 실제 전문가들이 실제로 하는 행동을 기반으로 한 '안전 영역(safety envelope)'을 만들었습니다. 과녁의 중심이 하나의 점이 아니라 넓은 고리라고 상상해 보십시오. 만약 AI의 추측이 그 '합리적인 전문가의 행동' 범위 안의 고리 어디에라도 착륙한다면, 점수를 받게 됩니다. 이 시스템은 두 가지를 확인합니다:

  1. 메커니즘: 수학적 계산이 제대로 작동했는가? 스프레드시트의 균형이 맞는가? (오븐이 실제로 켜졌는지 확인하는 것과 같습니다).
  2. 판단: AI의 추측이 실제 전문가들이 방어 가능하다고 간주하는 범위 안에 들어오는가? (양념이 좋은 셰프의 입맛 범위 안에 있는지 확인하는 것과 같습니다).

그들은 24개의 서로 다른 AI 에이전트를 이 새로운 시스템으로 테스트했으며, 금융 전공 학생부터 시니어 분석가에 이르는 55명의 인간 그룹도 함께 테스트했습니다. 결과는 다음과 같았습니다:

  • AI는 수학에는 능숙해지고 있지만, 직관(gut feeling)에는 서툽니다. AI 에이전트들은 기계적인 부분에서 탁월했습니다. 최고의 AI는 기계적 검사(스프레드시트 공식이 올바른지 확인하는 작업)의 93%를 통과했습니다. 그러나 판단 부분(실제 예측을 수행하는 것)에 있어서는 최고의 AI조차 78%만을 통과했습니다.
  • '격차'는 실재합니다. AI 에이전트들은 평균적으로 모델을 구축하는 것보다 가치 평가 판단을 내리는 데 있어 26점 더 낮은 성적을 보였습니다. 그들은 자동차를 만들 수는 있지만, 아직 운전하는 데는 서툽니다.
  • 여전히 인간이 승리합니다. 최고의 AI는 53.4점을 기록했습니다. 이는 평균적인 금융 전공 학생(43.2점)보다는 높았지만, 모든 시니어 분석가(평균 88.3점)와 대부분의 주니어 분석가보다는 낮았습니다. AI는 숙제를 할 만큼 똑똑하지만, 상사가 되기에는 아직 부족합니다.

이 연구는 AI가 복잡한 금융 모델을 구축하는 데 매우 유능해지고 있지만, 가장 어려운 부분인 전문가들이 기업의 가치를 평가할 때 사용하는 미묘하고 방어 가능한 판단을 내리는 것은 여전히 큰 도전 과제로 남아 있음을 시사합니다. 저자들은 단순히 점수를 찾아낸 것이 아닙니다. 그들은 단 하나의 완벽한 답을 찾는 기존의 방식이 인간과 기계 모두에게 불공평하다는 것을 증证明했으며, 전문가 간의 의견 불일치라는 복잡한 현실을 존중하면서 발전 과정을 측정할 수 있는 새로운 방법을 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →