← 최신 논문
🤖 AI

FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction

이 논문은 금융 지표 구축의 네 가지 엔드 투 엔드 단계를 가로질러 딥 리서치(Deep Research) 에이전트를 평가하기 위해 설계된 최초의 벤치마크인 FinDeepIndicator를 소개하며, 이러한 에이전트들이 표준 검색 기능 탑재 LLM보다 뛰어난 성능을 보임에도 불구하고 실제적인 금융 분석 시나리오 내에서의 데이터 검색 및 수치 실행의 신뢰성 측면에서는 여전히 어려움을 겪고 있음을 밝힌다.

원저자: Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀기 위해 노력하는 탐정이라고 상상해 보십시오. 하지만 단순히 목격자에게 "무엇을 보았습니까?"라고 묻는 수준이 아니라, 모든 일을 스스로 해내야 합니다. 어떤 질문을 던질지 결정해야 하고, 인파로 북적이는 도시에서 목격자를 찾아내야 하며, 그들의 이야기를 듣고, 그것을 받아 적고, 이야기가 앞뒤가 맞는지 확인하기 위해 수학적 계산을 수행한 뒤, 마지막으로 판사에게 판결을 전달해야 합니다. 이것이 바로 '딥 리서치(Deep Research)' 에이전트의 세계입니다. 이들은 단순한 정보 제공을 넘어, 스스로 정보를 찾아다니고, 조각들을 맞추며, 처음부터 복잡한 문제를 해결하도록 설계된 매우 똑똑한 컴퓨터 프로그램입니다. 하지만 여기에는 함정이 있습니다. 컴퓨터가 인간처럼 말을 할 수 있다고 해서 반드시 인간처럼 행동할 수 있는 것은 아니라는 점입니다. 단어의 정의는 완벽하게 알지 몰라도, 도서관에서 올바른 책을 찾는 데 실패하거나 페이지 수를 세는 덧셈에서 실수를 저지를 수도 있습니다.

금융의 세계에서 이는 매우 중요한 문제입니다. 금융 지표는 경제의 성적표와 같습니다. 즉, 기업이 건전한지, 주식 시장이 불안한지, 혹은 국가가 성장하고 있는지를 알려주는 숫자들입니다. 이 숫자들을 얻기 위해서는 단순히 추측해서는 안 됩니다. 수년간의 재무 보고서를 샅샅이 뒤지고, 특정 기업에 대한 정확한 숫자를 찾아내고, 데이터를 직접 계산해야 합니다. 과학자들은 이러한 업무를 수행하여 인간 분석가를 대체하거나 도울 수 있도록 이 '딥 리서치' 에이전트들을 구축해 왔습니다. 하지만 지금까지는 이 에이전트들이 실제로 이 모든 복잡한 과정을 처음부터 끝까지 처리할 수 있는지, 아니면 그저 중간에 어처구니없는 실수를 저지르면서 똑똑한 척하는 것에 불과한지를 제대로 테스트한 사람이 없었습니다.

이러한 디지털 탐정들을 테스트하기 위해 연구팀이 만든 새로운 '시험'인 FinDeepIndicator가 등장했습니다. 이 벤치마크를 금융 에이전트를 위해 설계된 거대한 장애물 코스라고 생각하십시오. 단순히 "X 기업의 이익은 얼마인가?"라고 묻는 대신, 이 시험은 에이전트에게 네 가지 명확한 과업을 수행하도록 강요합니다. 첫째, 필요한 정확한 수학 공식(예: '영업이익률'은 이익을 매출로 나누는 것이라는 점)을 파악해야 합니다. 둘째, 인터넷에서 원시 데이터를 찾아 나서야 합니다. 셋째, 중간 결과값을 얻기 위해 실제로 수학 계산을 해야 합니다. 마지막으로, 정확한 최종 답안을 제시해야 합니다. 연구진은 미국과 중국의 800개 실제 기업으로부터 추출한 10년 치 데이터를 바탕으로, 234가지 유형의 다양한 금융 지표를 아우르는 3,350개의 서로 다른 질문을 사용하여 이 코스를 구축했습니다.

에이전트들을 이 장애물 코스에 투입했을 때, 결과는 '나쁘지 않음'과 '이런 세상에' 사이를 오갔습니다. 에이전트들은 첫 번째 단계인 '규칙 이해'에서는 놀라울 정도로 뛰어났습니다. 그들은 70% 이상의 확률로 공식을 정확히 식별해 냈는데, 이는 그들이 금융 용어의 의미를 정말로 이해하고 있음을 보여줍니다. 그러나 막상 데이터를 '찾으러' 나가는 순간, 성능은 곤두박질쳤습니다. 에이전트들은 올바른 숫자를 찾는 데 어려움을 겪었으며, 종종 잘못된 연도를 가져오거나, 잘못된 기업을 선택하거나, 결정적인 정보를 통째로 놓치기도 했습니다. 이 '데이터 수집' 단계가 가장 큰 병목 현상이었으며, 성능 저하를 일으킨 가장 큰 원인이었습니다.

단순한 검색 엔진보다 더 나은 계획을 세우고 도구를 사용할 줄 아는 가장 똑똑한 에이전트조차 최종 정답을 맞힌 비율은 약 40%에 불-과했습니다. 연구진은 에이전트들이 데이터가 무질서하고 출처가 다양한 '거시경제' 지표(인플레이션이나 고용률 등)에서 특히 취약하며, 복잡한 이동 계산이 필요한 '기술적' 지표에서는 훨씬 더 고전한다는 것을 발견했습니다. 흥ًا히도, 에이전트들은 중국 시장 데이터보다 미국 시장 데이터에서 약간 더 나은 성과를 보였는데, 이는 국가마다 데이터를 조직하고 보고하는 방식이 큰 차이를 만든다는 점을 시사합니다.

결론적으로, 이 AI 에이전트들은 금융의 '이론'은 잘 알지 모르지만, 사실을 파헤치고 계산하는 '실무'에는 여전히 서툽니다. 이 논문은 우리가 이 에이전트들을 진정으로 실무에 유용하게 만들고 싶다면, 단순히 대화를 얼마나 잘하는지에 집중할 것이 아니라, 신뢰할 수 있는 데이터를 찾고 실수 없이 처리하는 능력을 개선하는 데 집중해야 한다고 제언합니다. 그때까지 이들은 법은 완벽하게 알지만 범죄 현장으로 가는 길을 헤매는 유능한 탐사와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →