← 최신 논문
💰 quantitative finance

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

이 논문은 5가지 핵심 금융 시나리오에 걸쳐 텍스트, 이미지, 비디오를 아우르는 최초의 통합 멀티모달 벤치마크인 UniFinEval을 소개하며, Gemini-3-pro-preview와 같은 현재의 모델들이 성능 면에서 앞서고 있음에도 불구하고 고밀도 정보 처리 및 복잡한 추론 측면에서는 금융 전문가들에 비해 여전히 크게 뒤처져 있음을 밝히고 있습니다.

원저자: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin
게시일 2026-02-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 막대한 자본이 움직이는 투자 회사를 운영하기 위해 새로운 비서를 채용한다고 상상해 보십시오. 이 비서는 두꺼운 재무 보고서를 읽고, 복잡한 차트를 해석하며, 수 시간 분량의 시장 분석 영상을 시청한 뒤, 어디에 돈을 투입할지 현명한 결정을 내릴 수 있는 '슈퍼 분석가'여야 합니다.

오랫동안 우리는 AI 비서들을 간단한 퀴즈로 테스트해 왔습니다. 예를 들어 단 하나의 문단을 읽게 하거나 단순한 그래프를 식별하게 하는 식이었죠. 하지만 현실 세계의 금융은 매우 무질서합니다. 그것은 마치 폭풍우가 치는 바다 위에서 지도도 읽어야 하고, 라디오 방송도 들어야 하며, 동시에 라이브 영상 피드도 지켜봐야 하는 상황과 같습니다. 기존의 테스트들은 너무 쉬웠으며, 실제 업무가 가진 혼란스러움을 반영하지 못했습니다.

유니핀이벌(UniFinEval)의 등장: 궁극의 금융 부트캠프

이 논문의 저자들은 AI 모델을 위한 특별히 설계된, 매우 도전적인 테스트인 UniFinEval을 만들었습니다. 이것은 AI 모델이 고압적이고 정보가 과잉된 실제 금융 환경을 감당할 수 있는지 확인하기 위한 일종의 "생존 코스"입니다.

그들이 이 부트캠프를 구축한 방법은 다음과 같습니다.

1. 부트캠프의 5단계

테스트는 단순히 한 가지 유형의 질문을 던지는 대신, 난이도가 높아짐에 따라 다섯 가지 현실적인 시나리오로 나뉩니다.

  • 1단계: 탐정 (재무제표 감사): AI가 복잡한 범죄 현장을 조사하는 탐정이라고 상상해 보십시오. AI는 텍스트, 차트, 그리고 혼란스러운 레이아웃으로 가득 찬 재무 보고서에서 아주 작은 불일치를 찾아내야 합니다. 이는 누군가 옆에서 주의를 분산시키는 소리를 지르는 와중에 100페이지짜리 문서에서 오타 하나를 찾아내는 것과 같습니다.
  • 2단계: 조사관 (기업 펀더멘털 추론): 이제 AI는 기업이 실제로 건전한지 파악해야 합니다. 다양한 보고서에서 숫자를 추출하고, 복잡한 수학 계산을 수행하며, 텍스트 설명과 그래프 사이의 점들을 연결해야 합니다. 이는 퍼즐 조각들이 서로 다른 언어로 되어 있는 문제를 푸는 것과 같습니다.
  • 3단계: 트렌드 포착가 (산업 트렌드 통찰): AI의 시야가 넓어집니다. 이제 단일 기업이 아니라 산업 전체를 바라봅니다. AI는 수십 개의 기업을 시간에 따라 비교하여 거대한 패턴을 포착해야 합니다. 이는 경기 전체를 보는 것이 아니라, 스타 쿼터백의 활약뿐만 아니라 필드 위의 모든 선수의 성과를 바탕으로 승자를 예측하는 축구 경기를 관찰하는 것과 같습니다.
  • 4단계: 레이더 (금융 리스크 감지): 이 부분은 무척 긴장되는 단계입니다. AI는 시장 분석가가 말하는 영상을 시청하면서 동시에 보고서를 읽고 차트를 살펴봐야 합니다. AI는 소음 속에 숨겨진 위험(리스크)을 포착해야 합니다. 이는 허리케인 속에서 속삭임을 듣는 것과 같습니다.
  • 5단계: 장군 (자산 배분 분석): 최종 보스 단계입니다. AI는 앞선 네 단계에서 배운 모든 것을 활용하여, 모든 리스크와 규칙을 균형 있게 고려하며 돈을 어떻게 투자할지에 대한 최종 결정을 내려야 합니다. 이는 장군이 군대를 어디로 보낼지 결정해야 하는 순간입니다.

2. 게임의 규칙

  • 부정행위 금칙: 테스트 질문은 다른 AI가 작성한 것이 아닙니다(AI는 실수하거나 거짓을 말할 수 있기 때문입니다). 질문은 실제 금융 전문가들—고등 학위를 소지하고 금융 분야에서 수년간의 경력을 쌓은 사람들—에 의해 작성되었습니다.
  • 복합 구성: 테스트는 텍스트, 이미지, 영상을 함께 사용합니다. 단순히 글을 읽는 것만으로는 부족하며, 맥락을 이해하기 위해 차트를 "보고" 영상을 "시청"해야 합니다.
  • 규모: 그들은 영어와 중국어로 된 약 4,000개의 까다로운 질문을 만들어냈습니다.

3. 결과: 누가 통과했는가?

연구진은 가장 똑똑한 10개의 AI 모델("학생들")을 이 부트캠프에 투입했습니다. 결과는 다음과 같았습니다.

  • 최고 성적 보유자: 한 모델, Gemini-3-pro-preview가 1위를 차지했습니다. 이 모델은 약 **74%**의 정답률을 기록했습니다. 수치가 좋아 보일 수 있지만, 이것이 매우 어려운 테스트라는 점을 기억하십시오.
  • 격차: 최고의 AI조차 인간 전문가(약 90~95% 정답률)에 비하면 많은 실수를 저질렀습니다. AI는 텍스트를 읽는 데는 능숙하지만, 영상, 차트, 보고서 사이의 점들을 연결하는 데는 어려움을 겪습니다.
  • 어려움을 겪는 부분:
    • 수학 문제: 많은 모델이 단순한 수학 계산에서 틀렸습니다.
    • 환각 현상(Hallucinations): 일부 모델은 사실이 아닌 내용을 지어냈습니다(마치 모른다고 말하기가 두려워 답을 추측하는 학생처럼 말이죠).
    • "영상" 문제: 영상이 포함되었을 때 대부분의 모델이 길을 잃었습니다. 그들은 시간에 따른 흐름을 따라가는 데 어려움을 겪었습니다.
    • 최종 보스: 가장 어려운 단계(자산 배분)에서 AI의 성능은 현저히 떨어졌습니다. 정보를 수집할 수는 있었지만, 혼란 없이 복잡한 최종 결정을 내리지는 못했습니다.

4. 핵심 요점

이 논문은 AI가 단순한 금융 데이터를 읽고 이해하는 데는 매우 능숙해지고 있지만, 복잡한 실제 상황에서 인간 금융 전문가를 대체할 준비는 아직 되지 않았다고 결론짓습니다.

이렇게 생각해보십시오. AI는 도서관의 책 한 권을 통째로 암기할 수 있는 명석한 학생과 같습니다. 하지만 라이브 영상 피드가 돌아가고, 손은 떨리고, 시계 초침 소리가 들리는 실제 작전 통제실에 놓이게 되면, 그들은 당황하며 실수를 하기 시작합니다.

저자들은 AI가 정확히 어디에서 실패하는지를 보여주기 위해 UniFinEval을 만들었으며, 이를 통해 개발자들이 이 모델들을 실제 돈을 다루는 데 신뢰하기 전에 구체적인 약점들을 보완할 수 있도록 했습니다. 그들은 AI가 곧 주식 시장을 운영할 것이라고 말하는 것이 아니라, "AI가 절벽 아래로 떨어질 가능성이 높은 곳이 어디인지 알려주는 지도"를 제시한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →