← 최신 논문
💬 NLP

BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

이 논문은 중국 및 미국 주식 시장의 실제 사용자 데이터를 활용하여 대규모 언어 모델을 평가하기 위한 포괄적인 이중 언어 벤치마크인 BizFinBench.v2를 소개하며, DeepSeek-R1의 우수한 성능에도 불구하고 현재의 최첨단 모델들이 여전히 실질적인 비즈니스 요구 사항에는 미치지 못한다는 점을 밝히고 있다.

원저자: Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 주식 트레이더가 되는 법을 가르치고 있다고 상상해 보세요. 수년 동안 우리는 이 로봇들을 가짜 연습 시험이 가득한 조용하고 거대한 교실에서 테스트해 왔습니다. 로봇들은 시험에서 A+ 성적을 받으며 만점을 받았고, 그래서 우리는 그들이 실제 돈을 관리할 준비가 되었다고 가정했습니다. 하지만 현실 세계의 주식 시장은 조용한 교실이 아닙니다. 그것은 규칙이 매 초마다 변하는 혼란스럽고 시끄러운 롤러코스터입니다.

이것이 바로 이 논문의 저자들이 BizFin \v2가 해결하고자 하는 큰 문제입니다. 그들은 기존의 "교실 테스트"가 우리를 속이고 있다고 주장합니다. 그것들은 실제 금융의 무질서한 현실과 일치하지 않는 가공된 데이터로 만들어졌기 때문입니다. 그래서 저자들은 이 로봇들을 테스트하기 위해 새로운 실전 체육관을 만들었습니다.

새로운 체육관: 실제 데이터, 실제 이해관계

가짜 질문 대신, 이 새로운 벤치마크는 실제 사람들이 중국 및 미국 주식 시장의 실제 금융 앱에서 던진 28,860개의 실제 질문을 사용합니다. 이것은 교과서 퀴즈를 실제 칩이 걸린 고액의 포커 게임으로 바꾸는 것과 같습니다.

이 체육관에는 두 가지 주요 구역이 있습니다:

  1. 오프라인 구역: 이곳에서 로봇들은 "왜 이 주식이 폭락했는가?" 또는 "이 회사의 보고서를 분석하라"와 같은 까رض거운 질문에 답합니다. 여기에는 데이터 오류를 찾아내는 것부터 사용자가 시장에 대해 느끼는 감정을 예측하는 것까지 8가지의 서로 다른 작업 유형이 있습니다.
  2. 온라인 구역: 이곳은 무서운 곳입니다. 로봇들은 실시간 결정을 내려야 합니다. 그들은 주가가 발생하는 즉시 예측해야 하며, 실시간 시장 데이터에 따라 매 시간 주식을 사고팔며 가상의 포트폴리오를 관리해야 합니다. 이것은 눈을 가린 채 자동차를 운전하는 것과 같지만, 자동차는 시속 100마일로 달리고 있고 도로는 매 초마다 변하고 있는 상황입니다.

결과: 로봇들은 여전히 배우는 중입니다

저자들이 세계 최고의 로봇들을 이 실전 체육관에 투입했을 때, 결과는... 음, 다소 충격적이었습니다.

심지어 슈퍼스타 로봇인 GPT-5조차 정답률이 **61.5%**에 불과했습니다. 학교 시험이라면 괜찮은 점수일지 모르지만, 실제 금융 세계에서는 안전하게 사용하기 위해 **84.8%**의 정답률이 필요합니다. 로봇들은 여전히 실제 비즈니스의 기본 요구 사항을 충족하는 데 실패하고 있습니다.

테스트된 모든 로봇 중에서 DeepSeek-R1이라는 이름의 모델이 눈에 띄었지만, 함정이 있었습니다. 이 모델은 온라인 투자 게임에서 "우수한 투자 효능"을 보여준 유일한 모델로, 실제로 **+47.34%**의 수익을 냈습니다. 하지만 동시에 다소 무모하기도 해서, 한 지점에서 자금의 최대 **53%**를 잃기도 했습니다(최대 낙폭). 이는 경주에서 우승은 했지만 시상대에 올라가는 길에 차를 박아버린 레이서와 같습니다. 여러 모델 중 최고였지만, 중간 수준의 전통적인 트레이딩 전략의 성과에 근접할 수 있었던 것은 이 모델뿐이었으며, 나머지 상업용 모델들은 시장을 이기는 데 실패했습니다.

흥미롭게도, 저자들은 "금융 전문가"로 유명한 일부 로봇들이 일반 목적의 로봇들보다 오히려 성적이 저조하다는 것을 발견했습니다. 로봇을 금융 교과서로만 학습시키는 것은, 그 로봇이 실제 시장의 혼돈을 다룰 수 없다면 더 나은 트레이더로 만들지 못한다는 사실이 드러난 것입니다.

"사고"의 함정

저자들은 또한 로봇들에게 답변하기 전에 "단계별로 생각하라"고 지시하는 **연쇄 사고(Chain-of-Thought, CoT)**라는 기술을 시도했습니다. 당연히 도움이 될 것이라고 생각했겠지요? 틀렸습니다. 대부분의 로봇에게 이것은 오히려 독이 되었습니다. 그것은 마치 긴장한 학생에게 수학 문제의 모든 단계를 너무 과하게 분석하라고 말해서 결국 정답을 잊어버리게 만드는 것과 같았습니다. 한 로봇인 Claude-Sonnet-4는 너무 깊이 생각하도록 강요받자 점수가 **39.5%**에서 **13.7%**로 급락했습니다!

다섯 가지 큰 실수

로봇들이 실패한 지점을 분석하면서, 저자들은 그들이 실전에서 저지르는 다섯 가지 구체적인 방식을 찾아냈습니다:

  1. 의미론적 편차 (Semantic Deviation): 단어는 이해하지만 의미를 놓칩니다. 예를 들어, 기술 기업과 반도체 기업이 둘 다 "기술"이라는 단어를 사용한다는 이유로 동일하다고 생각하여, 두 회사가 완전히 다른 사업체라는 점을 간과합니다.
  2. 논리적 불연속성 (Logic Discontinuity): 긴 이야기의 맥락을 놓칩니다. 긴 기간에 걸친 인과관계를 추적하라고 하면 혼란에 빠져 흐름을 놓쳐버립니다.
  3. 다변량 분석 (Multivariate Analysis): 너무 많은 공을 한꺼번에 돌리지 못합니다. 뉴스, 차트, 사용자 감정을 결합하여 결정을 내려야 할 때, 정보에 압도되어 잘못된 요인을 선택합니다.
  4. 고정밀 왜곡 (High-Precision Distortion): 수학에 약합니다. 금융에서 아주 작은 소수점 오차는 수백만 달러의 손실을 초래할 수 있는데, 이 로봇들은 종종 숫자를 잘못 계산합니다.
  5. 시간 순서 혼동 (Time-Order Disorder): 타임라인을 뒤섞습니다. 어떤 사건이 반응을 일으키기 에 발생했다고 생각하거나 그 반대로 생각하여, 이야기의 순서를 완전히 뒤집어 버립니다.

핵심 요약

이 논문은 AI 모델들이 점점 똑똑해지고는 있지만, 아직 당신의 개인 재무 상담사가 될 준비는 되지 않았음을 시사합니다. 그들의 "시험 점수"와 "실제 성능" 사이의 간극은 매우 큽니다. 저자들이 AI가 쓸모없다고 말하는 것이 아니라, 가짜 교실에서 테스트하는 것을 멈추고 실제의 혼란스러운 체육관에서 테스트해야 한다고 말하는 것입니다. 그들이 일관되게 **84.8%**의 정확도를 달ب성할 때까지, 우리는 그들에게 돈을 맡기는 데 매우 주의해야 합니다.

좋은 소식은요? 저자들은 다른 과학자들이 로봇이 실전에 대비할 수 있도록 돕는 데 사용할 수 있도록 자신들이 만든 데이터와 "체육관"을 공유하고 있다는 점입니다. 하지만 지금으로서는, 로봇들은 여전히 마스터가 아닌 그저 학생일 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →