← 최신 논문
🤖 machine learning

V-FiLLM: Verified Financial LLM Reasoning Benchmark

이 논문은 실행 가능한 계산 트리로부터 검증된 금융 추론 과제를 생성하여 복잡하고 구조화된 금융 데이터를 처리하는 LLM의 강건성과 정확성을 평가하고 개선하기 위한 확장 가능한 벤치마크 프레임워크인 V-FiLLM을 소개한다.

원저자: Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-Fantulin

게시일 2026-08-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-Fantulin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 로봇에게 재무 분석가가 되는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇이 지저분한 스프레드시트를 보고, 적절한 숫자를 찾아내며, 수학 계산을 수행하여 회사가 얼마나 많은 돈을 벌었는지 알려주기를 원합니다. 이것이 바로 "대규모 언어 모델(LLM)"의 세계입니다. LLM은 이야기를 쓰거나 질문에 답하는 데는 뛰어나지만, 정밀한 수학을 해야 하거나 복잡한 표를 읽어야 할 때는 때때로 비틀거리곤 하는 컴퓨터 뇌입니다. 이 모델들을 멋진 에세이를 쓸 줄은 알지만, 이익률을 계산하라고 하면 실수로 숫자를 잘못 더할 수도 있는 명석한 학생이라고 생각하면 됩니다. 연구자들이 던지는 큰 질문은 이것입니다. "테스트 자체가 지저지고 불공정하지 않으면서도, 이 학생이 정확히 어느 부분에서 혼란을 느끼는지 보여줄 수 있는 공정한 테스트를 만들 수 있을까?"

여기에 "V-FiLLM"이라는 논문이 등장합니다. 연구자들은 특별하고 매우 체계적인 테스트인 "벤치마크"를 만들었습니다. 로봇에게 실제의 지저분한 은행 보고서(오타가 있거나 페이지가 누락되었을 수 있는)를 읽게 하는 대신, 그들은 완벽한 가짜 재무 스프레드시트를 생성하는 공장을 건설했습니다. 그리고 그들은 "계산 트리(computation tree)"—조상 대신 수학적 단계들을 매핑한 가계도라고 상상해 보세요—를 사용하여 질문을 생성했습니다. 계산이 트리에 내장되어 있기 때문에, 질문이 작성되는 시점에 이미 정답은 수학적으로 보장됩니다. 이를 통해 연구자들은 로봇이 나쁜 필기나 혼란스러운 레이아웃 때문에 방해받지 않고, 순수한 논리에만 집중하여 뇌를 테스트할 수 있게 되었습니다. 그들은 수학적 단계(깊이)가 깊어질수록(더 많은 단계가 필요할수록) 로봇의 답변 능력이 훨씬 떨어진다는 것을 발견했으며, 심지어 숫자(예: "0"을 "O"로 바꾸는 것)를 아주 미세하게 바꾸는 것만으로도 모델이 무너질 수 있다는 것도 발견했습니다. 하지만, 로봇에게 자신의 작업 과정을 단계별로 보여주는 법을 조금 더 추가로 학습시키면 성능이 눈에 띄게 좋아진다는 점도 보여주었습니다.

논문 설명

문제점: "지저분한 책상" 대 "깨끗한 실험실"
아이에게 수학을 가르치려 한다고 상상해 보세요. 만약 당신이 잉크가 번지고 모서리가 찢어진 식료품 영수증을 건네주었는데 아이가 답을 틀렸다면, 아이가 수학을 못 하는 것인지 아니면 영수증을 읽지 못한 것인지 알 수 없습니다. 이것이 기존의 금융 AI 테스트들이 가진 문제입니다. 대부분의 기존 테스트는 누락된 숫자, 이상한 형식, 혼란스러운 텍스트와 같은 "노이즈"가 가득한 실제 문서를 사용했습니다. 이는 AI가 추론 능력이 부족한 것인지, 아니면 단순히 읽기 능력이 부족한 것인지 구분하기 어렵게 만듭니다.

이 논문의 저자들은 대신 "깨끗한 실험실"을 구축하기로 결정했습니다. 그들은 스스로 금융 질문을 생성하는 시스템인 V-FiLLM을 만들었습니다. 그들은 완벽한 합성 스프레드시트(비디오 게임의 인벤토리 화면 같은 것)에서 시작하여 모든 질문을 위한 "계산 트리"를 구축합니다.

  • 트리 비유: 질문을 레시피라고 생각해 보세요. 간단한 질문은 "사과의 가격은 얼마인가?"(깊이 0)입니다. 어려운 질문은 "사과 가격과 바나나 가격을 더하면 얼마인가?"(깊이 1)입니다. 가장 어려운 질문은 세 개의 다른 그릇을 섞고, 굽고, 그 결과들을 결합해야 하는 복잡한 케이크 레시피와 같습니다(깊이 4 이상).
  • 마법 같은 점: 컴퓨터가 먼저 트리를 구축하기 때문에, 질문을 쓰기도 전에 이미 정답을 알고 있습니다. 이는 모든 테스트 항목이 수학적으로 반드시 옳은 "그라운드 트루스(ground truth)"를 가지고 있음을 의미합니다. 인간의 추측이 개입되지 않으며, 정답을 확인하기 위해 누군가 앉아 있을 필요도 없습니다(레이블링 비용이 들지 않습니다).

발견: "깊이"의 함정
연구자들은 Gemma, Llama, Qwen과 같은 유명한 모델들을 포함한 여러 AI 모델을 이 깨끗한 실험실에서 테스트했습니다. 그들은 단순한 질문을 던졌습니다: 수학이 더 어려워지면 어떻게 될까?

그들은 수학적 "깊이"(추론 단계)가 증가함에 따라 AI의 성능이 급격히 떨어지는 것을 발견했습니다.

  • 하락: 단순한 질문(숫자 찾기)에서는 최고의 모델들이 거의 모든 것을 맞혔습니다(약 98%). 하지만 질문이 8단계의 추론(복잡한 케이크 레시피처럼)을 요구하자마 일부 모델의 정확도는 **26%**까지 폭락했습니다.
  • 적대적 반전: 그들은 또한 데이터에 영향을 주지 않는 방식으로 데이터를 조작하여 모델을 "속이는" 실험도 했습니다. 예를 들어, 숫자를 "쓰레기" 값으로 교체하거나 단위를 변경했습니다(예: 달러를 센트로 교체). 그들은 OCR 스타일의 문자 오염(숫자 "0"을 알파벳 "O"로, 또는 "1"을 "l"로 바꾸는 것)이 모델을 망가뜨리는 데 가장 효과적이라는 것을 발견했습니다. 실제처럼 보이는 문서의 단위를 바꿨을 때, 최고 성능의 모델의 점수는 거의 100%에서 단 **3.0%**로 급락했습니다. 이는 모델들이 숫자는 읽고 있지만, 그 숫자가 무엇을 의미하는지 알려주는 라벨(단위)은 종종 무시하고 있음을 시사합니다

해결책: AI에게 "풀이 과정 보여주기"를 가르치기
논문은 또한 이러한 문제들을 해결하는 방법을 테스트했습니다. 그들은 LoRA(Low-Rank Adaptation)라는 기술을 사용했는데, 이는 AI의 전체 뇌를 다시 훈련시키는 대신 특정하고 가벼운 학습 매뉴얼을 주는 것과 같습니다.

  • 방법: 그들은 "계산 트리"를 단계별 "생각의 사슬(Chain-of-Thought)" 설명으로 변환했습니다. 그들은 AI의 추론이 검증된 데에만 이 예시들을 사용했습니다.
  • 결과: 이러한 타겟팅된 훈련 후에, 더 작은 모델(Qwen3-4B)은 새로운 미지의 문제들에 대해 정확도가 **81.1%**에서 **85.6%**로 향상되었습니다. 또한 실제 데이터셋인 FinQA에서도 기존 버전을 5 퍼센트 포인트 앞지르며 더 나은 성적을 거두었습니다. 이는 문제를 작은, 검증된 단계로 나누도록 AI를 가르치는 것이 엄청난 컴퓨팅 자원을 필요로 하지 않으면서도 모델을 더 똑똑하게 만드는 유망한 방법임을 시사합니다.

결론
이 논문은 AI가 금융 추론 능력이 향상되고 있음에도 불구하고, 논리가 깊어지거나 데이터가 지저분해지면 여전히 크게 고전한다는 결론을 내립니다. 추론의 "깊이"가 가장 큰 장애물입니다. 그러나 그들이 구축한 새로운 벤치마크(V-FiLLM)는 연구자들이 실제 세상의 노이즈 없이 이 진척도를 측정할 수 있는 신뢰할 수 있는 방법을 제공합니다. 저자들은 자신의 작업 과정을 단계별로 보여주는 법에 대한 더 많은 훈련이 이루어진다면, 이 모델들이 훨씬 더 신뢰할 수 있는 금융 비서가 될 수 있다고 제안하지만, 현재로서는 수학이 복잡해지거나 숫자가 조금 이상해지면 여전히 어처구니없는 실수를 저지르기 쉽습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →