← 최신 논문
💰 quantitative finance

RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?

본 논문은 필수 전제를 질문에서 제거하여 금융 추론을 평가하는 이중언어 벤치마크인 REALFIN을 소개하며, 이를 통해 일반 및 금융 특화 대형 언어 모델 모두 누락된 정보를 인식하는 데 어려움을 겪고 종종 근거 없는 답변에 과도하게 확신하는 경향이 있음을 드러냅니다.

원저자: Yuyang Dai, Yan Lin, Zhuohan Xie, Yuxia Wang

게시일 2026-04-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuyang Dai, Yan Lin, Zhuohan Xie, Yuxia Wang

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

재무 설계사를 고용한다고 상상해 보세요. "이 채권을 사야 할까요?"와 같은 질문을 한다면, 진정한 신뢰할 수 있는 조언자는 단순히 답을 추측하지 않을 것입니다. 대신 먼저 귀하가 충분한 정보를 제공했는지 확인합니다. 만약 위험 감수성이나 현재 인플레이션율을 언급하는 것을 잊었다면, 좋은 조언자는 "아직은 답할 수 없습니다. 더 많은 세부 사항이 필요합니다"라고 말할 것입니다.

이 논문인 RealFin은 AI 재무 설계사 (대형 언어 모델) 가 동일한 신중함을 가지고 있는지 확인하기 위해 고안된 엄격한 '함정 테스트'와 같습니다.

연구자들이 수행하고 발견한 내용을 간단한 비유로 정리해 보겠습니다:

1. 함정: '부족한 재료' 레시피

대부분의 AI 테스트는 완벽한 레시피로 요리하는 것과 같습니다: "밀가루 2 컵, 달걀 1 개를 섞고 30 분간 굽습니다." AI 는 단순히 단계를 따르고 "케이크!"라고 말합니다.

RealFin 팀은 게임을 바꾸었습니다. 그들은 실제 재무 시험 문제를 가져와 비밀리에 핵심 재료를 제거했습니다 (예: 온도나 밀가루 종류). 하지만 문장은 정상적으로 보이도록 유지했습니다.

  • 옛날 방식: AI 는 누락된 단계를 보지만 어쨌든 추측하려 합니다. "350 도라고 가정하겠습니다!"라고 말하며 자신감 있는 답변을 내놓습니다.
  • RealFin 방식: AI 는 "잠깐, 온도를 모르면 이 케이크를 구울 수 없어. 그 정보를 요청해야 해"라고 깨달아야 합니다.

2. 실험: 누가 걸렸을까?

연구자들은 일반적인 '똑똑한' AI 에서부터 전문적인 '재무 전문가' AI 에 이르기까지 15 개의 서로 다른 AI 모델을 테스트했습니다. 그들은 세 가지 유형의 과제를 제시했습니다:

  1. 완전한 레시피: 모든 정보가 포함된 질문 (쉬운 테스트).
  2. 부족한 재료: 숨겨진 간극이 있는 질문 (함정).
  3. "위의 모든 것 아님" 테스트: 정보가 부족하여 어떤 답도 정답이 될 수 없는 질문.

결과:

  • "과도하게 자신감 있는" 일반 모델: 일상적으로 대화하는 대형 범용 AI 들은 자신이 모른다고 인정하는 데 가장 서툴렀습니다. 그들은 시험에서 점수를 얻기 위해 질문이 풀리지 않아도 답을 추측하는 학생처럼 행동했습니다. 질문이 깨져 있음에도 불구하고 "정답은 B 입니다!"라고 자신 있게 말했습니다.
  • "전문가"의 실패: 놀랍게도 재무 데이터로 특별히 훈련된 모델들은 누락된 정보를 파악하는 데 종종 더 나빴습니다. 그들은 수많은 재무 용어를 암기했기 때문에 "세금"이나 "감사"와 같은 단어에 반응하여 즉시 계산을 시작했고, 질문이 불완전하다는 사실을 무시했습니다. 이는 자동차에 엔진이 있는지조차 확인하지 않고 "엔진 소음"을 듣는 순간 바로 기기를 수리하기 시작하는 정비공과 같습니다.
  • "추론"의 영웅들: "단계별로 생각하도록" 설계된 몇몇 새로운 모델 (추론 강화 모델) 은 더 나은 성과를 보였습니다. 그들은 멈추고 누락된 부분을 살펴본 후 "이건 답할 수 없어"라고 말 할 가능성이 더 높았습니다. 하지만 그들조차 때로는 너무 흥분하여 어쨌든 추측을 시작하기도 했습니다.

3. 언어의 반전: 영어 vs 중국어

이 논문은 언어 간의 재미있는 차이를 발견했습니다:

  • 영어: 핵심 단어가 빠지면 문장이 종종 "어색하거나" 불완전하게 들리기 때문에, AI 는 무언가 잘못되었음을 더 자주 알아차렸습니다.
  • 중국어: 언어가 매우 유연합니다. 중요한 조건을 제거해도 문장이 완벽하게 자연스럽고 문법적으로 올바르게 들립니다. AI 들은 질문이 괜찮다고 생각하도록 쉽게 속아 넘어가 무작위로 추측하게 되었습니다. 이는 마치 주인공이 빠져 있지만 마치 완전한 이야기처럼 들리는 문장과 같습니다.

4. 주요 교훈

이 논문은 질문에 답하는 데 능숙한 것만으로는 충분하지 않다고 결론 내립니다.

실제 금융 세계에서는 수학을 잘못 계산하는 것이 가장 위험한 실수가 아닙니다. 아직 답해서는 안 되는 질문에 답하는 것이 가장 위험합니다.

  • 현재의 AI는 자신이 통과할 수 있다고 생각하며 빨간불을 속도로 통과하는 자신감 있지만 무모한 운전자와 같습니다.
  • 신뢰할 수 있는 AI는 아무도 지켜보지 않더라도 규칙을 알고 있기 때문에 빨간불에서 멈추는 신중한 운전자와 같아야 합니다.

저자들은 AI 가 금융 분야에서 안전하려면 "아니오"라고 말하는 기술을 배워야 한다고 주장합니다. 추론을 멈추고 "hey, 중요한 것을 말해 주지 않았네요"라고 물을 때를 알아야 합니다.

간단히 말해: 이 논문은 현재 AI 모델들이 너무 기꺼이 만족시키려 한다는 것을 보여줍니다. 질문이 깨져 있음에도 불구하고 그들은 답을 추측할 것입니다. 진정으로 신뢰할 수 있으려면, 때로는 정답이 "충분한 정보가 없습니다"라는 것을 배워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →