← 최신 논문
💰 quantitative finance

Can Open-Weight Models Compete on Financial Text Comprehension?

이 논문은 업데이트된 Financial Touchstone 벤치마크를 통해 20개의 모델을 평가하며, 정보 검색 병목 현상과 중국 모델들의 일관되지 않은 지정학적 거부 행동이 지속됨에도 불구하고 Kimi K2.6과 같은 오픈 웨이트 모델들이 금융 텍스트 이해력에서 폐쇄형 시스템에 필적할 수 있음을 밝혀냈다.

원저자: Jan Spörer

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jan Spörer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 인간처럼 읽고, 쓰고, 추론하는 법을 배우고 있는 세상을 상상해 보십시오. 인공지능(AI)이라 불리는 이 분야는 최근 대화하고, 수학 문제를 풀고, 심지어 코드를 작성할 수도 있는 새로운 모델들과 함께 폭발적으로 성장했습니다. 하지만 함정이 있습니다. 이 초지능적인 컴퓨터들 중 상당수는 '블랙박스'라는 점입니다. 우리는 그것들이 작동한다는 것은 알지만, 정확히 어떻게 만들어졌는지, 혹은 그 코드 안에 어떤 비밀을 품고 있는지는 알지 못합니다. 최근에는 중국 연구소들로부터 '오픈 웨이트(open-weight)' 모델이라는 새로운 물결이 나타났습니다. 이는 미국의 거대 기술 기업들이 사용하는 비밀스럽고 잠겨 있는 버전과 달리, 누구나 연구할 수 있도록 설계도(blueprints)를 공개했다는 것을 의미합니다. 이제 모두의 마음속에 떠오르는 큰 질문은 이것입니다. 이 공개적이고 공적인 모델들이 실제로 재무 보고서를 읽고 진실을 찾아내는 어렵고 지루하지만 매우 중요한 일을 해낼 수 있을까요, 아니면 그저 똑똑해 보이는 척하는 데 능숙한 것뿐일까요?

이 논문은 이 20개의 AI 모델을 대상으로 하는 거대하고 고위험적인 테스트와 같습니다. 연구진은 '파이낸셜 터치스톤(Financial Touchstone)' 챌린지를 설정했는데, 이는 기본적으로 전 세계 기업들의 실제 연례 보고서 495권과 그에 따른 까다로운 질문 2,967개를 짝지어 놓은 거대한 도서관과 같습니다. 이것은 학생에게 495권의 교과서를 주고 "2022년에 X 기업은 얼마나 많은 이익을 냈나요?" 또는 "주요 사업 부문 세 가지는 무엇인가요?"라고 묻는 것과 같습니다. 목표는 어떤 AI가 사실을 지어내지 않고(이를 '환각' 문제라고 합니다) 정답을 찾아내는지, 그리고 책에서 올바른 페이지를 찾지 못해 막히지 않는지를 확인하는 것이었습니다.

결과는 완전히 예상 밖의 반전이었습니다. 오랫동안 사람들은 복잡한 재무 수학을 처리하기 위해서는 특별한 '추론'용 두뇌나 비밀스러운 독점 모델이 필요하다고 생각했습니다. 하지만 이 연구는 오픈 웨이트 모델들이 빠르게 추격하고 있다는 사실을 발견했습니다. 실제로 오픈 웨이트 모델인 Kimi K2.6은 전체 순위에서 3위를 차지하며, 몇몇 유명하고 비밀스러운 미국 모델들을 제쳤습니다! 최고의 성적을 거둔 모델은 사실 Claude Opus 4.6이었으며, 정답률 88.4%를 기록했습니다. 그러나 이야기에는 또 다른 반전이 있습니다. 어떤 모델들은 정답을 찾는 데 뛰어났던 반면, 어떤 모델들은 무언가를 지어내지 않는 데 탁월했습니다. 구글의 Gemini 2.5 Pro는 환각률이 단 0.08%에 불과하여 가장 낮은 거짓말 비율을 보였지만, 정작 정답을 찾아내는 능력 자체는 최고가 아니었습니다.

연구진은 또한 이 모든 AI 모델들의 가장 큰 문제가 그들의 '두뇌'가 아니라 '눈'이었다는 사실을 발견했습니다. 전체 실수의 거의 절반(48.9%)은 컴퓨터가 방대한 보고서에서 읽어야 할 올바른 페이지를 단순히 찾지 못했기 때문에 발생했습니다. 이는 마치 책을 선반에서 찾는 데 서툰 천재와 같습니다. 또 다른 기이한 발견은 일부 중국 모델들이 특정 정치적 인물이나 사건이 언급될 경우, 완벽하게 정상적인 재무 질문임에도 불구하고 갑자기 답변을 거부하는 '안전 필터'를 가지고 있었다는 점입니다. 이는 마치 학생이 공부한 내용이 자신이 지켜야 할 규칙을 떠올리게 한다는 이유로 시험 치르기를 거부하는 것과 같습니다.

그렇다면 결론은 무엇일까요? 이 논문은 오픈 웨이트 모델들이 금융을 이해하는 데 있어 세계 최고의 비밀 모델들과 경쟁할 만큼 충분히 강력해졌음을 시사합니다. 그들은 대단한 일을 해내기 위해 반드시 '추론'형 슈퍼컴퓨터일 필요는 없으며, 때로는 더 단순한 오픈 모델이 똑같이 훌륭한 역할을 수행할 수 있습니다. 하지만 이 연구는 우리가 아직 갈 길이 멀다는 점도 경고합니다. 컴퓨터는 읽는 능력은 좋아지고 있지만, 거대한 문서 속에서 올로한 정보를 찾는 데는 여전히 어려움을 겪고 있으며, 때때로 너무 민감한 안전 규칙에 의해 가로막히기도 합니다. 저자는 우리가 AI 비서가 실제 재무 보고서를 다룰 수 있게 되기 직전이지만, 우리의 돈을 온전히 믿고 맡기기 전에는 그들이 정보를 검색하는 방식을 먼저 고쳐야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →