← 최신 논문
💬 NLP

Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval

DS@GT 팀은 BGE-M3 임베딩과 가중치 적용 역순 순위 결합(weighted Reciprocal Rank Fusion) 및 다음 토큰 로그 확률(next-token log-probabilities)을 통한 직접적인 선택지 점수 산출을 결합하여 다국어 금융 질의응답을 위한 언어 라우팅 기반 검색 증강 파이프라인을 제안하며, 이는 최적의 성능을 위해 언어별 모델 선택과 특정 언어에 대한 사고 사슬(chain-of-thought) 프롬프팅의 신중한 회피가 필요함을 입증한다.

원저자: Justice Ayela, Kabir Sahni

게시일 2026-07-28✓ Author reviewed
📖 5 분 읽기🧠 심층 분석

원저자: Justice Ayela, Kabir Sahni

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 까다로운 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 하지만 단순히 자신의 두뇌만 사용하는 것이 아니라, 바로 옆에 거대한 참고 도서관을 두고 있는 것입니다. 이것이 바로 **검색 증강 생성(Retrieval-Augmented Generation, RAG)**의 세계입니다. 이것은 마치 시험을 치르는 학생이 답을 하기 전에 교과서를 찾아보는 것을 허용받은 것과 같습니다. 보통 컴퓨터는 영어로 된 질문에는 이 작업에 능숙하지만, 스페인어, 그리스어, 또는 힌디어로 된 질문이 들어오면 상황이 엉망이 됩니다. "도서관"은 영어 책으로는 가득 차 있지만 다른 언어로는 비어 있을 수 있고, 학생은 설령 관련 자료를 찾더라도 그 외국어를 읽는 법을 모를 수도 있습니다.

이 논문은 매우 구체적이고 이해관계가 걸린 버전의 이 문제를 다룹니다: 바로 금융 자격증 시험입니다. 이것은 단순한 상식 퀴즈가 아닙니다. 공인 재무 분석가나 회계사가 되기 위한 복잡한 시험으로, 돈, 법률, 그리고 회계 규칙에 대한 깊은 논리를 요구합니다. 저자들이 던지는 핵심 질문은 이것입니다: 우리는 다섯 가지 언어(영어, 스페인어, 그리스어, 중국어, 힌디어)로 진행되는 이 어려운 금융 시험들을 영어만큼이나 잘 통과하는 컴퓨터 시스템을 구축할 수 있을까? 이 질문에 대한 답은 중요합니다. 왜냐하면 금융은 글로벌하지만, 대부분의 컴퓨터 두뇌는 주로 영어 위주로 훈련되어 있어 다른 언어로 된 금융 용어를 처리할 때 거대한 격차가 발생하기 때문입니다.

팀의 거대한 실험: 스마트한 다국어 탐정

조지아 공대의 연구진은 자신들의 팀을 DS@GT라고 부르며, 이 금융 시험 문제들을 해결하기 위해 디지털 탐정 시스템을 구축했습니다. 단순히 추측하는 대신, 그들의 시스템은 "파이프라인"이라고 부르는 엄격한 3단계 과정을 따릅니다.

1단계: 언어 탐정
먼저, 시스템은 질문을 보고 "이것은 어떤 언어인가?"라고 묻습니다. 이는 클럽 입구에서 신분증을 확인하는 보안 요원과 같습니다. 만약 질문이 그리스어라면, 시스템은 도서관의 "그리스어 섹션"에서 책을 가져와야 한다는 것을 알게 됩니다. 만약 도서로 구성된 라이브러리가 해당 언어에 대해 비어 있다면(그리스어나 힌디어 같은 소수 언어의 경우 흔히 발생함), 시스템은 비록 다른 언어일지라도 유사한 개념을 담고 있는 "글로벌 섹션"에서 책을 가져옵니다. 그들은 BGE-M3라는 특수한 도구를 사용하여 질문의 의미를 보편적인 코드로 변환함으로써, 언어 장벽을 넘어 관련 사례를 찾을 수 있도록 했습니다.

2단계: 모델 라우터 (적재적소의 "우뇌")
여기서 팀은 놀라운 사실을 발견했습니다. 그들은 모든 일을 처리하기 위해 하나의 거대한 컴퓨터 두뇌만을 사용하지 않았습니다. 그들은 서로 다른 컴퓨터 두뇌가 서로 다른 언어에 더 적합하다는 것을 발견했습니다.

  • 영어의 경우, Qwen2.5-14B라는 모델을 사용했습니다.
  • 그리스어의 경우, 놀랍게도 더 작은 모델인 Llama-3.1-8B가 훨씬 더 큰 모델들을 압도하며 스타로 떠올랐습니다(약 19.5 퍼센트 포인트 차이!).
  • 중국어, 힌디어, 아랍어의 경우, Qwen3-14B를 사용했습니다.

만약 그들이 모두에게 "최고"인 모델 하나만을 사용했다면, 영어와 그리스어에서는 처참하게 실패했을 것입니다. 이는 마라톤 선수가 장거리 달리기에는 뛰어나지만, 체스 경기를 하도록 시키지는 않는 것과 같습니다. 각 작업에 맞는 다른 전문가가 필요합니다.

3단계: 스코어러 (더 이상의 추측 게임은 없다)
보통 컴퓨터가 질문에 답할 때, "정답은 C입니다"와 같이 "작성"하려고 시도합니다. 이는 컴퓨터가 긴 문단을 쓰다가 정작 자신이 어떤 알파벳을 골랐는지 말하는 것을 잊어버리는 실수를 초래하곤 합니다. DS@GT 팀은 **검색 증강 직접 점수 산출(Retrieval-Augmented Direct Scoring, RADS)**이라는 영리한 트릭을 사용했습니다. 답을 쓰는 대신, 시스템은 단순히 수학적으로 체크합니다: "'A'가 다음 단어가 될 확률은 얼마인가? 'B'는? 'C'는?" 그리고 가장 높은 수학적 점수를 가진 알파벳을 선택합니다. 이것은 컴퓨터가 에세이를 쓰는 대신, 단순히 정답 칸을 찍는 객관식 시험과 같습니다. 이 방법은 기존 방식들이 어려움을 겪었던 중국어 문제에서 거의 100%의 성공률을 달성하며 "파싱 실패(parse failures, 컴퓨터가 자신의 답변을 제대로 읽지 못하는 실수)"를 거의 완벽히 제거했습니다.

놀라운 발견들

팀은 수천 번의 테스트를 수행했고, AI가 작동하는 일반적인 통념을 깨뜨리는 몇 가지 규칙을 발견했습니다.

  1. 너무 많이 생각하는 것이 독이 될 수 있다: 대부분의 사람들에게 "생각의 사슬(Chain-of-Thought, AI에게 단계별로 추론 과정을 설명하도록 요청하는 것)"은 도움이 됩니다. 하지만 그리스어 질문의 경우, 이것은 오히려 성능을 파괴했습니다. 정확도가 환상적인 **90.7%**에서 끔찍한 **20.9%**로 떨어졌습니다. 이 특정 그리스어 질문들은 수학 문제를 푸는 것보다 사실을 분류하는 것에 더 가깝기 때문에, AI가 "소리 내어 생각하게" 만드는 것이 오히려 혼란을 주었습니다. AI는 정답 카테고리를 고르는 대신 이야기를 쓰기 시작했습니다.
  2. "사고 모드"의 함정: Qwen3 모델은 정답을 내놓기 전에 "생각"하는 섹션을 작성하는 기본 설정이 있습니다. 팀은 이 설정을 켜두면 아랍어에 대한 (RADS) 시스템의 정답 선택 능력이 무작위 추측 수준으로 붕괴한다는 것을 발견했습니다. 시스템이 제대로 작동하게 하려면 이 "사고 모드"를 수동으로 꺼야 했습니다.
  3. 번역은 함정이다: 그들은 다른 언어의 질문을 영어로 번역하고, 영어로 푼 다음, 다시 원래 언어로 번역하는 실험을 했습니다. 결과는 재앙이었습니다. 번역 과정에서 중요한 금융 세부 사항이 손실되었고, 원래 언어로 직접 풀었을 때보다 점수가 거의 20 퍼센트 포인트 하락했습니다.
  4. 데이터도 중요하지만, 모델이 더 중요하다: 힌디어의 경우, 라이브러리에 현지 힌디어 예시를 추가하는 것이 도움이 되었지만, 그 정도는 약 1 퍼센트 포인트에 불 불과했습니다. 그러나 그들의 시스템과 최고 상용 AI(Claude Opus 4.7) 사이의 격차는 매우 컸습니다(17 퍼센트 포인트). 이는 저자원 언어의 경우, 문제가 단순히 라이브러리에 책을 더 많이 넣는 것이 아니라, 컴퓨터 두뇌 자체가 해당 언어의 금융 용어에 대해 더 깊이 훈련되어야 함을 시사합니다.

최종 성적표

팀이 공식 FinMMEval 2026 대회에 시스템을 제출했을 때, 그들은 대부분의 언어에서 상위 10위 안에 드는 좋은 성적을 거두었습니다.

  • 아랍어: 76.0% (10위)
  • 힌디어: 73.5% (7위)
  • 영어: 69.5% (9위)
  • 중국어: 64.5% (9위)

그들이 1위를 차지하지는 못했지만(상위 팀들은 90% 이상을 기록했습니다), 그들의 연구는 중요한 교훈을 남겼습니다: 하나의 크기가 모두에게 맞지는 않는다(One size does not fit all). 전 세계적으로 작동하는 스마트한 금융 AI를 구축하려면, 단 하나의 모델과 하나의 전략만을 사용해서는 안 됩니다. 서로 다른 언어를 서로 다른 모델으로 라우팅하고, 작업에 따라 다른 사고 전략을 선택하며, 답을 글로 쓰는 대신 수학적으로 점수를 매겨야 합니다. 글로벌 금융 AI의 미래는 단 하나의 슈퍼 브레인이 아니라, 각자의 언어를 말하고 적절한 도구를 사용하는 전문가 팀에 달려 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →