Mint-Agent: Introducing Finance-Native Agentic Foundation Models
이 논문은 특화된 데이터 엔진, 상호작용 하네스, 그리고 복잡하고 감사 가능한 금융 작업에서 최첨단의 신뢰성과 실행 가능성을 달성하는 고급 훈련 파이프라인을 기반으로 구축된 금융 특화 에이전트 파운데이션 모델 제품군인 Mint-Agent를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
금융의 세계에서 정답은 결코 단 하나의 숫자나 단순한 사실에 그치지 않습니다. 그것은 적절한 문서를 찾고, 정확한 기간을 식별하며, 서로 다른 출처의 값을 비교하고, 엄격한 검증을 견뎌낼 수 있는 계산을 수행하는 일련의 세심한 과정의 결과입니다. 인간 분석가가 이 과정에서 실수를 할 때, 그들은 대개 논리가 어디서 깨졌는지 추적하여 단계를 되짚어 올라갈 수 있습니다. 하지만 인공지능 시스템이 동일한 작업을 시도할 때, 시스템은 종약한 듯 들리는 답변을 내놓지만, 이는 숨겨진 오류, 잘못 읽은 표, 혹은 관련은 있지만 권위가 없는 출처에 기반한 것일 때가 많습니다. 원래의 증거로부터 최종 결론에 이르기까지 명확하고 추적 가능한 경로가 없다면, 그 결과는 신뢰받거나 수정될 수 없습니다. 확신에 찬 답변과 검증 가능한 진실 사이의 이 간극은, 연구자들이 기계가 독립적인 금융 조사관으로서 행동하도록 가르치는 과정에서 해결하고자 하는 핵심 과제입니다.
연구팀은 '민트 에이전트(Mint-Agent)'라고 부르는 시스템을 통해 이 문제에 대한 새로운 접근 방식을 도입했습니다. 단순히 컴퓨터가 금융 사실을 암기하거나 정답을 추측하도록 훈련하는 대신, 그들은 모든 결론을 회복 가능한 증거에 의해 뒷받침되어야 하는 하나의 '주장'으로 취급하도록 설계된 시스템을 구축했습니다. 이 시스템은 세 가지 주요 원칙에 따라 작동합니다. 첫째, 거래의 특정 규칙을 이해하기 위해 실제 금융 문서를 통해 학습합니다. 둘째, 모든 검색과 계산 과정을 영구적이고 감사 가능한 기록으로 남기는 특화된 환경을 사용합니다. 셋째, 단순히 최종 답변뿐만 아니라 그곳에 도달하기 위해 거친 전체 여정의 정확성에 보상을 주는 과정을 통해 학습합니다. 그 결과, 복잡하고 긴 금융 연구를 수행하면서도 결론에 도달한 과정을 증명하는 명확한 증거의 흔적을 유지할 수 있는 인공지능 모델 제품군이 탄생했습니다.
연구진은 먼저 실제 기업 보고서, 시장 데이터, 회계 기록에서 추출한 방대한 금융 작업 라이브러리를 구축함으로써 시스템을 설계했습니다. 그들은 이 작업들을 두 가지 유형으로 분류했습니다. 첫 번째 유형은 표에서 특정 숫자를 추출하거나 표준 계산을 수행하는 것과 같은 '원자적 기술(atomic skills)'로, 증거가 이미 존재하는 경우입니다. 두 번째 유형은 '장기 실행(long-horizon execution)'으로, 시스템이 스스로 증거를 찾아야 하며, 종종 복잡한 답변을 구성하기 위해 장기간에 걸쳐 여러 문서를 검색해야 하는 경우를 포함합니다. 두 번째 유형을 처리하기 위해, 그들은 '민트 하네스(MintHarness)'라는 디지털 환경을 만들었습니다. 이 환경은 AI가 도구를 사용하고, 정보를 검색하며, 계산을 수행할 수 있는 보안 작업 공간 역할을 합니다. 결정적으로, 이 환경은 수행된 모든 행동, 열람된 모든 문서, 계산된 모든 숫자의 영구적인 장부를 기록합니다. 이 장부는 AI가 세부 사항을 잊어버리더라도, 어떻게 답을 찾아냈는지에 대한 기록이 온전히 유지되어 인간이 검토할 수 있도록 보장합니다.
AI가 이 환경을 효과적으로 사용하는 방법을 가르치기 위해, 연구진은 금융적 추론 능력과 장기 연구 프로젝트 관리 능력을 분리하는 훈련 방법을 채택했습니다. 먼저, 데이터가 눈앞에 있을 때 수학과 논리를 정확히 수행하는 데 집중하는 '순수 금융 추론' 전문가 모델을 훈련시켰습니다. 그다음, 검색을 언제 멈춰야 하는지, 그리고 여러 단계에 걸쳐 정보를 어떻게 조직해야 하는지에 집중하는 '실행' 전문가 모델을 훈련시켰습니다. 마지막으로, 이 두 전문가를 하나의 통합된 시스템으로 병합했습니다. 이 결합된 모델은 두 가지 크기로 제공되며, 다양한 전문 금융 벤치마크를 대상으로 테스트되었습니다. '민트-에이지(Mint-Ag)'라는 이름의 더 큰 모델은 금융 추론 테스트에서 98.33점을 기록하며 여러 선도적인 상용 시스템을 능가했습니다. 복잡한 다단계 연구가 필요한 테스트에서도 높은 점수를 기록하여, 한 주요 벤치마크에서는 76.00점을, 더 어렵고 새로운 버전에서는 60.49점을 달성했습니다. 훨씬 더 콤팩트한 작은 모델인 '민트-큐(Mint-Cu)' 역시 검색 중심 작업에서 69.86점을 기록하며 뛰어난 성능을 보여주었고, 이를 통해 강력한 금융 연구 역량이 더 작은 시스템에서도 유지될 수 있음을 입증했습니다.
이러한 결과가 중요한 이유는 단순히 높은 점수 때문이 아니라, 성과의 본질 때문입니다. 연구진은 자신들의 모델이 단순히 답변을 생성하는 것이 아니라, '감사 가능한' 답변을 생성한다는 것을 발견했습니다. 한 상세한 사례에서, 시스템은 반도체 기업에 대한 예측을 추적하기 위해 37단계의 조사 과정을 성공적으로 수행했습니다. 그 과정에서 차단된 문서, 잘못된 기간, 상충하는 데이터 등을 마주했습니다. 시스템은 발견한 내용에 대한 지속적인 기록을 유지했기 때문에, 막다른 길을 버리고 자신의 실수를 바로잡으며, 확보한 유효한 증거만을 사용하여 최종 수치를 재계산할 수 있었습니다. 기업 인수와 관련된 또 다른 사례에서, 시스템은 확정적인 법적 문서를 찾을 때까지 최종 가격을 확정하지 않고 기다렸으며, 초기 단계의 모호한 출처들은 무시했습니다. 이러한 '단서'와 '사실'을 구별하고, 그 차이를 명확한 기록으로 남기는 능력이 바로 시스템을 신뢰할 수 있게 만드는 핵심입니다.
연구진은 인공지능이 금융과 같은 고위험 분야에서 유용해지려면, 단순히 올바르게 보이는 텍스트를 생성하는 수준을 넘어서야 한다고 주장합니다. 신뢰할 수 있는 에이전트는 자신의 작업 과정을 보여줄 수 있어야 하고, 사용하는 데이터의 시간적 범위를 준-수해야 하며, 증거가 뒷받침되지 않을 경우 결론을 수정할 의지가 있어야 합니다. 데이터 구축, 실행, 학습이 모두 검증 가능한 증거라는 단일 표준에 연결된 시스템을 구축함으로써, 민트 에이전트 팀은 유능할 뿐만 아니라 책임감 있는 금융 지능을 만드는 것이 가능하다는 것을 보여주었습니다. 이 연구 결과는 금융 분야에서 신뢰할 수 있는 AI의 미래가 모델을 더 크게 혹은 더 빠르게 만드는 것이 아니라, 모든 결정에 도달한 방식에 대해 명확하고 테스트 가능한 흔적을 남기도록 설계하는 데 있다는 점을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.