← 최신 논문
💰 quantitative finance

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

이 논문은 포트폴리오 구성, 리스크 관리, 기본적 분석 전반에 걸쳐 투자 관리 분야의 AI 에이전트를 평가하기 위한 종합적인 벤치마크인 FinSkillBench를 소개하며, 큐레이션된 절차적 기술에 대한 접근이 성능을 유의미하게 향상시키는 반면 자체 생성된 기술은 이점이 미미하다는 것을 입증한다.

원저자: Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

게시일 2026-08-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

투자 관리라는 고도의 긴장감이 흐르는 세계에서 성공은 단순히 어떤 주식을 살지에 대한 좋은 아이디어를 갖는 것 그 이상을 요구합니다. 그것은 정밀한 데이터를 수집하고, 복잡한 계산을 수행하며, 자금이 이동하는 방식을 규정하는 엄격한 규칙을 준-수하는 체계적이고 단계적인 과정을 필요로 합니다. 한 금융 분석가가 30개의 서로 다른 기업으로 구성된 포트폴리오를 검토하고, 갑작스러운 시장 폭락에 이들이 어떻게 반응할지 계산한 다음, 법적 제한 내에 머물도록 보유 자산을 재편성해야 하는 상황을 상상해 보십시오. 이 모든 과정이 과거의 특정 날짜에 사용 가능했던 정보만을 사용하여 이루어져야 합니다. 이것은 인간 전문가들에게는 일상적인 현실이지만, 인공지능에게는 새로운 개척지입니다. 현대의 AI 시스템은 텍스트를 작성하거나 일반적인 질문에 답하는 데는 뛰어나지만, 이러한 정확하고 절제된 과업을 수행하라는 요청에는 종종 어려움을 겪습니다. 그들은 리스크의 개념은 이해할 수 있어도, 이를 정확하게 측정하기 위해 필요한 구체적인 수학적 단계를 실행하거나, 오류 없이 포트폴리오를 재조정하기 위해 필요한 세부 지침을 따르는 데는 자주 실패합니다.

한 연구팀은 AI 에이전트가 진정으로 이러한 종류의 업무를 처리할 수 있는지 테스트하기 위한 새로운 방법을 개발했습니다. 그들은 2,603개의 독특한 투자 시나리오를 제시하는 FinSkillBench라는 특화된 테스트 환경을 구축했습니다. 이 시나리오들은 주식 포트폴리오 구축, 해당 주식과 관련된 리스크 관리, 그리고 개별 기업의 재무 건전성 분석이라는 세 가지 주요 영역을 다룹니다. 연구진은 단순히 AI에게 정답을 추측하도록 시킨 것이 아니라, 특정 날짜와 일련의 원시 데이터, 그리고 명확한 목표를 부여한 뒤, 표준 금융 소프트웨어로 생성된 알려진 정답과 결과를 대조하여 확인했습니다. 목표는 AI가 전문 분석가처럼 행동하며, 적절한 시점에 적절한 데이터를 검색하고, 적절한 도구를 사용하여 업무를 완수할 수 있는지 확인하는 것이었습니다.

연구는 AI를 돕는 세 가지 다른 방식을 테스트했습니다. 첫 번째 시나리오에서 AI는 아무런 도움 없이 완전히 스스로 문제를 해결해야 했습니다. 두 번째로, 연구진은 AI에게 '큐레이션된' 도구 세트와 서면 가이드를 제공했습니다. 이것들은 단순한 무작위 문서가 아니었습니다. 그것들은 필요한 계산을 수행하는 방법과 사용 가능한 도구를 올바르게 사용하는 방법을 AI에게 정확히 보여주는, 정교하게 준비된 지침과 컴퓨터 스크립트였습니다. 세 번째 시나리오에서 AI는 과업을 시도하기 전에 스스로 지침과 도구를 작성하도록 요청받았는데, 이는 본질적으로 업무 수행 방법을 즉석에서 스스로 가르치려는 시도였습니다.

결과는 명확하고 결정적이었습니다. AI에게 미리 만들어진 인간 작성 가이드와 도구가 주어졌을 때, 성능은 극적으로 향로되었습니다. 모든 테스트에 걸쳐, 이 AI 에이전트들의 평균 점수는 약 37%에서 53%로 급증했습니다. 이러한 향상은 최적의 포트폴리오를 구축하거나 숨겨진 리스크를 식별하는 것과 같이 집중적인 수치 계산이 필요한 과업에서 가장 두드러졌습니다. 이 영역에서 큐레이션된 도구를 가진 AI는 이전에는 전혀 해결할 수 없었던 문제들을 해결할 수 있었습니다. 연구진은 신뢰할 수 있는 단계별 절차에 접근할 수 있는 것이 AI 모델 자체의 선택만큼이나 중요하다는 것을 발견했습니다. 적절한 도구가 없는 강력한 AI 모델은 자주 실패했지만, 적절한 도구를 갖춘 유능한 모델은 성공했습니다.

대조적으로, AI가 현장에서 스스로를 가르치게 하는 아이디어는 효과가 없었습니다. 에이전트들이 문제를 풀기 전에 스스로 가이드와 도구를 작성하도록 강제되었을 때, 그들의 성능은 거의 변하지 않았습니다. 그들은 이러한 지침을 작성하는 데 많은 시간과 컴퓨웨어 자원을 소비했지만, 그들이 만든 지침은 종종 결함이 있거나 불완전했습니다. 이 연구는 AI가 단 한 번의 시도로 금융 분석에 필요한 복잡하고 정밀한 절차를 신뢰성 있게 발명할 수는 없다는 것을 보여주었습니다. AI가 코드를 작성하는 법을 아는 것만으로는 충분하지 않습니다. 이미 테스트되고 검증된 코드를 제공받아야 합니다. 연구진은 자신들의 발견이 특정 설정의 우연이 아님을 확인하기 위해 다른 AI 시스템을 사용하여 동일한 테스트를 수행했습니다. 두 번째 시스템 역시 동일한 패턴을 보였습니다. 미리 만들어진 도구는 도움이 되었고, 스스로 만든 도구는 그렇지 않았습니다.

이 연구는 AI가 금융과 같은 진지한 분야에서 유용해지기 위해서는, 모델이 진행 과정에서 스스로 게임의 규칙을 파악하도록 의존해서는 안 된다는 점을 시사합니다. 대신, 우리는 AI가 어려운 작업을 수행하기 위해 검증된 인간의 방법론에 접근할 수 있는 시스템을 구축해야 합니다. 연구는 투자 관리 분야에서의 AI의 미래가 단순히 더 똑똑한 모델에 있는 것이 아니라, 그러한 모델을 신뢰할 수 있고 재사용 가능한 기술과 결합한 더 잘 설계된 시스템에 있다고 결론짓습니다. 연구진은 AI 에이전트가 실세계의 문제를 해결하기 위해 적절한 자원을 갖출 수 있는 방법에 집중함으로써 이 분야가 발전하기를 바라며, 자신들의 테스트와 도구를 다른 이들이 사용할 수 있도록 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →