BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
본 논문은 600 만 건의 시장 기록에서 파생된 18,000 개 이상의 주석 달린 작업으로 구성된 자동화된 정량적 백테스팅을 위한 최초의 대규모 벤치마크인 BacktestBench 와 자연어 전략을 재현 가능한 백테스트로 변환하고 23 개의 주류 LLM 의 능력을 평가하도록 설계된 다중 에이전트 프레임워크인 AutoBacktest 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 부자가 될 새로운 요리를 만들고자 하는 셰프라고 상상해 보세요. 금융 세계에서는 이 "요리"가 거래 전략입니다. 이 요리를 세상에 내놓거나 (혹은 자신의 돈을 투자하기) 전에, 반드시 백테스트를 거쳐야 합니다. 이는 당신의 레시피를 과거 데이터 (지난 몇 년간 주식 시장에서 일어난 일) 라는 거대한 냄비로 요리해, 실제로 수익을 냈는지 아니면 부엌을 태워버렸는지 확인하는 과정입니다.
전통적으로 이 백테스트를 수행하는 것은 새로운 레시피를 테스트할 때마다 제로부터 복잡한 로봇을 조립하려는 것과 같습니다. 당신은 동시에 마스터 메커니커 (프로그래머), 데이터 사서 (올바른 과거 재료를 찾는 역할), 그리고 금융의 마법사가 되어야 합니다. 이는 느리고 비싸며, 소수의 전문가만 수행할 수 있습니다.
BacktestBench는 다음과 같은 새로운 프로젝트를 제안합니다: "인공지능 (AI) 이 그 마스터 메커니커, 사서, 그리고 마법사를 모두 한 번에 학습할 수 있을까?"
다음은 해당 논문이 수행한 작업에 대한 간단한 요약입니다:
1. 문제: 금융의 "블랙박스"
저자들은 인공지능 (특히 대규모 언어 모델 또는 LLM) 이 코드 작성과 대화에는 뛰어나지만, 자동화된 정량적 백테스트라는 구체적이고 고위험의 업무를 처리할 수 있는지 아직 제대로 검증된 바가 없다고 주장합니다.
- 과제: 단순히 코드를 작성하는 문제가 아닙니다. AI 는 "5 일간 가격이 오르면 매수한다"와 같은 모호한 인간의 요청을 이해한 후 다음을 수행해야 합니다:
- 데이터베이스에서 정확한 주식 데이터를 찾아냅니다.
- (미래 데이터를 이용하는 등) 속이지 않고 "5 일 상승" 규칙을 계산하는 프로그램을 작성합니다.
- 시뮬레이션을 실행합니다.
- 최종 점수를 계산합니다 (예: "Sharpe Ratio"는 우리가 감수한 위험 대비 얼마나 많은 수익을 얻었는지를 나타내는 세련된 표현입니다).
만약 AI 가 2 단계에서 사소한 실수를 한다면, 전체 결과는 쓸모없는 쓰레기가 됩니다.
2. 해결책: 거대한 "실기 시험" (BacktestBench)
AI 가 이를 수행할 수 있는지 테스트하기 위해 연구자들은 BacktestBench를 구축했습니다. 이는 AI 를 위한 방대하고 표준화된 운전 면허 시험과 같지만, 자동차를 운전하는 대신 AI 가 거래 전략을 운전합니다.
- 데이터: 중국 주식 시장 (거대한 역사 도서관과 같은) 에서 가져온 600 만 개 이상의 실제 시장 기록을 사용했습니다.
- 질문: 18,246 개의 구체적인 시험 문제를 만들었습니다. 이는 단순한 수학 문제가 아니라 다음과 같은 복잡한 시나리오들입니다:
- "이 특정 주식에서 이 특정 전략의 수익을 계산하세요."
- "이 전략으로 가장 잘 수행된 주식은 무엇입니까?"
- "어떤 설정 (파라미터) 이 가장 잘 작동합니까?"
- 정답 (Ground Truth): 연구자들이 직접 작성한 실제 코드에서 질문을 만들었기 때문에, 정확한 정답을 알고 있습니다. 이를 통해 AI 를 엄격하게 채점할 수 있습니다: 맞거나 틀림.
3. 시험 대상: "AutoBacktest" (AI 팀)
연구자들은 한 개의 AI 에게 모든 일을 맡기지 않았습니다. 대신 AutoBacktest라고 불리는 세 가지 전문화된 AI 에이전트 팀을 구축하여 주방 직원들처럼 함께 일하게 했습니다:
- 요약기 (번역가): messy 한 인간의 문장을 입력받으면, 시스템이 필요한 정확한 금융 "재료" (지표) 목록으로 번역합니다.
- 검색기 (사서): 해당 목록을 받아 데이터베이스로 가서 필요한 정확한 원시 데이터 (예: "시가"와 "거래량") 를 가져옵니다. 그리고 데이터를 가져오기 위해 쿼리 (SQL) 를 작성합니다.
- 코더 (셰프): 데이터와 지시를 받아 시뮬레이션을 실행할 파이썬 코드를 작성하고, 실행한 후 최종 숫자를 반환합니다.
4. 결과: 누가 시험에 합격했나?
연구자들은 이 시험에서 23 개의 서로 다른 AI 모델 (오픈소스 및 유료 "클로즈드 소스" 모델 모두 포함) 을 테스트했습니다.
- 승자: 상위 클로즈드 소스 모델 (Gemini 3 Pro 등) 이 가장 잘 수행했지만, 심지어 그들조차 약 67% 만 정확했습니다. 이는 현재 가장 똑똑한 AI 조차도 금융의 복잡한 논리를 처리하는 데 어려움을 겪고 있음을 의미합니다.
- "논리 격차": 많은 AI 들이 문법적으로 (구문상) 옳아 보이는 코드를 작성하는 데는 능하지만, 논리적으로는 실패한다는 사실을 발견했습니다. 예를 들어, AI 는 "변동성" (위험의 척도) 을 계산하는 코드를 작성할 수 있지만, 금융적 정의를 이해하지 못해 수학 계산이 틀릴 수 있습니다.
- "소형 모델"의 고전: "뇌 세포"나 파라미터가 적은 소형 AI 모델들은 수학이 많이 포함된 부분에서 형편없었습니다. 복잡한 통계적 추론이 필요한 질문의 경우, 소형 모델은 종종 완전히 실패한 반면, 대형 모델은 더 나은 성과를 냈습니다.
- 비밀 재료: "변동성 = 이 특정 공식"과 같은 표준화된 짧은 코드의 "요약 노트"를 AI 에게 제공하면, AI 가 훨씬 더 나은 코드를 작성할 수 있다는 사실을 발견했습니다.
5. 결론
이 논문은 AI 가 금융 연구 자동화에 점점 더 나아지고 있지만, 아직 멀었다고 결론 내립니다.
- 현재의 AI 모델은 훌륭한 에세이를 쓸 수 있는 천재 학생이지만, 종종 수학 시험에서 낙제하는 것과 같습니다.
- BacktestBench 데이터셋은 이제 누구나 자신의 AI 모델을 훈련하고 테스트하는 데 사용할 수 있으며, 이를 통해 미래의 금융 AI 가 단순히 숫자를 "환각"하는 것이 아니라 실제로 신뢰할 수 있는지 보장합니다.
간단히 말해: 이 논문은 AI 가 주식 시장 백테스트의 복잡하고 오류가 발생하기 쉬운 세계를 처리할 수 있음을 증명하기 위한 엄격한 "최종 시험"을 구축했습니다. 결과는 AI 가 유망하지만, 실제 돈을 맡기기 전에 완벽한 수학을 할 수 있도록 배워야 함을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.