Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs
이 논문은 스스로 생성하고 코드로 검증된 객관식 문제를 통해 알고리즘 트레이딩 분야의 LLM 코딩 에이전트를 평가하기 위한 새로운 프레임워크인 Backtrader-Bench를 소개하며, 도구 증강 에이전트가 비도구 기반 베이스라인을 크게 능가함을 입증하는 동시에 향후 강화 학습 훈련을 위한 확장 가능한 인프라를 구축한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 단순히 당신과 대화하는 것을 넘어 실제로 무언가를 하는 세상을 상상해 보십시오. 코드를 작성하고, 프로그램을 실행하며, 스스로 복잡한 문제를 해결하는 것입니다. 이들을 "AI 에이전트"라고 부릅니다. 이들은 터미널을 열고, 명령어를 입력하고, 업무를 완수하기 위해 소프트웨어를 실행할 수 있는 아주 똑똑한 디지털 인턴과 같습니다. 금융 세계에서 이 에이전트들은 퀀트 트레이더(수학과 컴퓨터를 사용하여 주식을 사고팔 시점을 결정하는 사람들)처럼 행동하도록 훈련되고 있습니다. 여기서 큰 의문이 생깁니다. 이 AI 인턴들이 실제로 그 일을 할 수 있을까요, 아니면 그저 잘 흉내 내는 것뿐일까요?
이를 알아내기 위해서는 그들을 테스트해야 합니다. 하지만 트레이더를 테스트하는 것은 까다로운 일입니다. 단순히 "수익이 얼마인가요?"라고 물을 수는 없습니다. 왜냐하면 그들이 실제로 수학 계산을 하지 않고도 정답을 맞힐 수도 있기 때문입니다. 이는 마치 요리사에게 한 번도 구워본 적 없는 케이크에 대해 설명하라고 하는 것과 같습니다. 요리사가 "달콤하고 폭신해요"라고 말할 수는 있겠지만, 그것이 재료를 섞는 법을 안다는 뜻은 아닙니다. 금융에서 숫자를 틀리는 것은 단순히 성적이 나쁜 문제가 아닙니다. 그것은 실제 돈을 잃는 것을 의미합니다. 따라서 과학자들에게는 AI가 실제로 트레이딩 소프트웨어를 실행하고, 숫자를 계산하고, 전략의 성과에 대해 진실을 말할 수 있는지 테스트할 방법이 필요합니다.
이것이 바로 "Backtrader-Bench"라는 논문이 다루는 내용입니다. 연구진은 AI 에이전트가 알고리즘 트레이딩의 복잡하고 수학적인 현실을 제대로 다룰 수 있는지 확인하기 위해 거대하고 자동화된 테스트 환경을 구축했습니다. 그들은 주식 시장 시뮬레이션에 관한 수천 개의 까다로운 질문을 생성하는 시스템을 만들었으며, AI가 기억력에 의존해 답을 추측하는지, 아니면 실제로 코드를 작성하고 실행하여 문제를 해결하는지 지켜봅니다.
"백테스트" 비디오 게임
먼저, 놀이터를 이해해 봅시다. 연구진은 Backtrder라는 도구를 사용했는데, 이는 주식 거래를 위한 비디오 게임 시뮬레이터와 같습니다. 당신은 "10일 평균 가격이 30일 평균 가격보다 높아지면 매수한다"와 같은 규칙(하나의 "전략")을 제공하고, 이는 과거의 주식 데이터를 사용하여 시뮬레이션을 실행합니다. 그리고 당신이 돈을 얼마나 벌었는지 혹은 잃었는지를 알려줍니다.
문제는 이러한 시뮬레이션에 아주 작고 교묘한 디테일들이 가득하다는 점입니다. 코드상의 작은 실수 하나—예를 들어 아주 작은 거래 수수료를 잊거나 살 수 있는 주식 수를 잘못 계산하는 것—가 승리하는 전략을 패배하는 전략으로 바꿀 수 있습니다. 만약 AI 에이전트가 단순히 "환각(hallucinating)"(그럴듯하게 들리는 내용을 지어내는 것)을 일으키고 있다면, 완벽해 보이는 수익 수치를 제시할 수도 있지만 그것은 완전히 가짜일 수 있습니다.
두 단계의 테스트: 퀴즈와 필터
이 가짜 답변들을 잡아내기 위해, 저자들은 두 가지 영리한 파트로 구성된 Backtrader-Bench 프레임워크를 구축했습니다.
파트 1: 결정론적 퀴즈 (The Deterministic Quiz)
스스로 문제를 풀고 자신의 작업과 정답지를 대조하여 100% 정확함을 확인하는 선생님을 상상해 보십시오. 이것이 시스템의 첫 번째 파트가 하는 일입니다. 시스템은 트레이딩 전략을 가져와 시뮬레이션을 실행한 다음, 자동으로 객관식 질문을 생성합니다.
- 쉬운 질문: "1월 1일의 주가는 얼마였습니까?" (단순히 숫자를 찾아내는 것).
- 중간 난이도 질문: "수익이 난 거래는 몇 건이었습니까?" (계산 및 필터링).
- 어려운 질문: "포트폴리오가 어느 시점에 최대 얼마의 금액을 손실 보았습니까?" (이는 복잡한 수학 계산과 시간 흐름에 따른 최고점 및 최저점 추적이 필요합니다).
결정적으로, 시스템에는 동일한 시뮬레이션을 다시 실행하여 정답지를 검증하는 "체커(checker)" 로봇이 있습니다. 만약 정답지가 재실행 결과와 일치하지 않으면, 그 질문은 폐기됩니다. 이는 테스트가 공정하고 답이 명백하게 진실임을 보장합니다.
파트 2: "하드 모드" 필터 (The "Hard Mode" Filter)
첫 번째 파트도 훌륭하지만, 만약 AI가 너무 똑똑해서 그냥 답을 외워버린다면 어떻게 될까요? 이를 해결하기 위해 연구진은 더 공격적인 두 번째 파이프라인을 추가했습니다. 그들은 AI "생성기(Generator)"를 사용하여 즉석에서 새롭고 기이한 질문들을 만들어냈습니다.
그다음, "도구 미사용 해결사(No-Tool Solver)"(컴퓨터를 사용할 수 없는 AI)를 실행하여 그 질문들에 답하게 했습니다.
- 만약 도구 미사용 해결사가 정답을 맞혔다면, 그 질문은 너무 쉬운 것입니다. AI가 답을 맞혔거나 훈련 데이터에서 이미 알고 있었던 것이므로, 그 질문은 버려집니다.
- 만약 도구 미사용 해결사는 실패했지만, "도구 활용 해결사(Tool-Augmented Solver)"(코드를 작성하고 실행할 수 있는 AI)가 정답을 맞혔다면, 그 질문은 유지됩니다.
이 과정을 통해, AI가 반드시 수학 계산을 하고 코드를 실행해야만 풀 수 있는 특별한 "하드 모드" 질문 세트가 만들어집니다. 이것들은 추측할 수 없으며, 반드시 프로그램을 실행해야만 합니다.
결과: 추측인가, 실행인가
연구진은 11개의 서로 다른 AI 모델을 테스트에 투입했습니다. 어떤 모델들은 도구(코드 실행, 시뮬레이션 실행)를 사용할 수 있었고, 어떤 모델들은 도구 없이 오직 기억에만 의존하도록 강제되었습니다.
"도구 활용" 챔피언들:
AI 에이전트들이 코드 실행을 허용받았을 때, 그들은 환상적이었습니다. 상위 모델들(GPT-5.5 및 Opus 4.7)은 단 한 번의 시도로 질문의 **90.0%**를 맞혔습니다. 그들은 코드를 작성하고, 시뮬레이션을 실행하고, 결과를 읽었습니다. 그들은 마치 실제로 케이크를 굽고 맛을 보는 요리사와 같았습니다.
"도구 미사용"의 고전:
AI 에이전트들이 코드 사용이 금지되어 기억으로부터 답을 추측해야 했을 때, 점수는 떨어졌습니다. 가장 뛰어난 모델들도 평균적으로 **73.0%**의 정답률을 보였습니다. 하지만 무서운 점은, 연구진이 "하드 모드" 질문(필터가 너무 어려워서 남겨둔 질문들)에 대해 테스트했을 때의 결과입니다.
- 절반의 모델들이 약 **25%**의 정확도로 급락했습니다.
- 객관식 질문의 선택지가 4개라는 점을 고려하면, 25%는 눈을 감고 알파벳 하나를 찍었을 때 나오는 정확도와 정확히 일치합니다.
이는 코드를 실행하는 능력이 없다면, 많은 AI 에이전트들이 복잡한 금융 과업에 대해 본질적으로 추측을 하고 있다는 것을 시사합니다. 그들은 자신감 있게 말할 수는 있지만, 실제로는 숫자를 지어내고 있는 것입니다.
이것이 왜 중요한가
이 논문은 AI가 실세계의 금융에서 유용해지기 위해서는 단순히 금융 용어를 아는 챗봇이어서는 안 된다는 것을 보여줍니다. AI는 실제로 작업을 수행할 수 있는 에이전트여야 합니다. "Backtrader-Bench" 프레임워크는 AI가 발전하고 있음에도 불구하고, 먼저 숫자를 계산(실행)하지 않고 거래를 시도할 경우 위험한 실수를 저지를 수 있음을 입증합니다.
저자들은 이 테스트 시스템이 단순히 AI를 채점하기 위한 것이 아니라, 하나의 훈련장이라고 제안합니다. 검증된 어려운 질문들을 다시 AI에게 학습시킴으로써, 그들은 조용하고도 값비싼 실수를 저지르지 않고 복잡하고 수학적인 알고리즘 트레이딩의 세계를 안정적으로 다룰 수 있는 특화된 "퀀트 에이전트"를 훈련시키기를 희망합니다. 그때까지는, AI가 시뮬레이션을 실제로 실행했다는 것을 증명하기 전까지는 AI의 트레이딩 조언을 신뢰하는 데 매우 주의해야 한다고 이 논문은 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.