Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics
이 논문은 대규모 언어 모델이 자연어 설명을 바탕으로 실행 가능한 백테스터를 생성하도록 요구함으로써 기초적인 퀀트 트레이딩 과업에 대한 모델의 능력을 평가하는 벤치마크인 MARKET-BENCH를 소개하며, 현재의 모델들이 기본적인 트레이딩 인프라를 안정적으로 구축할 수는 있지만 가격, 인벤토리 및 리스크에 관한 견고한 추론에는 여전히 어려움을 겪고 있음을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑하고 빠른 로봇 팀이 있다고 상상해 보세요. 이 로봇들은 책을 읽고, 이야기를 쓰고, 상식 퀴즈에 답하는 데 아주 능숙합니다. 하지만 이제 당신은 이들에게 훨씬 더 어려운 일을 시켜보고 싶습니다. 바로 레몬 가격이 매초 변하는 상황에서 레몬 에이드 가판대를 운영하며, 옷 한 벌을 통째로 날려 먹지 않고 돈을 버는 일입니다.
이 논문은 이 "로봇의 뇌"(대규모 언어 모델 또는 LLM이라 불리는)가 실제로 간단한 트레이딩 비즈니스를 운영하는 데 필요한 수학과 논리를 수행할 수 있는지 확인하기 위한 새로운 테스트인 MARKET-BENCH를 소개합니다.
이 테스트가 어떻게 작동하는지, 일상적인 용어로 나누어 설명해 드리겠습니다:
1. 테스트: "말만 하지 말고, 기계를 만들어라"
대부분의 테스트는 로봇에게 어떻게 거래할지 설명하라고 요구합니다. "가격이 오르면 사세요!"라고 그들은 말할 수도 있습니다.
MARKET-BENCH는 다릅니다. 이렇게 말합니다: "여기 레시피와 재료 목록이 있습니다. 실제로 비즈니스를 실행할 컴퓨터 코드를 작성하세요."
로봇들은 다음을 수행하는 코드를 작성해야 했습니다:
- 자신들이 가진 돈을 추적합니다.
- 특정 규칙에 따라 주식(마이크로드소프트, 코카콜라, 펩시 등)을 사고팝니다.
- 정확히 얼마의 이익이나 손실을 보았는지 계산합니다.
- 결정적으로: 로봇의 수학 결과는 "골드 스탠다드(표준 정답)"와 정확히 일치해야 합니다. 만약 로봇이 100달러를 벌었다고 했는데, 표준 정답이 95달러라면 그 로봇은 실패한 것입니다.
2. 세 가지 도전 과제 ("레벨")
테스트에는 비디오 게임 레벨처럼 세 가지 난이도가 있었습니다:
레벨 1: 단순한 일정 (마이크로소프트)
- 업무: 조립 라인의 로봇 팔처럼 특정 시간에 마이크로소프트 주식을 사고파는 것입니다.
- 함정: 단 한 푼, 단 한 주의 주식까지도 완벽하게 추적해야 합니다.
- 결과: 대부분의 로봇은 기계를 만들 수는 있었지만(코드가 실행됨), 많은 로봇이 작은 수학적 오류를 범했고 이것이 큰 실수로 이어졌습니다. 어떤 로봇은 완벽했지만, 어떤 로봇은 터무니없이 틀렸습니다.
레벨 2: 파트너 댄스 (코카콜라 vs 펩시)
- 업무: 이것은 "페어 트레이딩(Pairs Trading)" 게임입니다. 당신은 코카콜라와 펩시의 차이에 베팅합니다. 만약 코카콜라가 펩시에 비해 너무 비싸지면, 두 제품이 다시 정상으로 돌아올 것을 기대하며 펩시를 사고 코카콜라를 파는 식입니다.
- 함정: 두 주식을 동시에 다뤄야 하며, 복잡한 "스프레드(두 값의 차이)"를 계산해야 하고, 두 주식에 걸친 전체 자산을 관리해야 합니다.
- 결과: 훨씬 더 어려웠습니다. 여러 로봇이 기계를 완전히 고장 냈습니다(코드가 실행되지 않음). 한 로봇(Qwen3 Max)은 완벽하게 작동하는 기계를 만들었지만, 수익을 실제 몇 백 달러가 아닌 4억 달러로 계산했습니다. 이는 마치 자동차를 완벽하게 운전하면서도 자신이 달에서 운전하고 있다고 생각하는 로봇과 같았습니다.
레벨 3: 줄타기 (옵션 헤징)
- 업무: 가장 어려운 단계입니다. 당신은 마이크로소프트 주식에 대한 복잡한 보험 정책(옵션)을 가지고 있으며, 리스크 중립을 유지하기 위해 끊임없이 주식을 사고팔아야 합니다. 이는 마치 저글링을 하며 외줄 타기를 하는 것과 같습니다.
- 함정: 타이밍이 전부입니다. 아주 잠시라도 늦으면 돈을 잃게 됩니다.
- 결과: 가장 어려웠습니다. 많은 로봇이 기계를 시작조차 하지 못했습니다. 겨우 실행된 로봇들도 수학적으로 큰 오류를 보이는 경우가 많았습니다.
3. 주요 시사점
논문은 세 가지 주요 사실을 발견했습니다:
- 신뢰성 vs 정확성: 어떤 로봇은 코드를 만드는 지시(기계 작동)를 따르는 데는 뛰어나지만, 그 안의 수학을 수행하는 데는 형편없습니다. 반대로 수학은 잘하지만 기계 자체를 만들지 못하는 로봇도 있습니다.
- "환각(Hallucination)" 문제: 현실 세계에서 만약 로봇이 돈을 잃었는데도 돈을 벌었다고 생각한다면, 당신은 파산하게 됩니다. 이 논문은 이러한 로봇들이 종종 그럴듯해 보이지만 완전히 틀린 숫자를 "지어내는(환각하는)" 현상을 보여줍니다.
- 실전에 투입하기엔 아직 미흡: 저자들은 현재 이 로봇들을 트레이딩의 메인 브레인으로 사용하는 것은 안전하지 않다고 결론지었습니다. 이들은 보고서 초안은 쓸 줄 알지만, 상사에게 보내기 전에 모든 숫자를 사람이 일일이 확인해야 하는 매우 유능한 인턴과 같습니다.
결론
이 대규모 언어 모델들을 매우 유능하지만 경험이 부족한 견습생이라고 생각하십시오. 그들은 트레이딩 비즈니스를 시작할 코드는 짤 수 있지만, 회계 처리는 자주 틀립니다. 수학과 논리 능력이 더 향elle질 때까지, 그들에게 돈을 맡겨 스스로 운영하게 할 수는 없습니다.
저자들은 이 테스트(MARKET-BENCH)와 공개 점수판을 공개하여, 다른 과학자들이 더 나은 로봇을 만들고 누가 실제로 수학을 잘하게 되는지 경쟁할 수 있도록 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.