Do LLMs Understand Limit Order Book Dynamics?
합성 지정가 주문장 데이터로 학습된 대규모 언어 모델은 유효한 이벤트 시퀀스를 생성할 수는 있지만, 기저의 상태 역학을 내면화하는 데 실패하여 편향된 예측과 가짜 예측 가능성을 초래한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 금융의 분주한 세계에서 시장은 단순히 인간의 직관이나 광범위한 경제적 추세에 의해서만 움직이는 것이 아니라, 끊임없이 이어지는 고속의 디지털 명령 흐름에 의해 움직입니다. 이러한 시장의 중심에는 리미트 오더 북(limit order book, 지정가 주문 장부)이라 불리는 메커니즘이 자리 잡고 있습니다. 구매자와 판매자가 줄을 서서 각자 지불할 용의가 있는 특정 가격과 거래하고자 하는 주식의 수량을 명시하는 디지털 장부를 상상해 보십시오. 이 장부는 정지된 상태가 아닙니다. 새로운 주문이 도착하거나, 기존 주문이 체결되거나, 참여자가 자신의 제안을 취소할 때마다 변화하는 살아 움직이는 기록입니다. 이 장부를 지배하는 규칙은 엄격하고 논리적입니다. 구매자는 현재 판매자가 요구하는 최저가보다 낮은 가격으로 주식을 살 수 없으며, 판매자는 구매자가 제시하는 최고가보다 높은 가격으로 팔 수 없습니다. 수십 년 동안 트레이더와 수학자들은 이 장부가 어떻게 진화할지 예측하기 위해 복잡한 모델을 구축해 왔으며, 이 복잡한 수요와 공급의 춤 속에서 다음 움직임을 예측하려고 노력해 왔습니다.
최근에는 거대 언어 모델(large language model)로 알려진 새로운 유형의 인공지능이 이러한 금융 퍼즐에 적용되기 시작했습니다. 이러한 모델들은 일반적으로 언어의 패턴을 배우기 위해 방대한 양의 텍스트를 학습하지만, 연구자들은 대신 시장 이벤트의 시퀀스(sequence)를 학습시키기 시작했습니다. 만약 모델이 유효한 시장 주문의 시퀀스를 생성하는 법, 즉 시장이 한 상태에서 다른 상태로 어떻게 이동하는지를 정확하게 시뮬레이션하는 법을 배울 수 있다면, 시장의 근본적인 메커니즘을 진정으로 이해한 것이라는 희망이 있습니다. 이는 심오한 질문을 던집니다. 만약 기계가 시장이 어떻게 움직이는지에 대한 완벽한 이야기를 쓸 수 있다면, 그것은 실제로 그 이야기를 이해하고 있는 것일까요, 아니면 단지 구문을 흉내 내고 있는 것일까요? 컬럼비아 비즈니스 스쿨의 연구팀은 이러한 인공지능이 금융 시장에 대한 진정한 '세계 모델(world model)'을 보유하고 있는지, 아니면 그저 정교한 앵무새에 불 불과한지를 테스트함으로써 이 질문에 답하고자 했습니다.
연구진은 먼저 단순화된 버전의 리미트 오더 북 시뮬레이션을 만드는 것으로 시작했습니다. 이 디지털 샌드박스에서 그들은 고정된 가격 수준과 주문이 배치, 체결 또는 취소되는 방식에 대한 규칙을 정의했습니다. 그런 다음 시뮬레이션에서 생성된 데이터를 사용하여 처음부터 거대 언어 모델을 학습시켰습니다. 학습 과정은 엄격했습니다. 모델에게 시장의 시작 상태와 목표 상태를 부여한 뒤, 규칙을 어기지 않으면서 시장을 시작점에서 끝점으로 이동시키는 이벤트 시퀀스를 생성하도록 과제를 주었습니다. 모델은 이 작업에서 뛰어난 성과를 보였습니다. 거래 시퀀스를 생성하라는 요청을 받았을 때, 모델은 존재하지 않는 주식을 팔거나 시장 규칙을 위반하는 가격으로 거래를 실행하는 것과 같은 불가능한 움직임을 피하며 거의 항상 유효한 경로를 만들어내는 데 성공했습니다. 일반적인 관찰자에게 이 모델은 시장의 논리를 마스터한 것처럼 보였습니다.
그러나 연구진은 모델의 성공이 피상적일 수 있다고 의심했습니다. 그들은 모델이 현재의 시장 상태를 진정으로 이해하고 있는지, 아니면 단순히 그 상태에 도달하기까지의 이력(history)에 의존하고 있는지를 알고 싶었습니다. 실제 시장에서 주문 장부의 미래 진화는 전적으로 현재 상태에 달려 있습니다. 즉, 그 상태에 도달하기 위해 거쳐온 경로는 중요하지 않아야 합니다. 이는 마르코프 성질(Markov property)이라고 알려진 근본적인 원칙입니다. 모델이 이 원칙을 준수하는지 테스트하기 위해, 연구진은 단순한 규칙 준수를 넘어선 일련의 실험을 설계했습니다. 그들은 모델에게 단순히 유효한 시퀀스를 생성하는 것을 넘어, 다음에 어떤 일이 일어날지 확률을 예측하도록 요청했습니다.
결과는 모델의 이해에 중대한 결함이 있음을 드러냈습니다. 모델은 유효한 시퀀스를 생성할 수는 있었지만, 모델의 내부적인 관점은 편향되어 있고 불완전했습니다. 연구진이 모델의 예측을 조사했을 때, 모델이 미래의 이벤트에 대해 지속적으로 잘못된 확률을 할당한다는 사실을 발견했습니다. 예를 들어, 실제 수학적 확률이 훨씬 낮음에도 불구하고 모델은 특정 가격에서의 취소 주문 가능성을 과대평가했습니다. 더 우려스러운 점은, 모델의 예측이 현재 상태에 영향을 미쳐서는 안 될 과거의 이벤트 이력에 의해 영향을 받는다는 것이었습니다. 만약 시장이 두 가지 서로 다른 경로를 통해 특정 상태에 도달했다면, 올바른 모델은 두 경우 모두에 대해 동일한 미래를 예측해야 합니다. 그러나 이 인공지능는 거쳐온 경로에 따라 서로 다른 예측을 내놓았으며, 이는 예측력이 없는 과거의 세부 사항에 집착하고 있음을 시사했습니다.
이 오류를 정량화하기 위해 연구진은 모델의 예측과 시뮬레이션된 시장의 실제 수학적 현실 사이의 거리를 측정하는 새로운 테스트를 개발했습니다. 그 결과, 모델이 미래를 멀리 내다볼수록 오류가 커진다는 것을 발견했습니다. 모델은 존재하지 않는 과거의 패턴을 찾아낼 수 있다고 믿는 듯했는데, 이는 가짜 예측 가능성(spurious predictability)이라는 현상입니다. 마치 모델이 과거의 일련의 매수 주문이 미래의 매도 주문을 더 가능하게 만든다고 확신하는 것 같았는데, 현재의 시장 상태는 그러한 변화에 대한 아무런 근거를 제공하지 않았음에도 그러했습니다. 이 편향은 사소한 결함이 아니라, 시스템의 핵심 역학을 파악하는 데 있어 체계적인 실패였습니다. 모델은 시장의 문법은 배웠지만, 시장의 물리학은 배우지 못한 것이었습니다.
연구진은 또한 이러한 문제가 그들의 작고 단순한 시뮬레이션에 국한된 것인지, 아니면 더 복잡한 환경에서도 지속될 것인지를 테스트했습니다. 그들은 더 많은 가격 수준과 더 깊은 유동성을 가진 더 큰 규모의 주문 장부를 사용하여 실험을 반복했습니다. 결과는 일관되었습니다. 시장의 복잡성이 증가할수록, 상태에 대한 올바른 내부 표현을 유지하는 모델의 능력은 오히려 악화되었습니다. 모델은 계속해서 유효한 시퀀스를 생성했지만, 그 예측은 더욱 신뢰할 수 없게 되었습니다. 이는 단순히 더 많은 데이터로 모델을 학습시키거나 시장 시뮬레이션을 키우는 것만으로는 근본적인 문제를 해결할 수 없음을 시사합니다. 현재의 모델 구조는 시스템의 현재 상태를 그 이력의 노이즈로부터 추상화하는 데 어려움을 겪고 있습니다.
이러한 발견은 금융 분야에서 인공지능 활용에 중요한 시사점을 던집니다. 이 연구는 모델이 유효한 출력을 생성할 수 있다는 능력이 그 모델이 시뮬레이션하는 시스템을 이해하고 있다는 충분한 증거가 되지 못함을 보여줍니다. 정확한 예측이 매우 중요한 금융 시장의 맥맥락에서, 존재하지 않는 패턴을 찾아내는 모델은 막대한 비용을 초통하는 실수를 초래할 수 있습니다. 연구진은 거대 언어 모델이 시스템의 규칙을 이해하는 데 잠재력을 보여주기는 하지만, 신뢰할 수 있는 예측에 필요한 확률적 역학(stochastic dynamics)에 대한 깊고 암묵적인 이해는 현재 부족하다고 결론지었습니다. 이러한 모델이 단순히 발생한 사건의 시퀀스가 아니라, 시뮬레이션하는 세계의 상태를 진정으로 내면화하도록 훈련받기 전까지는, 복잡한 실제 시장에서의 예측은 여전히 의심의 여지가 있습니다. 앞으로 나아갈 길은 새로운 학습 방법과 더 큰 데이터셋을 요구하지만, 핵심적인 과제는 여전합니다. 기계에게 세상이 기억하는 방식이 아니라, 세상이 존재하는 그대로를 보는 법을 가르치는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.