Interpretable ensemble machine learning identifies player-specific performance indicators in elite tennis
본 연구는 노박 조코비치의 그랜드 슬램 데이터에 적용된 해석 가능한 앙상블 머신러닝 워크플로가 세트 결과에 대해 높은 예측 정확도를 달래할 뿐만 아니라, 개별 모델에서는 종종 간과되는 백핸드 리턴과 같은 선수 특유의 성과 지표를 밝혀낸다는 것을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
엘리트 스포츠의 세계에서 퍼포먼스 분석은 경기의 혼돈을 명확한 증거로 바꾸는 예술입니다. 코치와 과학자들은 단순히 누가 이겼는지를 보기 위해서가 아니라, 승리가 어떻게 구축되었는지를 이해하기 위해 경기를 관찰합니다. 그들은 경기를 서브, 리턴, 발걸음, 실수와 같은 수천 개의 작은 순간들로 세분화합니다. 목표는 이러한 순간들 중 실제로 가장 중요한 것이 무엇인지 찾아내는 것입니다. 하지만 단 하나의 숫자나 단순한 평균은 오해를 불러일유할 수 있습니다. 선수가 많은 위너(winner)를 쳤다고 해서 반드시 그 특정 행동이 승리를 이끌었다고 단정할 수는 없습니다. 때로는 전체적인 그림을 볼 때만 드러나는 미묘한 요소가 가장 중요한 요인일 수도 있기 때문입니다. 바로 이 지점에서 현대 컴퓨터 과학이 개입합니다. 연구자들은 이제 한 가지 방식의 사고에 의존하는 대신, 동시에 여러 가지 서로 다른 컴퓨터 프로그램을 사용할 수 있습니다. 이 프로그램들은 각기 다른 방식으로 데이터를 바라보는 전문가 팀처럼 작동합니다. 가장 큰 목소리에만 귀를 기울이는 대신 이 모든 목소리를 경청함으로써, 분석가들은 단일 방법으로는 놓칠 수 있는 패턴을 찾아낼 수 있습니다. 이러한 접근 방식은 승패의 차이가 종종 세부 사항 속에 숨겨져 있는 테니스와 같은 스포츠에서 필수적인 요소가 되고 있습니다.
우한 체육대학교와 우한 대학교의 연구팀은 이러한 팀 기반의 사고방식을 역사상 가장 위대한 테니스 선수 중 한 명인 노박 조코비치의 커리어에 적용했습니다. 그들은 조코비치가 세트를 이기는 데 있어 어떤 기술적 능력과 전술적 선택이 가장 강력한 동력이 되었는지 정확히 알고 싶었습니다. 이를 위해 그들은 2019년부터 2025년 사이 메이저 그랜드 슬램 대회에서 열린 하드 코트 경기 239세트로부터 방대한 양의 데이터를 수집했습니다. 그들은 더블 폴트 횟수와 같은 명백한 지표부터 백핸드 샷의 속도나 네트에 접근하는 횟수와 같은 더 구체적인 세부 사항에 이르기까지, 매 세트마다 34가지의 서로 다른 지표를 추적했습니다. 연구진은 이 데이터를 두 그룹으로 나누었습니다. 그들은 2019년부터 2024년까지의 과거 데이터를 사용하여 12가지의 서로 다른 컴퓨터 알고리즘이 세트의 결과를 예측하는 방법을 학습시켰습니다. 그런 다음, 이 학습 내용이 실제 세계에서도 유효한지 확인하기 위해 2025년의 새로운 데이터인 40세트를 대상으로 이 프로그램들을 테스트했습니다.
연구진은 단순히 단 하나의 최고의 컴퓨터 프로그램만을 선택하지 않았습니다. 대신, 그들은 12개의 알고리즘을 조합하여 만들 수 있는 모든 가능한 조합을 테스트하여 수천 개의 서로 다른 '팀' 또는 앙상블(ensemble)을 생성했습니다. 그들은 가장 정확한 팀이 12개 전체로 구성된 거대 집단이 아니라, 특정 4개 모델로 구성된 앙상블이라는 것을 발견했습니다. 선정된 4개의 프로그램은 함께 작동하여 조코비치가 세트를 이길지 질지를 놀라운 정밀도로 예측했으며, 2025년의 새로운 데이터에서 90퍼센트의 정확도를 달성했습니다. 이 팀이 학습한 내용을 살펴보았을 때, 가장 중요한 요인들은 전문가들이 오랫동안 의심해 온 것들과 정확히 일치했습니다. 상대의 서브를 깨는 능력, 총 득점 수, 그리고 언포스드 에러(unforced error)의 제어가 성공의 핵심 동력이었습니다. 이러한 결과는 컴퓨터 모델이 근거 없는 이야기를 만들어낸 것이 아니라, 경기의 확립된 진실을 복원해 냈음을 확인시켜 주었습니다.
하지만 이 연구의 진정한 가치는 연구진이 단일 컴퓨터 프로그램이 무시했을 법한 것들을 찾아냈을 때 나타났습니다. 연구진이 12개의 개별 프로그램 각각에 34가지 지표의 중요도를 순위 매기도록 요청했을 때, 그들은 놀라운 불일치를 발견했습니다. 하나의 특정 지표인 '백핸드 리턴 횟수'는 결합된 팀(ensemble)에서는 상위 5위 이내의 요인으로 꼽혔지만, 12개의 개별 프로그램 중에서는 단 3개의 프로그램에서만 상위 5위에 올랐습니다. 만약 연구진이 단순히 성능이 가장 좋은 단 하나의 프로그램만을 선택했다면, 이 신호를 완전히 놓쳤을 수도 있었습니다. 결합된 접근 방식은 백핸드 리턴의 빈도가 조코비치의 성공을 나타내는 미묘하지만 일관된 표식이라는 점을 밝혀냈는데, 이는 단일 알고리즘이 스스로는 들을 수 없을 만큼 조용한 패턴이었습니다.
또한 이 연구는 이러한 패턴이 어떻게 작동하는지를 명확히 했습니다. 연구진은 조코비치가 백핸드 리턴을 더 많이 할수록 세트를 이길 확률이 높아진다는 것을 보여주었습니다. 그들은 이 관계를 시각화하여, 세트당 백핸드 리턴 횟수가 약 22회에 도달할 때 긍정적인 효과가 더 뚜렷해진다는 것을 발견했습니다. 여기서 중요한 점은 이 숫자가 모든 선수가 따라야 할 마법의 목표치나 규칙이 아니라는 것입니다. 이는 단지 이 특정 경기들에서 일어난 현상을 기술한 것일 뿐입니다. 연구진은 왜 이런 현상이 발생하는지에 대해서는 설명할 수 없다고 주의 깊게 설명했습니다. 상대가 그의 백핸드로 더 많이 서브를 넣었을 수도 있고, 그가 더 많은 리턴 기회를 가졌을 수도 있으며, 혹은 랠리의 길이가 그의 전략을 변화시켰을 수도 있습니다. 데이터는 연관성을 보여주었지만, 그것이 인과관계를 입증한 것은 아닙니다.
이 작업은 스포츠 퍼포먼스를 연구하는 새로운 방식을 보여줍니다. 다양한 컴퓨터 모델의 팀을 사용하고 그들의 답변을 비교함으로써, 분석가들은 소음(noise)에서 신호(signal)를 분리해 낼 수 있습니다. 그들은 서브 브레이크의 중요성과 같이 이미 알려진 사실을 확인할 수 있을 뿐만 아니라, 자칫 간과될 수 있는 더 조용하고 선수 개인에게 특화된 습관들에 빛을 비출 수도 있습니다. 이 연구는 이러한 발견이 모든 테니스 선수나 모든 코트에 적용된다고 주장하지 않습니다. 결과는 조코비치와 그가 해당 연도에 펼친 하드 코트 경기들에 국한된 것입니다. 그럼에도 불구하고, 방법론 자체는 강력한 도구입니다. 이는 반복되는 퍼포먼스 데이터를 바라보는 재현 가능한 방법을 제공하며, 경기로부터 도출된 결론이 단일 분석 도구의 좁은 시야가 아닌 광범위한 증거의 합의에 기반하도록 보장합니다. 호기심 많은 관찰자에게 이 연구는, 엘리트 스포츠라는 복잡한 춤사위 속에서 가장 중요한 단서는 흔히 한 명의 전문가에게 묻는 것이 아니라 많은 이들에게 물어봄으로써 발견된다는 점을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.