← 최신 논문
🤖 machine learning

Isotonic Bradley-Terry Model for Paired Comparison Data

본 논문은 쌍체 비교 데이터의 모델 오지정 문제를 해결하기 위해 서브그레이디언트 및 이소토닉 회귀법을 통해 변화율 매개변수와 역링크 함수를 교대로 학습하는 이소토닉 브래들리-테리 모델을 제안하며, 이를 통해 합성 및 실제 스포츠 데이터셋 전반에서 승리 확률 예측과 선수 순위 성능을 향상시킨다.

원저자: Ryoya Yamasaki

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Ryoya Yamasaki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 세계 최고의 선수가 누구인지 알아내려는 스포츠 팬이라고 상상해 보세요. 당신에게는 누가 누구를 이겼는지, 비겼는지, 혹은 졌는지에 대한 방대한 경기 결과 목록이 있습니다. 하지만 까다로운 점은, 단순히 승리 횟수만 봐서는 안 된다는 것입니다. 어떤 선수는 약한 상대를 열 번 이겼을 수도 있지만, 강한 상대에게는 한 번 질 수도 있기 때문입니다. 이를 이해하기 위해 과학자들은 브래들리-테리(Bradley-Terry) 모델이라는 수학적 도구를 사용합니다. 이 모델을 "강점 계산기"라고 생각하면 됩니다. 이 모델은 모든 선수에게 숨겨진 숫자(즉, "강점 점수")를 부여합니다. 만약 플레이어 A가 플레이어 B보다 높은 점수를 가지고 있다면, 모델은 A가 승리할 것이라고 예측합니다. 이 두 플레이어의 점수 차이를 실제 승리 확률(예: "A가 이길 확률 60%")로 바꾸기 위해, 모델은 **역링크 함수(inverse link function)**라고 불리는 특정한 모양, 즉 "곡선"을 사용합니다.

수십 년 동안 연구자들은 어떤 곡선 모양이 적절한지 추측해야 했습니다. 그들은 매끄러운 S자 곡선(로지스틱)이나 종 모양의 곡선(가우시안) 같은 표준적인 모양을 선택하고, 그것이 데이터에 잘 맞기를 바라며 고수해 왔습니다. 문제는 현실은 매우 복잡하다는 점입니다. 때때로 데이터가 미리 정해진 곡선과 완벽하게 일치하지 않을 수 있으며, 이는 잘못된 예측으로 이어집니다. 이 논문은 단순하지만 대담한 질문을 던집니다. 만약 우리가 데이터를 미리 만들어진 곡선에 억지로 끼워 맞추지 않는다면 어떨까? 만약 데이터가 스스로 어떤 곡선이 되어야 하는지 말하게 한다면 어떨까? 저자는 우리가 곡선의 모양을 미리 추측하는 대신, 결과로부터 직접 곡선의 모양을 학습하는 새로운 방법을 제안합니다.

문제점: "일률적인 적용"의 함정

체스 그랜드마스터, 테니스 프로, 혹은 축구 팀에 이르기까지, 쌍체 비교(paired comparisons)의 세계에서 우리는 흔히 두 가지를 하고 싶어 합니다. 하나는 아직 서로 경기하지 않은 두 선수 사이의 승리 확률을 예측하는 것이고, 다른 하나는 모든 선수를 가장 강한 순서부터 가장 약한 순서까지 순위를 매기는 것입니다. 이를 수행하는 전통적인 방식이 바로 브래들리-테리 모델입니다.

이 모델을 두 부분으로 구성된 기계라고 상상해 보세요. 첫 번째 부분은 모든 선수의 "강점 점수"를 학습합니다. 두 번째 부분은 두 선수의 점수 차이를 가져와서 고정된 "필터"(역링크 함수)를 통과시켜 승리 확률을 내놓습니다. 수년 동안 과학자들은 이 필터를 미리 정해야 했습니다. 그들은 "로지스틱 필터를 사용하자"라거나 "가우시안 필터를 사용하자"라고 말할 수 있었습니다.

이 논문의 저자는 이러한 접근 방식의 결함인 모델 오지정(model misspecification) 문제를 지적합니다. 이는 마치 사각형 못을 둥근 구멍에 억지로 끼워 넣으려는 것과 같습니다. 만약 실제 세상의 움직임이 울퉁불퉁하고 계단식인 함수인데, 당신이 이를 매끄러운 S자 곡선에 강제로 맞추려 한다면, 당신의 예측은 틀릴 수밖에 없습니다. 이 논문은 데이터를 보기 전에 특정 곡선 모양을 확정 짓는 것이 귀중한 정보를 버리는 일이 될 수 있다고 주장합니다.

해결책: "형태를 바꾸는" 모델

이를 해결하기 위해 저자는 **아이소토닉 브래들리-테리 모델(Isotonic Bradley-Terry Model)**을 소개합니다. 고정된 곡선을 선택하는 대신, 데이터가 스스로 곡선을 구축하도록 합니다.

이것이 어떻게 작동하는지 재미있는 비유를 들어 설명하겠습니다. 당신이 몇 개의 흩어진 기상 보고서를 바탕으로 구릉 지형의 지도를 그리려고 한다고 상상해 보세요.

  1. 기존 방식: 당신은 지형이 반드시 완벽하고 매끄러운 포물선이어야 한다고 미리 결정합니다. 당신은 보고서에 맞춰 언덕의 높이를 조정하지만, 만약 보고서에 갑작스러운 절벽이 나타난다면, 당신의 매끄러운 포물선은 그것을 담아낼 수 없습니다.
  2. 새로운 방식 (아이소토닉 모델): 당신은 형태를 가정하지 않습니다. 대신, 보고서를 보고 낮은 점수에서 높은 점수로 이동함에 따라 엄격하게 상승하거나(또는 평평하게 유지되는) "점들을 잇는" 선을 그립니다. 이것을 **아이소토닉 회귀(isotonic regression)**라고 합니다. 이는 특정 공식을 가정하지 않고 데이터의 추세를 따르는 "비모수적(non-parametric)" 접근 방식입니다.

저자는 이 모델의 두 부분 사이의 영리한 춤을 제안합니다.

  1. 먼저, 표준 곡선을 사용하여 선수들의 강점 점수를 추측합니다.
  2. 그다음, 실제 경기 결과들을 살펴보고, 그 결과들에 완벽하게 들어맞도록 곡선(필터)을 다시 그립니다(이때 곡선은 절대 뒤로 돌아가지 않아야 합니다, 즉 단조성을 유지해야 합니다).
  3. 그런 다음, 이 새롭고 맞춤 제작된 곡선을 사용하여 선수들의 강점 점수를 다시 계산합니다.
  4. 모델이 더 이상 개선되지 않을 때까지 점수를 업데이트하는 과정과 곡선 모양을 업데이트하는 과정을 번갈아 가며 이 과정을 반복합니다.

연구 결과: 더 나은 예측과 정직한 무승부

저자는 두 가지 유형의 데이터를 사용하여 이 새로운 방법의 성능을 테스트했습니다: 합성 데이터(정답을 알고 있는 컴퓨터 생성 경기)와 2024/2025 시즌 프리미어 리그 축구, 2025 MLB 야구 시즌, 그리고 2025 ATP 테니스 투어실제 세계 데이터입니다.

컴퓨터 시뮬레이션에서, 저자는 강점과 승리 사이의 "진정한" 관계가 기이하여 표준 곡선과 일치하지 않는 시나리오를 만들었습니다. 이러한 경우 전통적인 모델은 어려움을 겪었지만, 아이소토닉 브래들리-테리 모델은 훨씬 더 뛰어난 성과를 보였습니다. 이 모델은 데이터의 기이한 모양을 학습하여 더 정확한 승리 확률을 예측했습니다.

더 흥미로운 점은, 새 모델이 자신이 답을 모를 때 이를 인정하는 능력이 더 뛰어나다는 것입니다. 전통적인 모델에서는 두 선수의 점수가 비슷할 때, 모델이 여전히 미세한 차이를 만들어내어 "플레이어 A가 이길 확률이 51%입니다"라고 말할 수 있습니다. 그러나 아이소토닉 모델은 "이 두 선수는 사실상 동등합니다"라고 말하며 50%의 승리 확률을 제시하는 경 가능성이 더 높습니다. 저자는 이러한 "무승부" 동작이 오류가 아니라 하나의 특징(feature)이라고 발견했습니다. 데이터가 부족하여 두 선수를 구분할 수 없을 때, 모델은 섣불리 엄격한 순위를 매기기를 거부함으로써 더 정직하고 안정적인 전체 순위를 도출해 냅니다.

실제 스포츠 데이터에서도 결과는 비슷했습니다. 새 모델은 특히 데이터가 적은 경우(선수들이 서로 자주 경기하지 않는 테니스와 같은 경우) 승리 확률 예측의 정확도를 높였습니다. 또한, 모델의 순위가 실제 결과와 얼마나 잘 일치하는지를 측정하는 척도인 켄달 타우(Kendall's Tau) 점수도 개선했습니다.

요약

이 논문은 우리가 데이터를 미리 만들어진 수학적 틀에 억지로 끼워 맞출 필요가 없음을 시사합니다. 데이터가 강점과 승리 사이의 관계 형상을 결정하게 함으로써, 우리는 더 유연하고 정확한 모델을 구축할 수 있습니다. 아이소토닉 브래들리-테리 모델은 단순히 곡선을 추측하는 것이 아니라, 곡선을 학습합니다. 비록 이 방식이 (점수 업데이트와 곡선 업데이트를 번갈아 수행하는) 더 많은 계산 단계를 요구하지만, 그 대가로 얻는 것은 지저도한 현실 세계의 데이터를 더 잘 처리하고, 불확실한 추측을 하기보다는 "누가 더 나은지 판단할 수 없다"라고 말할 줄 아는 시스템입니다. 저자는 이 접근 방식이 스포츠 경기 분석부터 설문 조사 선호도 분석에 이르기까지 다양한 분야에서 유망한 진전이라고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →