あなたは、ハイステークスな料理コンテストを見ているところだと想像してください。目の前の皿に盛られた完成した料理は見えますが、その材料やシェフの技術は見えません。その料理が素晴らしかったのは、シェフが天才だったからでしょうか、それともキッチンに世界最高の食材が揃っていたからでしょうか?スポーツ統計学の世界において、これは古典的なパズルです。つまり、個々の選手のスキルと、その選手が所属するチームや装備の質のどちらが寄与しているのかを、どのように切り分けるのかという問題です。この問いは、統計学とスポーツ科学の交差点に位置しており、そこでは数学を用いて、隠れたパフォーマンスのパターンを解き明かそうとしています。これを解決するために、研究者たちはしばしば「潜在変数モデル」を使用します。これは、実際に目に見えるもの(レースタイムやスコアなど)に基づいて、目に見えない性質(「才能」や「マシンの品質」など)を推測するという、高度な数学的ツールです。また、彼らは「状態空間モデル」も使用します。これはデータのタイムマシンのようなもので、シーズンが進むにつれて、これらの目に見えない性質がどのように変化し、進化していくかを捉えることができます。フォーミュラ・ワンにおいて、真に成功を導いているのが誰であるかを理解することは、「ドライバーがヒーローなのか、それとも車こそが真の主役なのか」という古くからの論争に決着をつけることなのです。
本論文において、ティム・リンドナーとその同僚たちは、ベイズ状態空間モデルという新しい数学的なレシピを用いて、まさにこの謎に挑んでいます。彼らは、複雑なハイブリッドエンジンを使用した「ハイブリッド時代」(2014年から2021年)のフォーミュラ・ワンのレースデータを調査しました。単にレース結果を見るのではなく、彼らは2種類の異なるデータをモデルに投入しました。一つは、予選中の最速ラップタイム(これはソロのスプリントのようなものです)、もう一つは、最終的なレース順位(これはグループでのレースです)です。このモデルは、ドライバーと自動車メーカー(「コンストラクター」と呼ばれます)を、絶えず変化し続ける2つの異なる目に見えない力として扱います。
研究者たちは、ドライバーと車の両方が重要である一方で、それらが全く異なる挙動を示すことを発見しました。モデルによれば、ドライバーの能力は「穏やかな川」のようです。それは比較的スムーズに流れ、時間の経過とともに安定しています。ドライバーはわずかに向上したり低下したりすることはありますが、その核となる才能がレースごとに激しく変動することはありません。しかし、コンストラクターの能力は「荒れる海」のようです。カーチームのパフォーマンスは、新しいパーツの開発や問題の修正に伴い、能力の大きな跳ね上がりや下落を伴いながら、より劇的に変動します。
おそらく最も興味深い発見は、多くのドライバーと車の組み合わせにおいて、ドライバーよりも実は車の方が最終的な結果に大きく貢献しているということです。モデルは、「コンストラクターの能力」が「ドライバーの能力」よりも、共有されたパフォーマンス・スコアに対して大きな影響を与えることが多いことを示唆しています。しかし、著者らは自分たちのモデルが完璧ではないことにも注意を払っています。シミュレーションによってレース結果をテストした際、モデルは予選タイムの全体的な流れを予測することには非常に優れていました。しかし、レース順位に関しては、トップチームの圧倒的な支配力を完全に捉えることに苦戦しました。このモデルは、中位グループの動きについてはうまく機能するものの、トップチームによる「超大型の嵐」を予測するには、この特定のツールでは少し難しいことを示唆しています。結局のところ、この研究は、クレジット(功績)を数学的に分割する方法を提供しており、フォーミュラ・ワンにおいては、ボンネットの下にあるエンジンが、ハンドルを握る手と同じくらい重要であることを私たちに示しているのです。
テクニカル・サマリー:フォーミュラ1における成功の要因
問題提起
フォーミュラ1のパフォーマンスは、ドライバーのスキルとコンストラクター(チーム)の能力の共同製品であるが、これらの貢献度は観測不能であり、時間の経過とともに動的に変化する。これらの効果を分離することは、以下の3つの要因により手法論的に困難である。すなわち、能力の時変性、ドライバーとコンストラクターの割り当ての頻繁な変更、そして観測される結果の異質性である。具体的には、データは2つの異なるアウトカム形式で構成されている。一つは連続値である最速予選ラップタイムであり、もう一つは順序型であるレース決勝順位(部分的なランキング)である。既存の文献では、静的なモデル、単一のアウトカム分析、あるいは連続的なパフォーマンス指標を共同で組み込まない動的ランキングモデルを用いるなど、これらの問題に個別に扱うことが多い。さらに、計量経済学における標準的な二元的なワーカー・ファーム(労働者・企業)モデルは、通常、単一の連続アウトカムを対象としており、個人の効果とグループの効果の両方が、結合された状態空間構造の中で別々の確率的進化方程式に従う枠組みを持たない。
手法
著者らは、標準化された予選ラップタイムとレースランキングを共同で分析し、潜在的なドライバー能力とコンストラクター能力を分離するベイズ状態空間モデルを提案する。
- 観測方程式: モデルは、共有された潜在変数によって結び付けられた、アウトカム固有のサンプリング分布を用いて2つのアウトカムを扱う。
- 予選: 連続的なアウトカムとして正規分布を用いてモデル化する。サーキットや天候の変動を考慮するため、観測されるタイムは各グランプリ内で標準化される。
- レース: 部分的なランキングのアウトカムとしてモデル化する。レースの決勝順位は、ガンベル分布に従う潜在的なレース・パフォーマンス変数によって誘導され、これは解析的にプラケット・ルース(Plackett-Luce)尤度をもたらす。レースの方程式には、予選のパフォーマンスによって決定されるグリッドポジションが共変量として含まれる。
- 潜在状態のダイナミクス: ドライバーの能力(ad,t)とコンストラクターの能力(ck,t)の両方を、グランプリレベルで進化する個別のランダムウォーク過程としてモデル化する。これらの状態は、両方のアウトカムのパフォーマンス予測因子へと加法的に分解される。観測される契約上の割り当て(zd,t)によって、どのコンストラクターの状態が特定のドライバーの予測因子に入るかが決定される。
- 識別戦略: 潜在的な分解の識別は、以下の3つの柱に基づいている。
- 結合尤度: 連続的な予選方程式とランキングの尤度は補完的な情報を提供し、ランキングモデル単独では識別できない共通の潜在成分のシフトを制限する。
- 和がゼロとなる制約: 潜在状態のロケーションとスケールを固定するために、モデルはすべてのグランプリにおいてドライバーとコンストラクターの能力をゼロに中心化する制約を課す。これは、状態方程式のイノベーション項に負の相関を誘発する特定の事前分布の仕様を通じて実装される。
- 割り当ての変動: 時間経過に伴うドライバーとコンストラクターの割り当ての変動(例:チームを移籍するドライバー)により、モデルは持続的なドライバーの能力とコンストラクターの能力を区別することができる。これは、二元固定効果モデルにおける労働者の流動性に類似している。
- 推論: ベイズ推論は、ドライバーとコンストラクターの能力を対称的に扱う弱情報事前分布の下で、ハミルトニアン・モンテカルロ法の一種であるNo-U-Turn Samper (NUTS) を用いて行われる。この手法は、ランキングの尤度が非ガウス的であるため、標準的なカルマンフィルタよりも適切である。
主な貢献
- 異質なアウトカムの結合モデリング: 本論文は、連続的なアウトカムと部分的なランキングのアウトカムを単一の動的フレームワーク内に統合し、混合アウトカムの潜在変数モデルを状態空間領域へと拡張している。
- 動的な二元分解: 静的なワーカー・ファーム・モデルとは異なり、このフレームワークでは、個人の効果とグループの効果の両方が、観測された割り当て構造を通じて識別されながら、時間の経過とともに確率的に進化することを可能にする。
- 手法論的統合: 本モデルは、混合アウトカムモデル、動的ランキングモデル(例:動的プラケット・ルース)、および計量経済学的な二元効果の文献を橋渡しし、共有されたパフォーマンス予測因子を分解するための統一的なアプローチを提供している。
実証結果
フォーミュラ1のハイブリッド時代(2014年–2021年)に適用した結果、モデルから以下の知見が得られた。
- 異質性: サンプル全体を通じて、ドライバーとコンストラクターの能力の両方に実質的な異質性が存在する。
- 安定性と揮発性: ドライバーの能力は一般に時間に対して安定しており、緩やかな進化を示す。対照的に、コンストラクターの能力はより大きな変動を示し、シーズン内およびシーズン間で、より顕著かつ時に急激な変化を示す。
- 相対的な寄与: いくつかのドライバーとコンストラクターの組み合わせにおいて、コンストラクターの成分は、ドライバーの成分よりも共有されたパフォーマンス予測因子に対してより強く寄与している。しかし、その相対的な寄与度は、特定のペアリングや時期によって大きく異なる。
- 予測性能: モデルは連続的な予選の結果を合理的に再現している。しかし、レースランキングのコンポーネントは、トップ層のペアリング(例:2021年のフェルスタッペン/レッドブル)の持続的な支配力を再現することにはより困難を示しており、観測データと比較してトップ2のフィニッシュの頻度を過小評価する傾向がある。
- 不確実性: 事後不確実性は、ドライバーの能力よりもコンストラクターの能力において一般に高く、これはコンストラクターのパフォーマンスの揮発性の高さと、割り当てデータの特定の構造を反映している。
意義と主張
本論文は、個人とグループの貢献が観測不能かつ動的であるチーム制スポーツにおいて、共同のパフォーマンスを分解するための厳密な統計的枠組みを提供すると主張している。ドライバーがチームを移籍し、アウトカムが異なる尺度で測定されるというフォーミュラ1データの特有の構造を活用することで、モデルはドライバーとコンストラクターの個別の潜在的な軌跡を正常に識別している。著者らは、本モデルはフォーミュラ1に特化しているものの、その基礎となる構造は、組織の成果や他のチーム制競技のように、個別の進化する個人およびグループの効果に依存する、異質な縦断的アウトカムを伴う他の設定にも適用可能であると述べている。研究は、分解は成功しているものの、レースランキングモデルにはパフォーマンスの極端な裾の部分を捉える上で限界が残っていることを控えめに結論づけている。
毎週最高の economics 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録