Formalising Sample Size Calculations for the Development of Risk Prediction Models: The Importance of Accounting for Performance Variability
本論文は、期待される性能指標の達成を目指すだけでなく、性能の変動性を明示的に考慮することで、許容可能なモデルの較正および堅牢性を達成する高い確率を確保する、リスク予測モデル開発におけるサンプルサイズ算出のための新しいフレームワークを提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、新しい料理の完璧なレシピを作ろうとしているシェフだと想像してください。あなたには材料(予測因子)のリストがあり、誰もが「これだ!」と思えるような味のレシピ(モデル)を作り上げたいと考えています。医学の世界では、これらの「レシピ」はリスク予測モデルと呼ばれます。これらは、年齢、体重、既往歴などの情報に基づいて、患者が心臓発作や感染症などの特定の健康事象を起こす可能性を、医師が推測するのを助けます。しかし、ここからが難しいところです。自分のキッチンで最高の味を作れたとしても、それが他のすべてのキッチンでも同じ味になるとは限りません。もし、数回分(数バッチ)の調理だけでテストしてしまうと、偶然うまくいっただけだったり、材料を混ぜる量が足りなかったために、変に塩辛いバッチができたりしてしまうかもしれません。これが「変動性(variability)」の問題です。科学者たちは、自分たちのレシピが単なる幸運によるものではなく、信頼できるものであると確信するために、どれだけのバッチ(あるいは患者数)をテストする必要があるのかを正確に知る必要があります。
長い間、必要な患者数を算出する標準的な方法は、「平均的な」完璧な結果を目指すことでした。それは、「1,000回の調理をすれば、平均的な味は美味しくなるはずだ」と言うようなものです。しかし、この論文の著者である Menelaos Pavlou、Rumana Z. Omar、Gareth Ambler は、平均を目指すだけでは不十分であることに気づきました。たとえ平均が素晴らしくても、材料の運が悪かったために、全く食べられないようなバッチができてしまうことがあります。彼らは、目標を変える必要があると主張しています。単に平均が良いことを願うのではなく、作るバッチの「ほとんど」が実際に良いものであるようにすることを目指すべきなのです。彼らはこれを「許容可能なパフォーマンスの確率(Probability of Acceptable Performance)」と呼んでいます。それは、「平均が素晴らしいことを期待する」のではなく、「オーブンから取り出す単一のバッチが素晴らしい味になる確率が80%であるように、十分に多くのバッチを焼く必要がある」と言うようなものです。
この論文は、従来のサンプルサイズの計算方法では、特に予測因子の数が少ないモデルにおいて、不安定なモデルを生み出しやすいことを示唆しています。もし、たった2つの材料だけでケーキを焼こうとするなら、混ぜ合わせが単なる幸運ではないと確信するために、もっと大きなキッチン(より多くのデータ)が必要になります。著者らは、この「変動性」を無視すると、書類上は良く見えても、現実の世界では失敗してしまうモデルが出来上がる可能性があることを、コンピュータ・シミュレーションを用いて示しました。彼らは、このリスクを考慮した新しい手法を提案しており、その手法では、モデルを堅牢にするために、より大きなサンプルサイズを必要とすることがよくあります。また、「シュリンケージ(収縮)」と呼ばれる手法についても検討しました。これは、レシピを少し控えめに調整して、より保守的にする方法ですが、これを用いても、そもそも十分なデータがない場合には問題を完全には解決できないことがわかりました。
信頼できるレシピのために
医療予測モデルを構築することを、ロボットに写真の中の猫を認識させる訓練だと考えてください。あなたはロボットに何千枚もの写真を見せ、パターンを学習させます。もし10枚の写真しか見せなかったら、ロボットはその特定の10匹の猫を完璧に記憶してしまうかもしれませんが、新しい猫を見たときには完全に失敗するかもしれません。これは「過学習(overfitting)」と呼ばれ、優れた予測の敵となります。これを避けるために、科学者はロボットに何枚の写真(患者)を見せるべきかを正確に知る必要があります。
論文はまず、どの程度の患者数が必要かを決定する現在のルールブックが、期待値に焦点を当てていることを説明しています。サイコロを振る場面を想像してください。「期待値」とは、100万回振ったときの平均値です(3.5)。古い手法は、「平均が3.5になるように、十分に多くサイコロを振ろう」と言います。しかし、著者らはここに欠陥があると指摘しています。もし10回しか振らなかった場合、毎回「6」が出ることもあれば、毎回「1」が出ることもあるでしょう。長期的には平均は3.5になるかもしれませんが、あなたの特定の10回の試行は悲惨なものになる可能性があります。医学的な観点では、これは、ある研究では完璧に見えるモデルが、あなたの病院で作られた特定のモデルにおいては、極めて不正確になる可能性があることを意味します。
著者らは、PrAP(Probability of Acceptable Performance:許容可能なパフォーマンスの確率)という新しい概念を導入しています。単に平均を気にするのではなく、PrAPは次のように問いかけます。「今作っているモデルが、十分に良いものである確率はどのくらいか?」彼らは、「十分に良い」範囲を定義しています。例えば、キャリブレーション・スロープが0.85から1.15の間(1が完璧)であるといった具合です。目標は、モデルがその「良い」ゾーンに入る確率が、例えば80%になるようなサンプルサイズを選ぶことです。
シミュレーション・キッチン
彼らのアイデアをテストするために、著者らは単に推測するのではなく、何千回ものコンピュータ・シミュレーションを実行しました。彼らは、異なる数の「材料(予測因子)」(4から28まで)を持つ、架空の患者データを作成しました。そして、以下の2つの方法で、どれだけの患者数を使用すべきかを比較しました。
- 標準的な方法: 平均的なパフォーマンスが0.9(完璧に近い)になるために必要なサイズを算出する。
- 新しい方法: パフォーマンスが0.85から1.15の間に入る確率が80%になるように算出する。
結果は目を見張るものでした。モデルの予測因子が少ない場合(4つまたは5つ)、標準的な方法は比較的小さなサンプルサイズを提案しました。しかし、実際にシミュレーションを実行してみると、その小さなサンプルサイズで構築されたモデルは、バラツキが非常に大きいことがわかりました。素晴らしいものもあれば、ひどいものもありました。「良い」モデルが得られる確率はわずか54%であり、実質的にコイン投げと同じでした。
対照的に、新しい方法は、より大きなサンプルサイズを要求しました。予測因子が4つのモデルの場合、新しい方法は標準的な方法よりも2.7倍多い患者数を必要としました。しかし、その見返りは絶大でした。より大きなサンプルを用いることで、「良い」モデルが得られる確率は、目標の80%へと跳ね上がりました。著者らは、予測因子の多いモデル(18個以上)の場合、2つの手法が提案するサンプルサイズは似通ってくるものの、より単純で小さなモデルにおいては、その差が極めて大きいことを発見しました。
「シュリンケージ」という近道は?
論文では、**シュリンケージ(収縮)**と呼ばれる人気のあるテクニックについても調査しました。ケーキを焼いてみて、少し甘すぎると感じたとします。シュリンケージとは、より安全にするために、砂糖をほんの少し取り除くようなものです。統計学においては、予測の強さをわずかに弱めることで、過剰な自信を防ぐことを意味します。
著者らは、シュリンケージを使用することで、より小さなサンプルサイズで済ませることができるかどうかをテストしました。シュリンケージは平均的なパフォーマンスを向上させ、モデルを完璧に近づけるという点では役立つことがわかりました。しかし、それは同時に新しい種類の「揺らぎ」ももたらします。なぜなら、どの程度縮小させるかを推定しなければならないため、その推定自体が独自の不確実性を加えるからです。シミュレーションの結果、シュリンケージは「良い」モデルが得られる確率を改善させましたが、サンプルサイズが小さすぎる場合の根本的な問題は解決できないことが示されました。実際、予測因子が6つ未満の非常に小さなモデルでは、シュリンケージによる追加の不確実性のために、「良い」モデルが得られる確率はほとんど改善しませんでした。著者らは、シュリンケージは有用なツールではあるものの、十分なデータを集めることをスキップするための「魔法の杖」として使うべきではないと示唆しています。
実世界のテスト:心臓弁手術
彼らの理論が単なるコンピュータ上の空想ではないことを証明するために、著者らは16,679人の患者の実際のデータセットを用いて、彼らの手法を適用しました。彼らは、心臓弁手術を受けた患者の、入院中の死亡リスクを予測するモデルを構築しようとしました。
標準的な方法を用いると、2,250人の患者が必要であると算出されました。彼らの新しいPrAP法を用いると、2,740人の患者が必要であると算出されました。その後、彼らは実際のデータからこれらのグループを繰り返しサンプリングするシミュレーションを行い、何が起こるかを確認しました。
結果は彼らの疑念を裏付けました。2,250人のグループ(標準)は、中央値としてのパフォーマンスは良好でしたが、モデルのバラツキが非常に大きかったのです。素晴らしいものもあれば、劣悪なものもありました。2,740人のグループ(新)は、はるかに一貫していました。この大きなグループで構築されたほとんどのモデルが、「許容範囲」内に収まっていました。さらに、シュリンケージを組み合わせた場合、大きなグループ(2,740人)では信頼性が明らかに向上しましたが、小さなグループではほとんど恩恵が見られませんでした。
まとめ
この論文の主なメッセージは、「平均」の結果に安心しすぎるなという警告です。医療予測という極めて重要な世界において、個々のモデルが劇的に失敗する可能性があるならば、平均的な成功率は十分ではありません。著者らは、特に材料(予測因子)が少ないモデルを構築する場合、研究者はより多くのデータを収集する覚悟を持つ必要があると示唆しています。彼らは、平均的な成功ではなく、成功の確率を優先する、サンプルサイズの新しい計算方法を提案しています。
これは、以前考えられていたよりも多くの患者を集めることを意味するかもしれませんが、そのトレードオフとして、安定し、信頼できるモデルが得られます。著者らが述べているように、もしあなたのモデルが機能することを80%の確率で確実にしたいのであれば、単に平均を目指すのではなく、安全マージン(安全域)を目指さなければなりません。彼らの研究は、まさにそれを実現するための数学的ツールを提供しており、医師が予測モデルに頼るとき、それが単なる幸運な推測ではなく、十分にテストされたレシピであることを保証するものなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。