Performance of Large Language Model on Real-World Patient Histories for Imaging Appropriateness.
本研究は、ChatGPTがACRの基準に基づいた腰椎MRIの適切性の分類において放射線科医と中程度の合致を示すこと、およびその推論の質が高く評価される場合に決定の信頼性が有意に向上することを実証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:実世界の患者履歴を用いた画像診断の妥当性に関する大規模言語モデルの性能
問題提起
腰痛(LBP)は世界的に蔓延している筋骨格系の疾患であり、腰椎部脊椎MRIの頻繁な依頼につながっている。系統的レビューによれば、これらの画像診断依頼の約29〜34%は不適切であり、感染症、悪性腫瘍、または外傷といった「レッドフラッグ(警告徴候)」が欠如していることが多い。不要なMRIは、医療コストの増大、患者の不安、および過剰診断のリスクを引き起こす。臨床意思決定支援ツールやガイドラインは存在するものの、ワークフローへの統合における課題やアラート疲れによって、実社会での導入は妨げられている。大規模言語モデル(LLM)は、不要な利用を削減するためのスケーラブルな代替案として浮上しているが、先行研究の多くは、実際の患者の履歴ではなく仮説的な臨床シナリオに依存しており、単一の放射線科医による参照標準を利用し、かつ、推論の質と決定の信頼性の間の関連性を体系的に評価することなく、初期のモデルバージョン(例:GPT-4)に焦点を当てていた。
方法論
本横断的研究では、実世界の患者履歴および米国放射線学会(ACR)の基準を用い、腰椎部MRIの妥当性を分類するGPT-5.2の診断精度を評価した。
- データ収集: 2025年9月から11月の間に腰椎部MRIを施行した成人患者160名(平均年齢 48 ± 15歳、男性58%)から、遡及的にデータを収集した。不十分な履歴、既往の脊椎手術、感染症疑い、または急性外傷がある患者は除外した。5名の専門家によって検証された構造化された質問票を用いて、画像撮影前の臨床履歴を収集した。
- モデルへのプロンプト: 患者の履歴は、モデルに放射線科医の役割を割り当て、ACRガイドラインに基づき、明示的な推論を含めた上で、MRIの適応を「通常適切(UA)」、「適切である可能性がある(MBA)」、「通常は不適切(UNA)」、または「臨床情報不足(ICI)」に分類することを求める構造化プロンプトを通じて、GPT-5.2に入力された。
- 参照標準: 経験5年および10年の2名の独立した放射線科医が参照標準を務めた。
- フェーズ1: 放射線科医は、モデルの出力に盲検化された状態で、提示されたものと同じプロンプトを用いて妥当性を評価した。
- フェーズ2: 放射線科医は、モデルの推奨事項の正確性と臨床推論の質を、5段階のリッカート尺度(1–5)を用いて評価し、互いに盲検化された状態で評価を行った。
- 統計解析: 一致度は加重コーヘンのカッパ係数()およびボウカーの非対称性テストを用いて測定した。二値分析では、UAとMBAを「適切」とし、UNAを「不適切」とした。性能指標には、感度、特異度、陽性的中率(PPV)、陰性的中率(NPV)、および曲線下面積(AUC)を含めた。推論の質(高:4 vs 低:<4)に基づくサブグループ解析を実施した。
主な結果
- 一致度: GPT-5.2は、両放射線科医に対して中程度の一致を示した(放射線科医1に対して 、放射線科医2に対して )。この一致レベルは、放射線科医間の一致度()と同等であった。
- 二値分類: モデルは高い感度(両放射線科医に対して約85%)を示したが、特異度は変動した(放射線科医1に対して92.9%、放射線科医2に対して61.7%)。陰性的中率(NPV)は中程度であった(放射者1に対して57.8%、放射線科医2に対して64.4%)、これは保守的(制限的)なMRI使用への傾向を示唆している。
- 識別能: ROC解析の結果、放射線科医1に対しては良好から優れた識別能(AUC 0.891)、放射線科医2に対しては良好から中程度の識別能(AUC 0.751)を示した。
- 推論の質との相関: 重要な知見は、推論の質と決定の信頼性の間の強い関連性であった。放射線科医がモデルの推論を「高い」と評価した場合(4)、妥当性に関する完全一致は高く(放射線科医1に対して83.3%、放射線科医2に対して90.4%)、反対の不一致(最も危険なエラータイプ)は低かった(2.3–4.7%)。逆に、推論が「低い」と評価された場合(<4)、完全一致は低下し(0–7.1%)、反対の不一致は急増した(71.4–92.8%)。
- 専門家による評価: 放射線科医は、妥当性と推論の両方において、中央値5(最大値)のリッカートスコアを付け、モデルの出力品質を高く評価した。
意義および主張
著者らは、GPT-5.2が実世界の患者履歴を用いて腰椎部MRIの妥当性を分類する際、放射線科医間のばらつきの範囲内で機能すると主張している。本研究は、モデルの推論の質が、その決定の信頼性の堅牢な予測因子であることを強調している。具体的には、高品質な推論出力は専門家の判断との高い一致に関連し、低品質な推論は重大な不一致に関連している。
本論文は、GPT-5.2のようなLLMが、不要な画像診断依頼を減らすための事前スクリーニング支援ツールとして機能する可能性があると仮定している。しかし、著者らは、この可能性はモデルの推論の質に依存していることを強調しており、低品質な推論が出力された場合には専門家によるレビューにエスカレーションするというハイブリッドなワークフローを示唆している。結論として、モデルは有望ではあるものの、安全な臨床統合には、継続的な人間による監視、前向きな多施設共同検証、および曖昧なケースにおけるコンセンサス・リファレンス・スタンダードの確立が必要であるとしている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。