Automating the triage of rheumatology outpatient referrals: a comparative evaluation of 23 large language models under simple and advanced prompting
本研究は、現代の大規模言語モデルが、特に高度なプロンプト技術によって導かれる場合、専門家と同等またはそれを上回る精度でリウマチ科への紹介のトリアージを自動化できることを実証しており、高価で大規模なモデルの必要性を効果的に排除するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
関節の痛み、腫れ、またはこわばさを抱える何千人もの人々が、毎日リウマチ科医に助けを求めて手紙を書いています。これらの手紙は「紹介状」として知られ、専門医が仕分けなければならない大量の潮流となって押し寄せます。この仕分け作業は「トリアージ」と呼ばれ、病状が臓器や生命を脅かす可能性があるため即座に診察が必要な人と、数週間あるいは数ヶ月待っても安全な人を判断することを目的としています。この任務は、複雑で非構造化されたテキストを読み解き、判断を下さなければならないシニア医師の肩に重くのしかかっています。これは、患者を診察し病気を治療するための時間を奪う、高ボリュームで精神的に消耗する仕事です。システムがうまく機能していれば、最も深刻な状態にある人々が迅速に助けを得られます。しかし、システムが失敗すれば、急速に悪化する自己免疫疾患を持つ患者が待ちすぎてしまい、永久的な損傷を負うリスクがあります。たとえ経験豊富な医師が行ったとしても、この仕分けプロセスは完璧ではなく、専門家同士でも意見が分かれることがあり、緊急の症例が見逃されたり遅れたりすることもあります。
紹介状の数が増加するスピードは、利用可能な専門医の数を上回っているため、クリニックは人工知能を活用する方法を模索しています。具体的には、膨大な量のテキストで学習し、人間の言語を理解し生成できるコンピュータプログラムである「大規模言語モデル」のテストが行われています。これらのモデルはすでに医学的な質問に答えたり診断を支援したりするために使用されていますが、リウマチ科の紹介状を仕分けるという、具体的かつ極めて重要なタスクを確実にこなせるかどうかは不明でした。中心となる問いは、単にコンピュータがこれを実行できるかどうかではなく、コンピュータが人間のチームと同じくらい上手くできるのか、そして最も強力で高価なコンピュータを使用するコストが必要なのかどうかでした。
オーストラリアのモナッシュ・ヘルスに所属するある研究者が、23種類の異なる大規模言語モデルを厳格なテストにかけることで、これらの疑問に答えるべく取り組みました。彼らは、生命を脅かす緊急事態から日常的な痛みまで、全範囲の緊急性を網羅した、実例に基づく20の現実的な紹介シナリオを作成しました。正解の「ゴールドスタンダード(標準)」を確立するため、4人の独立したリウマチ科医が、互いの決定を知らされない状態で全ての症例をレビューし、最終的に各症例に対する合意された緊急度レベルを決定しました。その後、研究者は23のコンピュータモデルに対し、これら20の症例を同じようにトリアージするよう求めました。結果が単なる偶然の的中ではないことを保証するため、各モデルには各症例に対して3回ずつ決定を下すよう指示しました。実験は2回行われました。一度目は、モデルに紹介状を分類するよう伝えるだけの非常に単純な指示を与え、二度目は、問題についてどのように考えるべきかを詳しく説明し、各緊急度レベルがどのようなものかを示す例を提供し、痛みなどの重要度の低い要因を無視して特定の医学的兆候に注目するようにモデルを導く、より詳細な指示を与えました。
結果は、これらの機械がどのように思考するかについて明確なパターンを明らかにしました。単純な指示のみを与えた場合、モデル間のパフォーマンスは大きく異なりました。最大規模で最も高度、かつ最も高価なモデルは、小型で安価なモデルよりも大幅に精度が高かったのです。この単純な設定においては、より大きなモデルに投資することで、より高い性能が得られました。しかし、研究者が高度で詳細な指示に切り替えると、物語は一変しました。この優れたガイダンスによって、モデル間の性能差は消失したのです。小型で安価なモデルが大型のモデルに追いつき、コストと精度の相関関係は消え去りました。詳細な指示は、本質的に小型モデルに対して問題の推論方法を教え込み、高額な代償を払うことなく、巨大なモデルと同等のパフォーマンスを発揮させることに成功したのです。
最高の指示を与えたとしても、コンピュータは完璧ではありませんでした。彼らは依然としてミスを犯し、患者を実際よりも重症であると示唆したり、逆に軽症であると示唆したりすることがありました。研究者は、「アンダートリアージ(緊急症例の見落とし)」というエラーが最も危険なタイプのミスであり、クリティカルなケアを遅らせる可能性があると指摘しました。それにもかかわらず、トップクラスの性能を示すモデルは、ほとんどの症例において人間の合意と一致しており、多くの場合、3回の試行すべてにおいて正しい緊急度レベルに同意していました。このレベルのパフォーマンスは、人間同士でも約3分の1のケースで意見が分かれ、患者を実際に診察した後に緊急度評価を変更することが頻繁にあるとされる、人間の医師の精度範囲内、あるいはそれを上回るものでした。
この研究は、このような事務的な負担を自動化するためのツールはすでに存在しており、これまで考えられていたよりも手頃な価格である可能性があることを示唆しています。鍵となる発見は、コンピュータへの「問いかけ方」が、コンピュータそのものと同じくらい重要であるということです。明確なルールと例を含む、よく設計されたプロンプトを使用することで、クリニックは最も高価なシステムに匹敵する結果を得るために、より小型で安価なモデルを利用できる可能性があります。これにより、医療現場はシニア医師を仕分け作業から解放し、彼らが患者の治療に集中できる貴重な時間を取り戻すことができます。この技術は有望ですが、研究者は、実世界で使用されるいかなるシステムも、緊急症例を見逃さないように注意深く監視される必要があり、最も重要な決定については人間の医師がレビューし続ける必要があると強調しています。今後の道のりは、これらのツールを実際のライブな紹介状でテストし、安全性を確保するために指示を洗練させていくことですが、データは、リウマチ科のトリアージにおける信頼できる自動アシスタントが、もはや遠い夢ではないことを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。