Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals
本研究は、現在の大型言語モデルが耳鼻咽喉科の電子健康記録から構造化された臨床情報を抽出する際、医療専門家と同等の検者間信頼性を達成できていないことを示しており、それらのモデルは自律的な臨床運用よりも、人間の検証を必要とする初期データ抽出に適していることを示唆している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
今日の病院は、膨大な量の書面による記録を生み出しています。患者の受診、検査結果、そして治療の決定のひとつひとつが、電子健康記録と呼ばれるデジタルノートとして記録されています。これらの文書には、医師が症状を説明し、疾患を診断し、ケアを計画するために用いる特定の言語が含まれており、詳細な情報に満ちています。数十年にわたり、これら非構造化された物語を整理され検索可能なデータへと変換することは困難な課題であり、多くの場合、人間が情報を読み取り、手作業で書き直す必要がありました。近年、「大規模言語モデル」と呼ばれる新しいタイプのコンピュータプログラムが登場しました。これらのシステムは膨大な量のテキストを用いて学習されており、人間の言語を読み、理解し、驚くほど流暢に要約することができます。これらは医学的な質問に答えたり、免許試験に合格したりできることを示しており、患者の記録を読み、その中にある重要な事実を自動的に抽出することもできるのではないかと、多くの人々が疑問を抱いています。
この問いは、単に時間の節約に関する問題ではありません。それは安全性と正確性の問題なのです。もしコンピュータが医師の患者ケアを支援するのであれば、作り話をしたり重要な詳細を見落としたりすることなく、正しい情報を見つけ出さなければなりません。ある新しい研究は、この能力を直接テストすることを目的としました。研究者たちは、耳鼻咽喉科の診療における実在の患者記録を約100件集め、人間の医師と7つの異なる大規模言語モデルの両方に、それらを読ませました。タスクは、患者の年齢、症状、診断、および受けた治療といった特定の事実を抽出することでした。全員が同じ言語で話していることを確実にするため、研究者たちは、すべての情報を世界中の病院で使用されている標準化されたコードに変換することを求めました。これにより、機械の性能が人間に対してどの程度優れているかを精密に比較することが可能になりました。
結果は、人間の専門知識と現在の人工知能との間に明確な格差があることを明らかにしました。研究に参加した14人の医師が同じ記録を読んだ際、抽出された情報について約81パーセントの割合で一致しました。この高い一致率は、医師たちがノートを整合性を持って解釈していることを示していました。しかし、コンピュータモデルを医師と比較したところ、一致率は約66パーセントへと大幅に低下しました。言い換えれば、機械は同じテキストから同じ事実を特定するという点において、まだ人間ほど信頼できるレベルには達していなかったのです。研究では、数千億の結合を持つ巨大なシステムから、ローカルコンピュータで動作する小規模なものまで、さまざまなサイズのモデルをテストしました。そのどれもが、医療専門家が見せたレベルの一貫性に到達することはありませんでした。
性能は、どのような種類の情報を抽出するかによって変化しました。モデルは、明確で標準的な方法で書かれることが多い治療法や検査結果を見つけることには非常に長けていました。一方で、臨床的な文脈に対する深い理解を必要とするサイン(徴候)や診断については、成功しにくい傾向がありました。興味深いことに、コンピュータは医師よりも多くの情報を見つける傾向があり、特にリスク要因に関してその傾向が見られました。医師はしばしば目の前の問題に集中しますが、モデルはテキストの中で言及されているあらゆる可能なリスクをフラグ立てするようでした。これは、機械が単に人間の行動を模倣しているのではなく、テキストを異なる方法で処理していることを示唆しています。つまり、人間が見落とす可能性のある詳細を捉えることもあれば、臨床的に関連のない事項をフラグ立てしてしまう可能性もあるということです。
こうした違いはあるものの、機械は正しく使用されれば有用なツールになり得ることを示しました。研究によると、モデルがある情報を特定した場合には、その多くが正しく、精度率は97パーセントでした。これは、存在しない事実を捏造することがほとんどないことを意味します。しかし、情報の約15パーセントを見落としていました。このパターンは、これらのツールが将来担うべき特定の役割を示唆しています。すなわち、それらは「第一段階の作業」として、記録を素早くスキャンして、医師が確認すべき可能性の高い候補を抽出するのに適しているということです。最終的な決定と検証には、依然として人間が必要となります。研究者たちは、これらのモデルは強力ではあるものの、臨床現場で単独で働く準備はまだ整っていないと結論付けました。それらは、人間の専門家が常にその作業をチェックすることを条件として、膨大な医療データを整理するのを助けるアシスタントとして捉えられるべきなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。