Feasibility of using automatically extracted routine clinical data in a respiratory cohort study: The SPHN-SPAC demonstrator project.
SPHN-SPACデモンストレーター・プロジェクトは、自動抽出された日常的な臨床データが、データの完全性を向上させ、より多くのイベントを捕捉することによって、小児呼吸器疾患コホート研究における手動による抽象化を効果的に補完できることを示しているが、その幅広い適用は、現在は不均一な記録慣行とデータ調和に要する多大な労力によって制約されている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あなたは巨大なパズルを解こうとしているところだと想像してください。しかし、そのピースは数千もの異なる箱の中に散らばっています。これが医学研究の世界です。そこでは、科学者たちが病気が時間の経過とともに人々にどのように影響するかを理解しようとしています。これを行うために、彼らは通常、「コホート」を構築する必要があります。これは、彼らが注意深く追跡するグループのことを指す、少し専門的な言葉です。伝統的に、研究者たちは病院に座り、患者のファイルから自分のデータベースへと手動でメモを書き写す「人間の書記官」としての役割を果たさなければなりませんでした。それは時間がかかり、コストもかかり、例えるなら、ティースプーンでスイミングプールを満たそうとするようなものです。
近年、新しいアイデアが登場しました。もし、病院のコンピュータに、適切なピースを自動的に取り出すよう頼めたらどうだろうか?というアイデアです。ここで「ルーチン臨床データ」が登場します。これらは、医師や看護師が患者を治療する際に毎日作成するデジタル記録、例えば血液検査の結果、受診日、診断名などです。もし、コンピュータにこれらのデータを自動的に取得するよう教えることができれば、より速く、より安価に、膨大なグループを研究できるのではないかという期待があります。しかし、落とし穴があります。データがコンピュータの中に存在するからといって、それがすぐに使える状態であるとは限りません。それは秘密のコードで書かれていたり、乱れた形式で保存されていたり、システムの異なる場所に隠されていたりする可能性があるのです。大きな疑問は、研究者たちが自らに問いかけていることです。私たちは、これらの自動デジタル収集機が、注意深い人間の書記官と同じくらい優れた情報を与えてくれると本当に信頼できるのだろうか、それともコンピュータは単に壊れたパズルのピースの山を私たちに渡してしまうのだろうか?
この論文は、子供たちの呼吸器疾患のグループを用いてこのアイデアをテストすることに決めた、スイスのあるチームの物語を伝えています。彼らは、自動システムであるスイス・パーソナライズド・ヘルス・ネットワーク(SPHN)を使用して、人間の書記官に取って代わる、あるいは少なくとも彼らを助けることができるかどうかを確認するために、「デモンストレーター・プロジェクト」を設定しました。
研究者たちは、スイス小児気道コホート(SPAC)という研究に参加している1,075人の子供たちを調査しました。何年もの間、人間の研究チームがこれらの子供たちの診療録から手動でデータをコピーしてきました。この新しいプロジェクトでは、チームは病院のコンピュータにSPHNシステムを使用して同じ情報を自動的に抽出するよう依頼しました。彼らは、データの取得にかかる時間、実際に取得できるデータの量、そしてコンピュータのデータが人間のデータとどの程度一致するかという3つの点を確認したいと考えました。
結果は、「素晴らしいニュース」と「そんなに早くはない」が混ざり合ったものでした。まず、自動システムは、良い意味で「データに飢えたモンスター」でした。それは人間よりもはるかに多くの受診を見つけ出しました。例えば、ある病院では、コンピュータは1,963回の外来受診を見つけましたが、人間は1,049回しか記録していませんでした。別の病院では、コンピュータは2,343回の受診を見つけましたが、人間は1,010回でした。コンピュータはまた、親がフォローアップのアンケートに回答していなかった子供たちの受診も見つけることができ、人間が見逃した情報を捉えるセーフティネットのように機能しました。
しかし、このデータを手に入れることは、単に「ダウンロード」ボタンを押すことのように単純ではありませんでした。チームはデータの準備が整うまでに、約24ヶ月、つまり丸2年もかかりました! 彼らは、それぞれ独自の言語を話す異なる病院のコンピュータシステムの迷路を突破しなければなりませんでした。データはRDF(Resource Description Framework)と呼ばれる形式で出力されました。これは、コンピュータにとっては好ましいものの、人間にとっては読み解くのが非常に難しい、高度に構造化されているが非常に抽象的な情報整理方法です。チームは、このデータを研究に実際に使用できる形式に翻訳するために、膨大な時間と費用(前払いで約24万2,000スイスフラン)を費やさなければなりませんでした。
ようやく両方のデータセットを比較したとき、コンピュータは、それが発見できた項目については驚くほど正確でした。身長、体重、肺機能テスト(スパイロメトリー)のような構造化された数値については、コンピュータと人間はほぼ完璧に一致しました。数値は非常に密接に一致しており、これらの特定の項目については、コンピュータのデータは人間のデータと同じくらい信頼できるものでした。しかし、コンピュータは完璧ではありませんでした。例えば、外来受診中に処方された薬の詳細や、アレルギーのための皮膚プリックテストの結果など、人間なら容易に見つけられる情報をいくつか見落としていました。また、特定のボックスに入力されたものではなく、自由記述のメモに書かれた情報を探すのにも苦労しました。
チームはまた、救急外来への受診に関する親の報告と、コンピュータのデータがどの程度一致するかについても確認しました。コンピュータと親は、受診があったかないかについては概ね一致していましたが(高い「陰性的合致」)、受診が実際にあった場合、その正確なタイミングや詳細については必ずしも一致しませんでした。これは、親がコンピュータには見えていない別の病院への受診を覚えていたり、あるいは軽微な受診を忘れてしまったりしているためである可能性があります。
結局のところ、この論文は、自動データ抽出は、研究者に「より多くの」情報を提供し、人間が見逃す可能性のある事柄を捉えることができる強力なツールであるが、まだ人間のタッチを完全に置き換えることはできないことを示唆しています。コンピュータは、扱いやすい構造化された数値を扱うのには優れていますが、患者の物語の乱雑な部分や自由記述の部分を理解するには、まだ多くの助けを必要としています。研究者たちは、この技術は有望ではあるものの、自動的な作業をすべて任せられるようになる前に、病院での記録の書き方や、コンピュータの言語を翻訳するためのより優れたツールを整備する必要があると結論付けています。それは非常に役立つアシスタントですが、現時点では、パズルのピースが正しく組み合わさっているかを確認するために、依然として人間の監督者を必要としているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。