Towards understanding the disease landscape of clinical trials in Germany: Ontology and embedding-based pipelines versus Large Language Models for ICD-10 Harmonization
本研究は、決定論的なオントロジーおよび埋め込みベースのパイプラインがドイツにおける異種混合の臨床試験条件データをICD-10標準に部分的に調和させ得る一方で、大規模言語モデル(具体的にはGPT-4o)が専門家によるヒューマンコーディングとのほぼ完全な一致を実現することでそれを大幅に上回り、それによってレジストリ横断的な疾患ランドスケープ分析のためのより優れたソリューションを提供できることを実証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あらゆる本が異なる言語で書かれ、異なるアルファベットが使われ、時にはタイトル代わりに「病人のことについて」といった付箋が貼ってあるような、巨大な図書館を整理することを想像してみてください。これが、現在の臨床試験データの現状です。科学者たちは、新しい薬をテストするために何千もの実験を行っていますが、それらの試験は世界中のさまざまなデータベースに登録されています。厳格な医学コードを使用しているものもあれば、豪華な医学辞書を使っているものもあり、あるいは単に普通の英語やドイツ語で書き連ねているものもあります。これは、あるデータベースが「心臓の問題」と言い、別のデータベースが「心臓疾患」と言い、そして3つ目のデータベースが単に「ああっ、胸が痛い」と書いているときに、どれだけの人が「心臓の問題」について研究しているかを数えようとするようなものです。これらの異なる記述を一つの共通言語に翻訳する方法がなければ、科学者が実際にどのような疾患を研究しているのか、そしてどこに空白があるのかという全体像を把握することは非常に困難です。
これを解決するために、研究者には「翻訳者」が必要です。医学の世界では、疾患の「共通言語」はICD-10と呼ばれ、既知のあらゆる健康状態を分類する膨大なリストとなっています。課題は、臨床試験の記述から、それらを自動的に正しいICD-10コードへと変換することです。長い間、科学者たちは、単語とコードを一致させるための厳格なルールブックに従う、厳格な司書のようなコンピュータプログラムを構築しようとしてきました。より最近では、「大規模言語モデル(LLM)」と呼ばれる、新しいタイプの超スマートなコンピュータの脳が登場しました。これらのモデルは膨大な量のテキストで学習されており、文脈やニュアンスを理解することに長けています。それは、行間を読むことができる人間のようです。大きな疑問は、これらのAIの脳は、従来のルールベースのシステムよりも優れた仕事をして、試験の記述を翻訳できるのか?ということです。
この論文は、まさにその問いに深く切り込み、ドイツの4つの主要なレジストリからの臨床試験の記述を、標準的なICD-10コードに翻訳するためのハイテクなパイプラインを構築しています。研究者たちは「決定論的パイプライン」を作成しました。これは、簡単に言えば多段階のロボットプロセスです。まず、ロボットが疾患の言及を抽出します。次に、厳密な医学辞書(オントロジー)を使用してそれらを照合し、意味の類似性を探すスマートな検索エンジン(エンベディング)を使用します。彼らはさらに、正しい答えを見つけられるかどうかを確認するために、上位の候補を再ランク付けする第2のバージョンも追加しました。しかし、彼らはそこで止まりませんでした。彼らは強力な大規模言語モデル(GPT-4o)をテストしましたが、そこにはひねりがありました。AIに対して、人間の専門家が使うのと全く同じステップバイステップの論理とルールに従うよう強制し、AIが従来のロボットよりも優れた「司書」になれるかどうかを検証したのです。
結果は、旧来のアプローチにとって衝撃的なものでした。彼らがルールベースのロボット・パイプラインを、人間の医学専門家が作成した「ゴールドスタンダード」のコードと比較してテストしたところ、特定の3文字のコードを探す場合、ロボットが正解したのはわずか約49%でした。一般的なカテゴリー(例えば「心臓病」対「肺疾患」など)を推測することについては、約59%の正解率とまずまずの結果でしたが、詳細については苦戦しました。ロボットは、似たような響きの疾患に混乱したり、辞書の中から正しいコードを見つけられなかったりすることがよくありました。
しかし、大規模言語モデルは全く別の次元にいました。同じルールと仕事を与えられた際、このAIは驚異的な96.7%の精度を達成しました。それは人間の専門家とほぼ完璧に一致しました。論文は、AIのスーパーパワーは単にコードを知っていることではなく、文章の「文脈」を理解する能力にあると示唆しています。例えば、試験の中で「成人発症の糖尿病」と言及された場合、AIはそれが「タイプ2糖尿病」であることを即座に理解しますが、ロボットは正確な単語を一致させようとして行き詰まってしまうかもしれません。また、AIはロボットが諦めて拒絶した言及のうち、約82%に対して妥当なコードを割り当てることができました。
著者たちは、ロボットの主な失敗はランキングの問題ではなく、そもそも正しいコードを見つける段階にあったことを発見しました。もし正しいコードがロボットの初期の候補リストに含まれていなければ、いくら再ランク付けをしても救いようがありません。一方で、AIは、テキストが乱雑であったり曖昧であったりする場合でも、正しいコードが何であるべきかを判断するのが非常に上手でした。この研究は、従来のルールベースのシステムは疾患の傾向を大まかに把握するには適していますが、詳細を正確に捉えるためには大規模言語モデルが明らかに勝っていると結論付けています。彼らは、臨床試験の状況を調査する将来の研究において、これらのAIツールを使用することで、研究の取り組みが実際に最も重要な健康ニーズに焦力的になっていることを確実にするために、より明確で正確な姿を描けるようになるだろうと示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。