← 最新の論文
🧬 biology

Frequent Hitter Prediction Beyond Classification Models

本研究は、経験ベイズ補正されたヒット率の直接回帰およびマルチラベル集約戦略が、ハイスループットスクリーニングにおける頻回ヒット予測において、従来の閾値依存的な二値分類よりも優れた性能を示すことを実証しており、初期濃縮度とグローバルなランキングを向上させる、より堅牢でカットオフに依存しないアプローチを提供するものである。

原著者: Samuli Näppi, Steffen Renner, Jutta Blank, Ansgar Schuffenhauer, Paul Selzer

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Samuli Näppi, Steffen Renner, Jutta Blank, Ansgar Schuffenhauer, Paul Selzer

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

創薬の初期段階において、科学者たちはハイスループットスクリーニングと呼ばれる大規模な実験を行います。ロボットが何十万もの小さな化学分子を生物学的標的に対してテストし、その分子が疾患の原因となるタンパク質に付着したり、有害な細胞プロセスを阻害したりする兆候がないかを探る研究所を想像してみてください。目標は、将来の医薬品としての真の有望性を示す希少な「ヒット」分子を見つけ出すことです。しかし、このプロセスにはノイズが伴います。多くの分子が誤警報(偽陽性)を生み出します。中には、テストを妨げるような形で凝集するものや、装置と化学反応を起こすもの、あるいは単に機械による読み取り結果に干渉するものもあります。これらの厄介者は「頻回ヒット化合物(frequent hitters)」として知られています。これらは、強力な薬であるからではなく、化学的にノイズが多いために、数十、時には数百もの異なるテストで活性があるように見えるのです。もし研究者が、これらのノイズの多い化合物と真の創薬候補を区別できなければ、行き止まりの追求に時間と資金を浪費することになります。課題は、高価な実験を開始する前に、信号からノイズを分別し、これらの頻回ヒット化合物を早期に特定できるシステムを構築することです。

長年、この問題に対処するための標準的な方法は、明確な境界線を引くことでした。科学者は、すべてのテストの中でその分子がどれくらいの頻度でヒットとして現れたかを計算し、固定のカットオフ値(閾値)を設定してきました。もし分子のヒット率がそのラインを超えていれば、「頻回ヒット化合物」とラベル付けされて破棄されました。そうでなければ、保持されました。このアプローチは単純ではありますが、重大な欠陥があります。それは、決定を単純な「はい」か「いいえ」として扱うため、ラインのすぐ近くにある分子に関する貴重な情報を捨ててしまうのです。カットオフ値をわずかに上回っただけの分子は、重大な違反者と同じように扱われますが、カットオフ値をわずかに下回っただけの分子は、たとえ問題となる危険性が高いとしても、完全に安全であると見なされます。さらに、もし研究所がルールを変更して、より厳格にしたり、あるいはより寛容にしたりしたいと考えた場合、ゼロから全く新しいコンピュータモデルを構築しなければなりません。この硬直性は、最も有望なリード化合物を優先順位付けする能力を制限します。

スイス連邦工科大学とノバルティス・バイオメディカル・リサーチの研究チームは、このプロセスを再考することにしました。すべての分子を二値の箱に押し込める代わりに、分子が頻回ヒットである真の可能性を反映する「連続的なスコア」を予測できないかと問いかけたのです。彼らは、分子の形状(グラフニューラルネットワークとして知られるもの)に着目した高度なコンピュータモデルを用いた新しい手法を開発しました。これらのモデルを「はい」か「いいえ」を判断するように訓練するのではなく、分子が実際に受けてきたテストの数を考慮した「補正済みヒット率」という特定の数値を予測するように訓練しました。経験的ベイズ法と呼ばれる統計的手法を用いてノイズを平滑化するこの手法により、モデルはリスクの全スペクトルを見ることができるようになります。これにより、モデルは明らかに迷惑な分子、明らかに成功している分子、そしてその中間にある詳細な調査が必要な分子を区別できます。

研究者たちは、2つの大規模なデータコレクションを用いて、この新手法を従来の方法と比較検証しました。一方は1,000以上の異なる生物学的テストを含む公開データベースからのデータであり、もう一方はノバルティスの独自のプライベート・ライブラリのスクリーニング結果によるものです。彼らは、テストが試験管内(生化学的)で行われたか細胞内(細胞学的)で行われたかに基づいてデータをグループ分けし、コンピュータモデルが未経験の化学構造に対してテストされるようにしました。彼らは、固定のカットオフ値に依存する従来のモデルと、この新しい連続予測モデルを比較しました。その結果、新手法が優れていることが示されました。連続モデルは、特に最悪の違反者をフィルタリングするために非常に厳格になる必要がある場合において、分子を正しくランク付けすることに長けていました。彼らは、リストのより早い段階で最も問題のある化合物を特定することができ、これはラボでの時間を節約するために極めて重要です。

おそらく最も重要な点は、この新手法が非常に柔軟であるという点です。モデルは固定されたラベルではなく連続的なスコアを予測するため、科学者はコンピュータを再学習させることなく、いつでも決定ルールを調整できます。プロジェクトに非常に高い安全マージンが必要な場合は、単に問題とみなす閾値を上げることができます。より広い網をかける必要がある場合は、閾値を下げることができます。研究の結果、この柔軟性と精度の高さの両立が、連続的なアプローチを実世界の創薬におけるより実用的なツールにしていることが分かりました。また、研究者たちは、モデルが個別のテストごとの結果を予測し、それらを単一のスコアに統合するという第二の戦略についても調査しました。この手法も良好なパフォーマンスを示し、分子がなぜ問題を引き起こしているのかを理解するための異なる視点を提供しました。

これらの知見は、スクリーニングの未来が、硬直した白黒の分類から、より微細なリスクの理解へと移行することを示唆しています。頻回ヒットをカテゴリーではなくスペクトラムとして扱うことで、これらの新しいモデルは、どの分子をさらなる研究に値するかを優先するための、より明確で信頼性の高い方法を提供します。これは、従来のメソッドが無用であることを意味するのではなく、それらが達成できるはずの効率に達していないことを示しています。連続モデルは、化学データの混沌とした現実を処理しながら、最も重要な微妙な差異を捨て去ることなく扱える、堅牢なベースラインとして機能します。創薬が膨大なデータに依存し続ける中で、変化するニーズに適応し、あらゆる分子に対して詳細なリスクプロファイルを提供できるシステムを持つことは、次世代の救命薬を見つけ出すために不可ло欠となるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →