JURY: A Comprehensive Training-Free to Fully-Supervised Framework for Evaluating Chemical Language Models
本論文は、学習不要な手法から完全教師あり学習の手法まで、訓練なしから完全な教師あり学習に至る4つの異なるプローブを活用して化学言語モデルを厳密に評価する包括的なフレームワークであるJURYを紹介しており、それらの真の化学的エンコーディング能力は強力な予測ヘッドによってしばしば隠蔽されており、以前考えられていたよりも従来のフィンガープリントに近いものであることを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新薬発見の競争において、科学者たちはあらゆる突破口を遅らせるボトルネックに直面している。それは、新しい化学化合物が薬になる前に、厳格な一連の安全性チェックを通過しなければならないということである。研究者は、その化合物が体内に吸収されるのか、血液中をどのように移動するのか、肝臓でどのように分解されるのか、そして毒性がないかを知る必要がある。これらは「吸収、分布、代謝、排泄、および毒性(ADMET)」として知られるチェックであり、実験室で行うにはコストがかかり、時間もかかる。このプロセスを加速させるため、科学者たちはコンピュータを利用し、分子の構造を見るだけでこれらの特性を予測する人工知能を活用している。長年、最も成功してきたツールは、数百万もの化学式をテキスト文字列として学習させた「言語モデル」であった。これらのモデルは、複雑な分子を単一の固定された数値リスト、すなわちその化学的本質を捉えたデジタル指紋へと圧縮することを学習する。これらのモデルがどれほど優れているかを判断する標準的な方法は、モデルに単純な予測ツールを付加し、そのツールを少量の実験データで学習させ、その予測がどれだけ正確かを検証することであった。予測が良ければ、そのモデルには高いスコアが与えられる。
しかし、新しい研究は、この標準的な手法が決定的な真実を隠してきた可能性を示唆している。研究者たちは、予測ツール自体が非常に多くの役割を果たしてしまい、その結果、基礎となるモデルが実際に何を学習したのかが覆い隠されてしまうことが多いことを発見した。強力なツールは、与えられた答えから多くのことを学習できるため、たとえ読み取っているデジタル指紋が弱くても、あるいは役に立たなくても、高い性能を発揮できてしまうのである。これを解決するために、ドイツの研究チームは、JURYと呼ばれる新しいモデル評価手法を開発した。彼らは単一の学習済みツールに頼るのではなく、モデルのデジタル指紋を読み取るために4つの異なる手法を用いた。そのうち2つの手法は、分子がデジタル空間内で互いにどれほど近い位置にあるかを見るだけで、学習を一切必要としない。残りの2つの手法は、単純な直線計算から小さな柔軟なネットワークに至るまで、簡単な学習を用いたものである。これらの4つの手法を10種類の化学モデルと73種類の安全性テストに適用した結果、チームは、モデル同士がこれまで考えられていたよりもはるかに似通っていることを発見した。あらゆることに対して最高である単一のモデルというものは存在しなかった。実際、数十年前の、手作業で作られた分子記述法が、多くのケースにおいて最新の高度なAIと同等の性能を発揮したのである。
最も驚くべき発見は、モデルの違いは保持している化学的知識の量にあるのではなく、その知識をどのように「整理しているか」にあるということだった。あるモデルは、性質が似ている分子が自然に近くに配置されるようにデジタル指紋を構成しており、追加の学習なしでも容易に見つけられるようになっている。一方で、別のモデルは、同じ化学的知識を、予測器を学習させてデータを再構成した後でなければ見えないような形で隠している。これは、ある司書はすでにジャンル別に本を整理しているが、別の司書は本をランダムに積み重ねているものの、適切な質問をすれば特定の書物を正確に見つけ出すことができる、という図書館の例えに似ている。研究は、第一のアプローチに長けたモデルが第二のアプローチでは失敗する可能性があり、その逆もまた然りであることを示した。つまり、単一のスコアではモデルが優れているかどうかを判断することはできず、その強みがどこにあるかを理解するためには、異なるテスト手法にわたるプロファイルを見る必要があるということである。
研究チームは、3つの異なるトランスフォーマー・ファミリーを使用するものを含む、10種類の異なる化学言語モデルと、ECFP(拡張連結性フィンガープリント)として知られる伝統的な手作業による手法をテストした。彼らは、薬物の吸収から毒性の可能性に至るまで、73種類の異なるタスクをカバーする4つのテスト手法を適用した。結果を分析すると、使用するテスト手法によってモデルのランキングが完全に変わることが判明した。学習を必要としない手法で1位となったモデルが、予測器の学習を伴う手法でテストされると、リストの最下位に転落することがよくあった。逆に、学習なしでは苦戦したモデルが、単純な予測器を追加した途端にトップに躍り出ることもあった。この不一致は、モデルが単に「優れている」か「劣っている」かではなく、化学的知識を根本的に異なる方法で保存していることを証明した。
MoLFormer-XLと呼ばれる一つのモデルは、デジタル空間を非常に明確に整理しており、挙動が似ている分子がすでにグループ化されていることを示した。このモデルは、追加のツールを学習させることなく、デジタル空間内の近傍探索を行うだけで、極めて優れた性能を発揮した。対照的に、MolEncoderという別のモデルは、生の空間配置に基づいたテストでは性能が悪かった。しかし、単純な予測器をそのデータに学習させると、MolEncoderはランキングのトップに躍り出た。これは、MolEncoderが同じ量の化学的知識を保持していながら、それを解凍するためには学習済みのツールが必要な形式で隠していたことを示している。また、本研究は、現代のAIに先駆けて作られた伝統的な手作業によるフィンガープリント手法が、学習を許可しない状況においては、特に人体における化学物質の挙動を予測する際に、最新のモデルを凌駕することが多いことも明らかにした。これは、特定のタスクにおいては、化学データを整理する古い手法がいまだに非常に効果的であることを示唆している。
チームは、複雑なシステムを単一の数字で判断することは、音楽家をたった一曲の演奏だけで判断するようなものであると結論づけた。モデルは、データの内部構造によっては、ある種の予測には優れていても、別の予測には全く適さない可能性がある。新しいフレームワークであるJURYは、単一のスコアに代わり、どの程度の監督(学習)が行われたかによってモデルがどのように機能するかを示す詳細なプロファイルを提供する。これにより、科学者は目的に応じた適切なツールを選択できるようになる。もし研究者が、新しいツールを訓練する時間をかけずに化学ライブラリを迅速にスクリーニングしたいのであれば、学習なしのテストで高い性能を示すモデルを選ぶべきである。もし豊富なデータがあり、重要なタスクのために特定の予測器を訓練したいのであれば、学習後にこそ優れた性能を発揮するモデルを選ぶのがよい。モデルの知識がどこにあり、それがどのように整理されているかを理解することで、科学者は単なるランキングを超えて、これらの人工知能が実際に何を学習したのかという深い理解に基づき、より良い意思決定を行うことができるようになる。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。