Benchmarking antibody-antigen co-folding on human monomeric antigens
本研究は、10種類の抗原抗体共折り畳みプロトコルを評価するためのベンチマークであるHuMonoAg-Benchを導入し、近年の手法がCDRH3のモデリングを大幅に改善し、カットオフ後の複合体の約半分に対して中程度以上の精度を達成している一方で、正しい結合モードのサンプリングや柔軟なループのモデリングに課題が残っており、それが多くの構造的に不均一な複合体の予測を制限していることを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
ヒトの免疫系という微小な世界において、抗体は、侵入してきたウイルスや有害なタンパク質によって提示される「鍵穴」に完璧に適合するように設計された、高度に専門化された「鍵」として機能します。数十年もの間、科学者たちは、化学的な設計図を見るだけで、これら鍵と鍵穴がどのように適合するかを正確に予測できることを夢見てきました。この能力は、研究者がラボですべてのバージョンを構築してテストする必要なく、新しい薬やワクチンを設計することを可能にし、医学に革命をもたらすでしょう。しかし、この予測は生物学における最も手強いパズルの一つであり続けてきました。コンピュータは2つのタンパク質がどのように結合するかを推測することには長けていますが、抗体は特別なケースです。パートナーと共に進化する多くのタンパク質とは異なり、抗体は独立して進化するため、コンピュータが正確な推測を行うための助けとなる共通の進化の歴史を欠いています。さらに、標的に実際に掴みかかる抗体の部分は、常に形を変え続ける柔軟でゆらゆらとしたループであり、標準的なツールでモデル化することを極めて困難にしています。
ある研究チームは、最新世代のコンピュータプログラムがこの特定のパズルを解く上で、どこまで到達したかを測定するために調査を行いました。彼らは、抗体がヒトのタンパク質と結合している実世界の例を412件という膨大なコレクションとして収集し、コンピュータプログラムが構築される前に見られることのなかった厳格なテストセットを作成しました。10種類の予測手法をこの新しいデータに対して実行した結果、最新のソフトウェアは劇的な飛躍を遂げ、未知のケースの約半分について正しい形状を予測することに成功したことが明らかになりました。しかし、この研究は、最新のプログラムであっても最も柔軟な部分には依然として苦戦しており、単に予測回数を増やしても必ずしもより良い答えに辿り着くわけではないことも明らかにしました。研究者たちは、もしコンピュータに対して抗体が標的に触れるべき場所を正確に教えることができれば、古いプログラムでも新しいプログラムに追いつけることを発見しました。これは、主な障害がソフトウェアの知能そのものではなく、膨大な可能性の海の中から正しい出発点を見つけ出す能力にあることを示唆しています。
研究者たちはまず、HuMonoAg-Benchと呼ばれるベンチマークの組み立てから始めました。これは、抗体とヒトタンパク質の複合体を含む、精査された412件のリブラリです。彼らは、このコレクションを構造が発見された時期に基づいて2つのグループに慎重に分けました。一方のグループは、多くの現代的な予測ツールの学習データのカットオフ日である2021年9月以前に公開された278件の複合体で構成されています。もう一方のグループには、2021年9月以降に公開された134件が含まれており、これによりコンピュータプログラムがこれらの特定の形状を一度も見ることがなかったことを保証しました。テストをさらに精密にするため、彼らは新しいグループを、抗原が古いものと非常に類似しているものと、完全に新規のものの両方にさらに分割しました。この設定により、コンピュータが単に古い例を暗記しているのか、それとも新しい相互作用を予測する方法を真に学習しているのかをテストすることができました。その後、彼らは2つのタンパク質が共に折り畳まれる様子をシミュレートする10種類の共折り畳みプロトコル(co-folding protocols)をこのデータセットに対して実行し、予測結果を実際の実験構造と比較して、予測がどれほど近いかを確認しました。
結果は、古い手法と比較して、最新の手法における明確かつ有意な改善を示しました。未知の新しい複合体の構造を予測する場合、古いソフトウェアが正解またはそれに近い形状を見つけ出せたのは、わずか16〜22パーセントのケースのみでした。対照的に、Protenix v2、IntelliFold-2、ESMFFold2といった最も先進的な手法は、同じケースの約33〜52パーセントにおいて、中程度以上の品質のモデルを見つけることに成功しました。最も優れた性能を示したProtenix v2は、標準的な抗体に対して52パーセントの成功率を達成し、抗原が既知であった場合の特定の単一ドメイン抗体に対してはさらに高い82パーセントを達成しました。この進歩にもかかわらず、研究では、依然として約半数の新しいターゲットが未解決のままであることが強調されており、この分野が急速に進展している一方で、抗体の相互作用の大部分は現在の技術の及ばない範囲にあることを示しています。研究者たちは、この改善が単に新しいプログラムがより多くのデータを見たためではなく、複雑な形状のモデリング方法における根本的な改善によるものであると指摘しました。
なぜ一部の予測が成功し、他の予測が失敗したのかという詳細な分析は、特定の構造的特徴、すなわちCDRH3ループを指し示していました。これは抗体上の柔軟なヘアピン状の構造であり、標的との主要な接触点として機能します。研究によれば、コンピュータは抗原の硬い部分や抗体の他のより安定したループのモデリングには概して優れていましたが、CDRH3ループは最も困難なコンポーネントであり、特にそのループが長い場合にその傾向が顕著でした。新しい手法はこの特定のループのモデリングにおいて著しい改善を示しており、それが全体の成功率の高さと直接相関していました。しかし、ループの局所的な構造がうまくモデル化されたとしても、抗体全体が標的に対して正しく配置されることは保証されず、パーツを正しく作ることがパズル全体を正しく組み立てるのと同じではないことを示しました。
研究者たちはまた、コンピュータプログラムに対して、抗体がどこに結合すべきかというヒントを与えた場合に何が起こるかをテストしました。現実世界のシナリオでは、科学者は抗体が付着する標的タンパク質のいくつかの主要な箇所を知っているかもしれませんが、抗体の正確な形状までは知りません。この限定的な情報を制約として提供することで、古い手法の成功率は20〜30パーセント上昇し、最も強力な制約なしの手法と同等のレベルに達しました。この発見は、古いソフトウェアの主な限界が物理学の理解不足ではなく、何十億もの可能性の中から正しい結合モードを見つけ出す能力の欠如にあることを示唆しています。ヒントによって探索空間が狭められると、古いプログラムは解を見つけることができました。しかし、この恩恵は提供されたヒントの正確さに大きく依存しており、提供された情報が部分的にしか正しくなかった場合、改善は見られませんでした。
最後に、チームはシミュレーションをより多く実行することが残りの問題を解決するかどうかを調査しました。彼らは、制約なしの手法において、主な問題はサンプリングの失敗、つまり正しい形状が生成されたモデルのセットの中にそもそも現れないことであると発見しました。シミュレーションの実行回数を増やすと、より多くの正しい形状が見つかりましたが、同時にコンピュータのランキングシステムが、最適な答えをトップとして選ぶことにしばしば失敗することも分かりました。これにより、新たなボトルネックが生じました。たとえ正しい答えが生成されたとしても、ソフトウェアがそれを最良の選択肢として認識できないことがあるのです。研究は、実行回数を増やすことが助けにはなるものの、最適なモデルを正しくランク付けし、選択する能力が、モデルを生成する能力と同じくらい重要になっていると結論付けました。未解決のまま残されたケースは、単一の共通した特徴を持たない困難なターゲットの多様な混合物であり、今後の道筋には、単一の問題を修正することではなく、複数の異なるタイプの課題を解決する必要があることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。