An interpretable open platform for sequence-based antibody developability prediction
本論文は、厳密な交差検証を用いることで、独自のトレーニングデータへのアクセスを必要とすることなく、独自のデータセットおよび公開データセットの両方において高い性能を達成し、配列ベースの抗体デベロッパビリティ予測モデルの学習、評価、および解釈を研究室に可能にするオープンソースプラットフォームであるDELPHIを紹介するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
抗体は免疫システムの特化した兵士であり、ウイルスや細菌などの特定の侵入者を認識して無力化するように設計されたY字型のタンパク質です。現代医学において、科学者たちはがんから自己免疫疾患に至るまで、さまざまな病気と戦うためにこれらの分子を設計しています。しかし、治療用抗体を作ることは、非常にリスクの高い賭けでもあります。ある分子が標的に結合できるからといって、それが患者の体内への旅路を生き延機できるとは限らないからです。多くの候補が失敗するのは、それらが「粘着性」を持ち、互いに凝集したり、体内の誤ったタンパク質に結合したりするためであり、その結果、急速に排除されたり、危険な免疫反応を引き起こしたりすることがあります。これらの失敗は「デベラビリティー・ライアビリティ(開発上の欠陥)」として知られ、開発プロセスの後半で発見されることが多く、長年の研究と数百万ドルの資金を無駄にすることになります。何十年もの間、抗体が安全で安定しているかを知る唯一の方法は、ラボでそれを合成して物理的なテストを行うことであり、これは現代の遺伝技術によって生成される何百万もの潜在的な候補に追いつくことのできない、遅くて高価なボトルネックとなっていました。
プロテイン・イノベーション研究所の研究チームは、このボトルネックを解決するために、DELPHIと呼ばれる新しいツールを構築しました。これは、抗体の遺伝的な設計図を見て、それが実際にラボで分子として作られるずっと前に、その抗体が安定していて安全であるかどうかを予測できる、高度に訓練された「デジタル偵察兵」のようなものだと考えてください。研究者たちは単一の予測モデルを作ったのではなく、あらゆる研究所が独自のデータを使用してカスタム予測器を訓練できるオープンなプラットフォームを構築しました。25種類の異なる人工知能技術を実世界の実験データに対してテストした結果、正確な予測の鍵は、コンピュータのアルゴリズムの複雑さではなく、抗体の配列が機械に対してどのように表現されるかにあることが分かりました。彼らのシステムは、結合領域における電気的な電荷の不均衡など、失敗につながる微妙な化学的シグネチャーを見つけ出すことに成功し、今や最高の人間の専門家に匹敵する精度で候補をスクリーニングすることができます。
この研究の核心は、コンピュータにタンパク質の言語を読ませることにあります。抗体はアミノ酸の鎖でできており、これらの構成要素の特定の順序が分子の挙動を決定します。研究者たちは、すでにラボでテスト済みの抗体配列の膨大なコレクションを集め、それらを「パス(安定しており、粘着性がない)」または「フェイル(凝集したり、誤ったものに付着したりしやすい)」としてラベル付けしました。彼らはこのデータをDELPHIに投入し、これらのアミノ酸の鎖をコンピュータが理解できる形式に翻訳するさまざまな方法を試みました。ある手法は、配列を単純な部品のリストとして扱いましたが、他の手法は、人間が文脈に応じて単語の意味が変わることを理解するのと同様に、タンлоの異なる部分の間の文脈や関係性を理解する高度な「言語モデル」を使用しました。
結果は驚くべきものでした。システムは、抗体の配列をどのように表現するかという選択が、予測を行うためのコンピュータモデルの種類よりもはるかに重要であることを学習しました。具体的には、抗体の重鎖と軽鎖を個別にではなく、一緒に見るモデルの方が、失敗につながる微妙なパターンを見つけるのがはるかに優れていました。24万6,000以上の抗体のライブラリを用いてテストした際、最高のバージョンのDELPHIは、安定した抗体と不安定な抗体を区別する上で0.95のAUCを達成しました。この性能は、学習データに含まれていない未知の抗体(臨床試験中のものを含む)に対して予測を求められた場合でも維持されました。主要な業界コンペティションに対するブラインドテストにおいて、このツールは、コンペティション固有のデータにアクセスすることなく、トップクラスの人間による提出エントリーと同等の性能を発揮しました。
DELPHIは、単に「合格」か「不合格」かを予測するだけでなく、ほとんどの研究者にはこれまで不可能だったレベルの詳細を提供します。それは単にスコアを与えるだけでなく、リスクの原因となっている特定のアミノ酸を指摘することで、なぜそのスコアを与えたのかという理由を説明します。分析の結果、一貫したパターンが明らかになりました。失敗する抗体は、結合ループにおいてアルギニンやリシンといった正に電荷を持つ構成要素が多く、アスパラギン酸のような負に電荷を持つ構成要素が不足している傾向がありました。この電気的な不均衡が抗体を「粘着性」のあるものにし、無関係なタンパク質を掴んだり、凝集したりする原因となります。このツールは、この同じ危険なシグネチャーを、二種類の異なる失敗(誤ったものに付着する抗体と、単一の安定したユニットとして留まることができない抗体)の両方で見出しました。これは、これらの特定の領域における電気的電荷を修正することで、一度に複数のタイプの失敗を防げる可能性を示唆しています。
研究者たちはまた、予測を信頼できるものにするためにどれだけのデータが必要かをマッピングしました。彼らは、より多くのデータが追加されるにつれてシステムの精度が急速に向上するものの、約5,000の多様な抗体配列の後で横ばいになることを発見しました。これは研究所に対する明確なガイドラインとなります。つまり、有用な予測器を構築するために何百万ものサンプルは必要なく、よく特性化された数千の例があれば、高い信頼性に達するのに十分であるということです。さらに、このツールは柔軟性に優れています。オープンソースソフトウェアであるため、どの研究所でも独自の実験結果をアップロードし、特定の種類の抗体を用いてモデルを再訓練し、直ちに新しい候補のスクリーニングを開始することができます。これにより、デベラビリティー(開発性)を予測する能力が民主化され、開発分野が、高価で段階的な失敗から、最も有望な抗体が早期に特定され、患者が必要とする時間を節約できる未来へと移行することを可能にします。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。