← 最新の論文
📄 bioengineering

ProtGPT3: an Open-source family of Promptable and Aligned Protein Language Models

本論文は、機能的かつ多様なタンパク質配列を生成するための、ファインチューニングに代わるスケーラブルで効果的な手法として、数発プロンプティング(few-shot prompting)および推論時のステアリング(inference-time steering)を実証する、プロンプト可能でアライメントされたタンパク質言語モデルのオープンソースファミリーであるProtGPT3を紹介するものである。

原著者: Garibbo, M., Boxo Corominas, G., Stocco, F., Illanes Vicioso, R., Middendorf, L., Ferruz, N.

公開日 2026-06-08
📖 1 分で読めます☕ さくっと読める

原著者: Garibbo, M., Boxo Corominas, G., Stocco, F., Illanes Vicioso, R., Middendorf, L., Ferruz, N.

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

想像してみてください。あなたには、宇宙にあるあらゆる料理のレシピを知っている、巨大で魔法のような料理本があります。生物学の世界において、この「料理本」とは、生命を維持するための小さな機械である「タンパク質」を作るための「レシピ」を理解するコンピュータープログラムのことです。

この論文は、ProtGPT3と呼ばれる、この料理本の新しいオープンソース版を紹介しています。その仕組みを、簡単な比喩を用いて説明します。

1. 問題点:あまりに多くの混沌

これまでのコンピュータープログラムは、何百万もの新しい料理を考案できるシェフのようなものでしたが、誰も食べられないようなデタラメな料理を作ってしまうことがよくありました。科学者たちは、シェフに特定の種類の料理(例えば「スパイシーなパスタ」や「ヴィーガンのデザート」など)を作らせるように導きたいと考えていましたが、毎回シェフを一から再学習させることなく、明確な指示を与えることは困難でした。

2. 解決策:柔軟なシェフのファミリー

著者たちは、小さくて素早いものから、最大100億個の「脳細胞」を持つ巨大で超知能的なものまで、一連の「タンパク質シェフ」を生み出しました。彼らはこれらを、まるで公共のレシピライブラリーのように、誰もが利用できるように公開しました。

3. 指示を与えるための2つの新しい方法

論文では、シェフを再学習させることなく、シェフに何を料理させるかを伝えるための2つの巧妙な方法を強調しています。

  • 「プロンプト」法(Few-Shot Prompting): シェフに全く新しい言語を教える代わりに、作りたい料理の例をいくつか見せるだけです。これは、シェフに「完璧なチョコレートケーキ」の写真を見せて、「これに似たものを作って」と言うようなものです。論文では、この方法が従来の低速な再学習の方法と同じくらい優れていることが示されましたが、より速く、より簡単です。
  • 「アライメント」法(Fine-Tuning): これは、何が良い料理であるかについての厳格なルールをシェフに教えるようなものです。研究者たちは、モデルが「味が薄い」あるいは「単調すぎる(低複雑度)」レシピを作らないようにしつつ、多様な風味を維持するように教えました。これにより、生成されるタンパク質が高品質で安定したものになることを保証しています。

4. 「MSA」というスーパーパワー

一部のシェフは、**MSA(多重配列アラインメント)**と呼ばれる特別な能力を持っています。これは、一つのレシピだけを見るのではなく、異なる文化からの似たようなレシピの束全体を見て、料理の「本質」を理解するシェフのようなものです。

  • 結果: チームがフッ素を除去するための特定のタンパク質(低データ・デフルオリナーゼ)を設計しようとした際、「レシピの束」を用いる方法を用いたシェフ(ProtGPT3-MSA)は、ゼロから再学習させたシェフよりも優れた成果を上げました。
  • 現実世界での証明: 彼らは単にコンピューター上でシミュレーションを行っただけではありません。実際にラボでそのタンパク質を構築しました。結果は成功でした。タンパク質は適切に溶解し、正常に発現しました。これは、コンピューターによる設計が現実的で機能的なものであることを証明しています。

5. リアルタイムでの操舵

最後に、論文は「ファインマン・カッツ推論(Feynman–Kac inference)」と呼ばれる新しいトリックについて述べています。想像してみてください、あなたは目的地に向かって車を運転しています。通常、ルートを選んだらそのまま進みます。この新しい方法は、道が難しくなったとしても、目的地への経路から正確に外れないように、走行中に常にステアリングホイールを調整してくれるGPSのようなものです。これにより、科学者はタンパク質の生成が行われているまさにその瞬間に、生成を特定の目標へと操舵することができます。

要約すると: 著者たちは、科学者が新しいタンパク質をより簡単に設計できるようにする、多才でオープンソースのツールキットを構築しました。彼らは、AIを必ずしも再学習させる必要はなく、時には優れた例を与えたり、「レシピの束」のアプローチを用いたりする方が、より速く、より効果的であり、実際に現実世界で機能する結果を生み出すことができるということを示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →