Effective sequence-to-expression prediction for a model membrane protein using machine learning and computational protein design
本研究は、12,000種類を超える設計された膜タンパク質の変異体からなる制御されたデータセットで学習させた教師あり機械学習が、大腸菌における発現レベルを正確に予測し、精製収量を8倍に向上させるためのタンパク質工学を導くことができることを実証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あなたは、非常に特殊で複雑なケーキ(膜タンパク質)を、忙しいキッチン(生細胞)の中で焼こうとしているところだと想像してください。問題は、このケーキが極めて焼きにくいことです。ほとんどの場合、焦げてしまったり、生焼けだったり、あるいは全く膨らまなかったりします。科学者たちは、どのような材料と手順を用いれば完璧なケーキを保証できるのかを正確に伝える「レシピガイド」を長らく求めてきましたが、研究対象となる成功したレシピが十分に足りないために、行き詰まっていました。
この論文は、高度な製菓実験とコンピュータ学習を巧みに組み合わせることで、そのガイドを作成することについて述べています。
大規模な実験
完璧なレシピを推測しようとする代わりに、研究者たちはコンピュータを使用して、特定の種類の膜タンパク質に対して、わずかに異なる12,248通りの「ケーキのレシピ」(タンパク質の変異体)からなる膨大なライブラリを設計しました。そして、これらすべてのケーキを、標準的なキッチン、この場合は大腸菌(E. coli)と呼ばれる一般的な細菌の中で焼き上げました。
データの課題
通常、科学者がコンピュータに結果を予測させるには、数千もの成功および失敗したレシピを教える必要があります。しかし、ここでは12,000以上のレシピのうち、データが得られているのは約2,000件だけでした。これは、全 possible なケーキのわずかな一部しか見せることなく、生徒にケーキの焼き方を教えようとしているようなものです。
「スマート・アシスタント」
チームは、機械学習ツール(例から学習する一種のコンピュータプログラム)を使用して、それら2,000件の既知のレシピを研究しました。彼らはコンピュータに、材料(タンパク質の配列)を観察し、その結果が「良いケーキ」(高発現)になるか、「悪いケーキ」(低発現)になるかを推測するように教えました。
驚いたことに、限られたデータにもかかわらず、コンピュータはエキスパートになりました。未知のレシピに対してテストを行った際、その精度は驚異的でした。彼らはこの「スマート・アシスタント」を使用して、まだ実際に焼いていない残りの10,000件以上のレシピの結末を予測しました。
検証の魔法
アシスタントが単に推測しているだけではないことを証明するために、研究者たちはラボに戻り、予測された上位のレシピを実際に焼きました。結果はどうだったでしょうか?完璧な成功率100%でした。コンピュータが良いと言うものはすべて良く、失敗すると言ったものはすべて失敗したのです。
コードを解読する
研究者たちは単に予測を行うだけでなく、「説明可能なAI」ツールを使用して、コンピュータに「なぜそのような選択をしたのか」を問いかけました。それは、アシスタントに「なぜ砂糖を増やすと台無しになると考えたのですか?」と尋ねるようなものです。コンピュータは、材料を変えることで最も大きな変化が生じるレシピ内の特定の箇所を指し示しました。
最終的な結果
これらの洞察を用いて、彼らはもともと作るのが非常に困難であった「悪いケーキ」のレシピを取り、コンピュータのアドバイスに基づいて微調整を行いました。その結果、そのケーキは以前よりも8倍作りやすいものになりました。
まとめ
この論文は、この特定の制御されたタンパク質レシピのセットにおいては、問題を解決するために超複雑で謎めいたAIは必要ない、と結論付けています。シンプルで理解しやすいコンピュータモデルこそが、これらの困難なタンパク質を細胞内でうまく発現させるための「秘密の言語」を解読できるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。