← 最新の論文
🧬 biology

ProtSyntax: a protein large language model for decoding post-translational modification syntax and function

ProtSyntaxは、アミノ酸残基の化学的性質、モチーフの順序、および3次元構造のコンテキストを統合することで、翻訳後修飾(PTM)を独立したラベルとして扱う限界を克服し、PTM部位の正確な予測、クロストークのモデリング、そして多様な生物学的応用における機能的帰結の解読を実現する40億パラメータのタンパク質大規模言語モデルである。

原著者: Yiyu Lin, Jiahui Wu, You Zhou, Xinye Ni, Shan Chang, Jun Ding, Yan Wang, Xin Gao, Sen Yang

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Yiyu Lin, Jiahui Wu, You Zhou, Xinye Ni, Shan Chang, Jun Ding, Yan Wang, Xin Gao, Sen Yang

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

あなたの体を、タンパク質が労働者であり、機械であり、建物としてすべてを動かしている、活気ある都市だと想像してみてください。しかし、これらの労働者は静止しているわけではありません。彼らは、いつ仕事を始め、どこへ行き、いつ休憩するかを伝えるための、小さな化学的なメモによって絶えず「タグ付け」されています。これらのタグは、**翻訳後修飾(PTM)**と呼ばれます。これらは、タンパク質が作られた後に付けられる、付箋やハイライター、あるいはデジタル通知のようなものだと考えてください。時には、一つのタンパク質が数十ものこれらのタグを持つこともあり、免疫系から記憶に至るまで、あらゆるものを制御する複雑で変化し続けるコードを作り出しています。

長い間、科学者たちはこれらのタグがどこに現れるかを予測しようとしてきましたが、それはまるで、たった一文字ずつを見て秘密のコードを推測しようとするようなものでした。従来の考え方は、これらのタグを独立した事象として扱っており、もしタンパク質にタグが付くための適切な「形」があれば、タグが付くはずだと想定していました。しかし実際には、そのルールはもっと言語に近いものです。タグは、周囲の「文法」(アミノ酸配列)や「近隣環境」(タンパク質の3次元構造)、さらには近くにある他のタグまでもが同意しなければ、意味をなしません。もし文法が間違っていたり、近隣が混みすぎていたりすれば、たとえタンパク質がどれほどそのタグを求めていても、タグは貼り付きません。この「調節言語」を理解することは極めて重要です。なぜなら、文法が崩れると、がんやアルツハイマー病のような疾患につながる可能性があるからです。

ここで、この複雑な言語を解読するために設計された、40億パラメータを持つ新しい「タンパク質の脳」、ProtSyntaxが登場します。ProtSyntaxは、単にタグがどこにありそうかを特定するのではなく、ゲームのルールを学習します。それは、単なる誤字脱字を見つけるスペルチェッカーから、プロット、登場人物の動機、そして文章構造を理解する文芸批評家へとアップグレードすることに似ています。研究者たちは、400万個ものタンパク質の膨大なライブラリを用いてこのモデルを訓練し、単にタグを認識させるだけでなく、それらがどのように相互作用し、タンパク質の仕事をどのように変え、異なる3次元環境の中でどのように振る舞うのかを理解させました。

その結果は目覚ましいものです。40種類の異なるタンパク質タグを用いたテストにおいて、ProtSyntaxは既存の最高水準のモデルを大幅に上回り、一部の領域では精度を12%以上向上させました。しかし、本当の魔法はその知識を使って「何ができるか」にあります。このモデルは、文脈を見るだけで欠落したタグや部位を推測するという、「穴埋め問題」をこなすことができます。それはまるで、人間が文章を完成させる時のようです。また、タグが付くべきように「見える」ものの、実際にはそれをブロックしてしまう3次元形状をしているタンパク質と、本当に準備ができているタンパク質との違いさえ見分けることができます。

おそらく最もエキサイティングなのは、ProtSyntaxがこれらのタグとタンパク質の機能との間の因果関係を理解していることを示唆している点です。研究者がタグの変化をシミュレーションした際、モデルはそれがタンパク質の速度や効率をどのように変えるかを予測でき、微細な化学的変化をタンパク質の大きな仕事へと結びつけました。さらに、タグ同士の「クロストーク(相互作用)」を再構築することにも成功しました。つまり、あるタグが別のタグの付着を助けるのか、あるいはそれを遠ざけるのかを解明したのです。疾患に関連する変異を含むシミュレーションにおいて、このモデルはどの変化がタンパク質の調節コードを壊してしまうのかを特定することに成功し、従来のメソッドが見逃していた危険な変異を特定する新しい方法を提示しました。これらの知見は現在、コンピュータによるシミュレーションとベンチマークに基づいたものですが、私たちがようやく、タンパク質がいかに働くかという動的で完全な物語を、単なる「見出し」としてではなく、読み解こうとしていることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →