BOTANIC-1: a series of long-context plant genomic foundation models in the agentic era
本論文は、アノテーションされていない植物データで学習され、形質関連領域の予測において既存のモデルを凌駕し、メカニズムの解釈可能性を通じて生物学的知見を提供するとともに、気候変動に強い作物の開発を加速させるために研究コミュニティへ公開される、ロングコンテキストかつエージェント統合型のゲノム言語モデルのファミリーであるBotanic1を紹介するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
生命の設計図が、A、C、G、Tという4つの文字による言語で書かれている世界を想像してみてください。これらの文字は、植物がどのように成長し、どのように乾燥に耐え、どのように病気と戦うかを決定するDNA配列を形成しています。何十年もの間、科学者たちはこの言語を読もうと試みてきましたが、それは数十億の単語からなる巨大で複雑なテキストであり、その多くは種ごとに異なる方言で書かれています。植物が厳しい気候や新しい害虫に直面したとき、その解決策はしばしば、このコードへの極めて小さな変化、つまり、作物をより強くするかもしれない、たった一文字の入れ替えの中に隠されています。その特定の変化を見つけ出すことは、干し草の山の中から針を探すようなものですが、その干し草の山は図書館ほどの大きさがあり、針は肉眼では見えません。伝統的な手法は、多くの植物を比較してパターンを見つけ出そうとしますが、これは時間がかかり、コストも高く、研究者に明確な一つの答えではなく、数千もの可能性を残してしまうことがよくあります。
パリの研究チームは、この生物学的なテキストを読み解くための新しい方法を導入しました。彼らは、植物DNAの文法を理解するために特別に設計された「Botanic1」と呼ばれる人工知能モデルのファミリーを構築しました。これまでのツールとは異なり、これらのモデルは、人間によって生物学のルールを教えられる必要はなく、自ら言語を学習しました。モデルには、小さなコケからそびえ立つ高木まで、320種類の異なる植物種の遺伝子配列が与えられ、配列内の欠落した文字を予測するように求められました。これを何百万回と繰り返すことで、モデルはDNAがどのように構造化されているか、どのように遺伝子がオン・オフされるか、そしてコードの微細な変化が植物にどのような影響を与えるかという、隠されたルールを学習しました。その結果、長いDNA領域を見渡すだけで、植物の生存にとってどの部分が重要であり、どの変化が有害または有益であるかを瞬時に察知できるシステムが誕生しました。
研究者たちは単に一つのモデルを作ったのではありません。彼らは、これらのモデルのトレーニングとテストのプロセス全体を管理するために、インテリジェントなソフトウェアエージェントを使用する「工場」を作り上げました。これらのエージェントがデータの整理、実験の実行、エラーの修正といった重労働を担うことで、人間の科学者は大きなアイデアに集中できるようになります。このアプローチにより、以前はまとめて分析することが不可能だったゲノムの異なる部分間の長距離相互作用を捉えることができる、最大12万8千文字の長さのDNA配列を読み取れるモデルを訓練することができました。テストにおいて、これらのモデルは、はるかに大規模でより多くのデータで訓練された既存のツールを含む、植物遺伝学を理解するためのあらゆる既存ツールを凌駕しました。彼らは、遺伝子の開始と終了の境界線といったDNAの最も重要な部分を特定し、細胞に遺伝的指示の切り貼り(カット・アンド・ペースト)の方法を伝える特定のシグナルさえも見つけ出すことができました。
この発見を特に強力なものにしているのは、モデルがそれらのルールを教えられることなく、自ら学習したという点です。研究者がモデルの内部を調査し、何を学習したのかを確認したところ、AIは「スプライス部位」(遺伝子がタンパク質になる前にどのように編集されるかを示す指示)のような生物学的概念を独立して発見していました。ある顕著な例では、モデルはある遺伝子内の特定の場所を特定しましたが、そこは標準的な科学データベースによって20年以上も誤ってマークされていた場所でした。モデルの内部ロジックは異なる箇所を指し示しており、研究者がその遺伝子の履歴を確認したところ、1999年の記述が実は正しく、モデルが後に更新された過程で失われてしまった真実を再発見していたことが判明しました。このことは、これらのモデルが、データの中に隠れていて人間の注釈(アノテーション)が見逃してきた生物学的な真実を明らかにする、新しい種類の顕微鏡として機能できることを示唆しています。
チームはまた、これらのモデルが人間の研究者とどのように新しい形で協力できるかを実証しました。彼らは、汎用人工知能エージェントに対し、メロンの特定の形質の原因、すなわち、なぜある植物は雌花を出し、他の植物は雌雄同株になるのかを突き止めるよう設定しました。エージェントには数千の遺伝的差異のリストが与えられ、その原因となる一つを見つけ出すよう求められました。エージェントが標準的なツールのみを使用してこれを解決しようとしたとき、リストを絞り込むことはできても、正しい答えを選ぶことはできませんでした。しかし、研究者がエージェントにツールとしてBotanic1モデルへのアクセスを与えると、エージェントは即座に正しい遺伝的変化を筆頭候補としてランク付けしました。モデルは、遺伝的変化がどれほど「驚き」をもたらすかという連続的な尺度を提供したことで、エージェントが真の原因をノイズから区別するのを助けたのです。
この研究は、植物の研究における重要な進歩を象徴しています。機械にDNAの言語を教えることで、研究者たちは、変化する気候に耐えうる作物を見つけ出す探索を加速させるツールを作り上げました。これらのモデルは単に速いだけでなく、より正確であり、以前は目に見えなかったパターンを見抜くことができます。これらは、どの遺伝子が重要であるかを推測する段階から、どの遺伝子が重要であるかを高い確信を持って知る段階へと移行させる手段を提供します。研究者がこれらのツールを科学界に公開することで、複雑な生命のコードを、以前では到達不可能だったスピードと精度で理解し、改善できる植物生物学の新時代の扉が開かれました。モデルは現在、他の科学者が使用できるよう公開されており、より優れた作物の品種改良や、植物界における生命の根本的なメカニズムの理解に貢献することが期待されています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。