ML4SD: Leveraging Machine Learning and High-Throughput Search Algorithms for an Iterative Growth-Coupled Design Innovation
本論文は、機械学習と新規の高スループット・アルゴリズム(gcSwarms)を統合することで、成長結合型微生物株のデザインを効率的に特定し、従来の探索手法よりもはるかに少ない実験回数で大幅に高い炭素収率を達成する、能動学習型のDesign-Build-Test-LearnサイクルであるML4SDを導入している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
循環型経済の構築に向けた競争の中で、科学者たちは、現在私たちの世界を動かしている石油ベースのプロセスに代わるものとして、廃棄物を価値ある化学物質へと変えるよう微生物に教え込もうとしています。廃棄された植物質や工業副産物を消費し、プラスチック、燃料、あるいは医薬品を吐き出す小さな作業員としての細菌が働く工場フロアを想像してみてください。課題は、これらの微小な作業員が、人間のために特定の製品を作ることにエネルギーを費やすよりも、自然に成長と分裂を優先してしまうことです。これを解決するために、エンジニアは細菌の内部代謝を再配線し、目的の製品を作ることが生物自身の生存にとって不可лоessential(不可欠)となるようにしようとしています。もし細菌がその化学物質の生産を停止すれば、成長も停止します。この「成長結合型」の戦略は、微生物に仕事を強制するものですが、適切な遺伝子のスイッチを見つけ出すことは、数十億もの可能性という干し草の山の中から一本の針を探すようなものです。従来の手法は、一度に一つの遺伝的変化をテストするものであり、遅くて高価なプロセスであり、結果が得られることも少ないのが現状です。
研究チームは現在、この探索を劇的に加速させるために、コンピュータモデリングと機械学習を組み合わせた新しいアプローチを開発しました。彼らは、設計された細菌のスマートなガイドとして機能するML4SDと呼ばれるシステムを作り上げました。数千の遺伝的組み合わせを盲目的にテストする代わりに、このシステムは細菌の代謝のデジタルツインを使用して、異なる遺伝的な切断が成長と生産にどのように影響するかをシミュレートします。そして、機械学習を用いてこれらのシミュレーションから学習し、成功につながるパターンを特定します。研究者たちは、この学習が機能するためには、シミュレートされた設計の初期プールが膨大かつ多様であり、失敗したものや性能の低いものも多く含まれていなければならないことを発見しました。もしプールに「最良の」設計しか含まれていないと、コンピュータモデルは混乱し、新しい状況に一般化することができなくなります。多様なデータを用いて訓練することで、システムはどの遺伝的変化が最も効果的かを予測することを学び、事実上、探索空間を絞り込むことができました。
この手法をテストするために、チームは特定かつ困難な課題に焦 میلしました。それは、植物廃棄物由来のリグニンから得られる化合物である4-ヒドロキシ安息香酸を、ナイロン6のビルディングブロックである6-カプロラクタムへと変えることです。これは、化学経路が複雑であり、かつ細菌であるPseudomonas putidaが自然にはこのタスクを効率的に実行できないため、非常に難しい変換です。研究者たちはまず、既存のアルゴリズムを使用して潜在的な遺伝的設計のリストを生成しようと試みましたが、それが小さく反復的な選択肢のリストを生成してしまい、機械学習モデルが効果的に学習できないことが判明しました。モデルは過学習(オーバーフィッティング)を起こしました。つまり、与えられたわずかな例を暗記してしまいましたが、新しい未知のデザインに対して予測を行うことができなかったのです。
これを解決するために、チームはgcSwarmsと呼ばれる新しい探索アルゴリズムを構築しました。以前の手法とは異なり、このアルゴリズムは設計空間をより広く探索し、一度の実行で5万件以上のユニークな遺伝的設計を含む大規模なライブラリを生成しました。これには完璧ではない設計も多く含まれており、機械学習システムが代謝の根本的なルールを学習するために必要な、豊かで多様なデータを提供しました。この多様なライブラリをML4SDシステムに投入したところ、結果は驚くべきものでした。システムは、最初の探索だけで見つかった最良のデザインと比較して、プロセスの炭素収率を最大164パーセント向上させる遺伝子欠損のセットを特定することに成功しました。
このアプローチの強みはその効率性にあります。これらの高性能な設計を見つけ出すために、ML4SDシステムは4,500件未満の設計を探索しました。対照的に、従来の探索アルゴリズムは、同等のレベルの性能に達するために1万件から3万件の設計を検討する必要がありました。これは、新しい手法が2倍から7倍少ない計算量で同じ結果を達成したことを意味します。さらに、システムは、最良のデザインに一貫して現れる、最小限の3つの遺伝的変化という特定のセットを特定することができました。これらの変化は細胞内のエネルギーの流れを効果的に転換し、細胞がナイロン前駆体を作るために資源を注ぎ込むよう強制しました。
研究者たちは、これらの知見は現在シミュレーション段階であり、手法の概念実証(プルーフ・オブ・コンセプト)であることを強調しています。次のステップは、実際の細菌をラボで構築し、コンピュータが予測した通りに機能するかどうかをテストすることです。もし成功すれば、このアプローチは持続可能なバイオ製造の開発を大幅に加速させ、現在の方法よりもはるかに少ない時間とリソースで、廃棄物ストリームを価値ある材料へと変えることができるでしょう。失敗と成功の両方の試みから機械に学習させる方法を編み出すことで、研究者たちは複雑な代謝工学の景観をナビゲートするためのロードマップを作成し、より循環型で持続可能な産業の未来への実用的な道筋を提示しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。