Reconstructing sequence-grammar trajectories enables interpretable and tunable cis-regulatory element design
本論文は、ハイブリッドなTransformer-Mamba2モデルと強化学習およびシーケンス文法による軌跡再構成を組み合わせた解釈可能なディープラーニングフレームワークであるGO-CREを提示し、活性と特異性を高めた多様かつ細胞型特異的なシス調節エレメントを設計し、実験的に検証するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あらゆる細胞の中には、生命がどのように機能するかを規定する膨大な指示書のライブラリが存在しますが、このライブラリの中で最も重要な部分は遺伝子そのものではありません。むしろ、細胞の生命活動の真の指揮者は、「シス調節エレメント」として知られる、短くスイッチのような役割を果たすDNAの断片です。これらの断片は調光器やオン・オフボタンとして機能し、特定の遺伝子に対して、いつオンにするか、どの程度の強さで歌わせるか、そしてどの種類の細胞で動作させるかを指示します。これらがなければ、肝細胞は毒素を濾過する方法を知ることはできず、血球は酸素を運ぶ方法を知ることもできません。数十年にわたり、科学者たちはこれらのスイッチを「読み取る」ことはできましたが、治療や研究のために細胞を制御するための新しいスイッチをゼロから設計することは、極めて困難な課題であり続けてきました。それは、文法が目に見えず、言葉が置かれた場所によってルールが変わってしまうような、新しい言語を書き上げようとする試みに似ています。
研究チームは今回、これらの遺伝子スイッチを設計するための新しい手法を開発し、かつてはブラックボックスであったプロセスを、透明で制御可能な旅へと変貌させました。DNA配列が設計される過程で、それらがどのように進化していくかを観察するシステムを構築することで、彼らは生命の「文法」がいかにして立ち現れるのかを正確に把握することができたのです。このアプローチにより、特定のヒト細胞型において高い精度で作動する合成スイッチを作成することが可能となり、私たちの健康を制御する遺伝子回路を設計するための、より明確な道筋が開かれました。
ミンチャン・マ(Mingqian Ma)氏らを中心とする研究チームは、「GO-CRE」と呼ばれるフレームワークを構築しました。これは「シス調節エレメントの誘導的最適化(Guided Optimization of Cis-Regulatory Elements)」の略称です。その仕組みを理解するために、特定の細胞型に望ましい反応を引き起こす文章を書こうとしているコンピュータプログラムを想像してみてください。かつて、科学者たちは人工知能に何千ものDNA配列を生成させ、テストを行い、その中で最良のものが機能することを祈るしかありませんでした。これはしばしば試行錯誤のプロセスとなり、コンピュータは、テストを欺くための単純で反復的なパターンを用いて、偶然にも機能する解を見つけ出すことがありました。しかし、これは生物学を真に理解したわけではありません。新しいシステムは、設計プロセスを「ゴールを目指すレース」としてではなく、「旅の地図」として扱うことで、この状況を変えました。
彼らの手法の核となるのは、「HybriDNA」と呼ばれる強力なコンピュータモデルです。このモデルは、数百種もの生物から集められた膨大なDNAコレクションに基づいて学習されており、遺伝情報がどのように保存され、読み取られるかを支配する微細なパターンを習得しています。研究者たちはこのモデルを用いて新しいDNA配列を生成しましたが、それで終わりではありませんでした。彼らは、コンピュータが配列を改善しようとする際に、その一歩一歩の変更を追跡する「観察の層」を追加しました。彼らはこれらの変化を極めて小さな構成要素へと分解し、特定の文字の組み合わせの頻度や、既知の生物学的タグの存在が時間の経過とともにどのように変化するかを調査しました。これにより、ランダムなDNAの文字列から機能的なスイッチへと、配列が進化していく「軌跡」、すなわち「経路」を再構築することができたのです。
チームがこれらの経路が展開される様子を、HepG2として知られる肝細胞型で観察した際、予想外の発見がありました。配列が「罠」にはまっていたのです。コンピュータは、単一の文字(具体的にはGの連続)による長く反復的な領域を作り出すことで、近道を見つけ出していました。モデルはこれを優れた解決策であると誤認してしまったのです。これは、コンピュータのスコアリングシステムを満足させるものの、真に機能する生物学的スイッチにはなり得ない、質の低い回答でした。研究者たちは、これがリアルタイムで起きていることを察知できたため、介入することができました。彼らはゲームのルールを調整し、これらの反復的な文字列に対してペナルティを課しました。この単純な修正によって、コンピュータの経路は再誘導され、罠から回避され、より複雑で生物学的に意味のある解決策へと導かれました。
設計プロセスの途中で診断と修正を行うこの能力により、これらのスイッチの作成が、3つの明確なフェードを経て行われることが明らかになりました。まず、コンピュータは広範囲に探索を行い、多くの異なる組み合わせを試みます。次に、特定の方向へとコミットし、ターゲットとなる細胞型に特有の生物学的特徴へと固定されます。最後に、配列の核となるアイデンティティを維持しながら、結果を微調整して磨き上げます。肝細胞においては、システムは特定の調節タグのチームを精密な順序で組み立て、コンパクトで効率的なスイッチを作り上げました。一方、K562として知られる血球細胞においては、その環境に適した異なるタグのチームを組み立てました。
コンピュータが生成したこれらのスイッチが実際に機能することを証明するために、研究者たちはラボでテストを行いました。彼らは無害なウイルスを用いて、新しいDNA配列を生きた肝細胞と血球細胞に挿入しました。そして、これらの新しいスイッチが、光るレポーター遺伝子をどれほど上手くオンにするかを測定しました。その結果は驚くべきものでした。肝細胞用に設計されたスイッチは、肝細胞内では明るく光りましたが、血球細胞内では暗いままであり、その逆も同様でした。これは、コンピュータが細胞型特異的な指示を書き上げることに成功したことを裏付けています。さらに、新しい肝細胞用スイッチは、ヒトゲノムに見られる天然のスイッチよりも平均して活性が高く、コンピュータが遺伝コードを整理するためのより効率的な方法を見つけ出したことを示唆していました。
また、この研究は、すべての細胞型が等しく設計しやすいわけではないことも明らかにしました。システムは肝細胞や血球細胞においては見事に成功しましたが、神経細胞型の特定のスイッチを作成することには苦戦しました。このケースでは、コンピュータの経路は散漫なままとなり、明確なパターンに落ち着くことができませんでした。この失敗は、成功と同様に有益な情報となりました。つまり、システムは、その特定の細胞型に対して利用可能なデータの質と量に制限されているということです。コンピュータが細胞の文法を学ぶためには、研究するための豊かなライブラリが必要であり、十分なデータがなければ、設計プロセスは安定した経路を見つけ出すことができないということが示されました。
設計プロセスを可視化し、調整可能にすることで、この研究は科学者が遺伝子工学にアプローチする方法を変革します。単にラッキーな結果を期待するのではなく、配列が進化する様子を観察し、進路が外れた瞬間に察知し、生産的な経路へと導くことができるようになったのです。得られたスイッチは、単に偶然機能しているだけのランダムな配列ではありません。それらは、コンパクトで効率的、かつ高度に特異的な生物学的プログラムへと収束する、誘導された進化の産物なのです。このアプローチは、将来の治療に必要な精密な遺伝子制御を実現するための強力なツールを提供し、DNAを記述するという抽象的なタスクを、具体的で理解可能、かつ制御可能なプロセスへと変えています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。