CodonMamba: a foundation model for programmable mRNA coding sequence design
CodonMambaは、大規模なコーパスでの事前学習を通じて予測タスクにおいて優れた性能を達成し、再学習を行うことなく、特定の宿主や用途の好みに合わせたコドンの最適化をプログラム可能かつ推論時に制御することを可能にする、mRNAコーディング配列設計のための最先端の基盤モデルである。
1012 件の論文
バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。
Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。
以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。
CodonMambaは、大規模なコーパスでの事前学習を通じて予測タスクにおいて優れた性能を達成し、再学習を行うことなく、特定の宿主や用途の好みに合わせたコドンの最適化をプログラム可能かつ推論時に制御することを可能にする、mRNAコーディング配列設計のための最先端の基盤モデルである。
本論文は、不均質なデータからのベイズネットワーク構造学習の堅牢性、解釈可能性、および統計的較正を向上させるために、解像度を考慮した較正済み最小不確実性基準および識別能評価フレームワークを導入するものである。
Delta-Marchesは、腎細胞癌のグレーディングや大腸の異形成において実証されているように、組織クラス間の理想化された形態学的転移をシミュレートすることで、病態生理学的変化を駆動する細胞内小器官の特徴を特定し、疾患メカニズムを解読する生成AIフレームワークである。
KRAKENは、標準化されたセマンティクス、組み込みの解析ツール、そして人間とAIによる研究の両方のためのマルチモーダルなインターフェースを備えた、1,500万ノードのモジュール式システムを通じて、多様な生物医学的ソースを統合することにより、マルチオミクスおよびウェルネスデータの過小評価に対処する、スケーラブルでプロベナンス(由来)追跡可能なナレッジグラフである。
本研究は、明示的なPfamドメイン含有量が、生合成遺伝子クラスターの検索においてESM-2の配列由来表現を上回るか、あるいは同等の性能を示すことを実証しており、これは配列埋め込みが、既存のドメインベースの指標を超えて代替的な生合成経路の回収を現時点では改善できていないことを示唆している。
本論文は、タンパク質配列のみから近接性を誘導し標的タンパク質分解を促進するマクロ環状分子接着剤のデノボ設計を可能にするディープラーニングフレームワークであるEvoBind-multimerを紹介するとともに、これらの接着剤の機能的結果が異なる患者由来モデル間で文脈依存的に変化し得ることを明らかにしている。
本論文は、現在の最先端の酵素機能予測モデルが系統発生学的なショートカットに大きく依存しており、触媒能を失った変異体と機能的な酵素を区別できていないことを示すために、構造的に破壊された酵素デコイの新しいベンチマークデータセットであるEnzymARCを導入し、それによってモデルの学習および評価における構造を考慮した負例の極めて重要な必要性を浮き彫りにしている。
本論文は、インフルエンザ変異株の割り当ておよび増殖率推定手法のベンチマーク用として、遺伝子配列を宿主による選択下での抗原表現型へと結びつけ、グラウンドトゥルース・データ(正解データ)を生成する前方時間エピデミックシミュレータであるantigen-primeを紹介し、それらの手法の正確性と特有の失敗モードの両方を明らかにしている。
本研究は、標準的な次数に基づく遺伝子優先順位付けが、生物学的プロセスを調整するために不可欠な非ハブ・コネクター遺伝子を系統的に見落としていることを明らかにし、機能注釈やコミュニティ検出に依存することなく、これらの見落とされた遺伝子を正常に回収することに成功した、分割フリーの情報理論的中心性尺度であるEDVSを提案するものである。
SVlogは、ゲノムデータをリレーショナルな事実へと変換し、構成可能な論理規則を適用することで、臨床疾患のキュレーションに向けた構造変異の高速かつ決定論的で説明可能な解析、アノテーション、および優先順位付けを可能にする、Souffle上に構築された透明性の高い宣言型論理プログラミングフレームワークである。