バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。

Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。

以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。

💻 bioinformatics

A structured study of cross-condition prediction of transcriptional responses to gene perturbations

本論文は、LLM由来の遺伝子埋め込みと標的条件のトランスクリプトームプロファイルを利用することで、既知および未知の両方の生物学的条件における遺伝子摂動に対する転写応答を競争力のある精度で予測する、軽量なエンコーダー・デコーダーフレームワークであるTranScouterを導入するものである。

Zhu, O., Li, J.2026-08-05
💻 bioinformatics

Semi-automated annotation refinement accelerates cell type identification in brain spatial and single-cell studies

本論文は、要約統計量とユーザー定義のハイパーパラメータを用いることで、迅速かつプライバシーを保護したラベル転送を可能にし、透明性の高い半自動的なアノテーションレポートを生成することにより、シングルセルおよび空間トランスクリプトミクス研究における細胞型同定を加速させるスケーラブルなRパッケージであるSAHAを紹介するものである。

Acri, D. J., Mustaklem, R., Horan-Portelance, L., Dabin, L. C. J., Park, J. H., Hartigan, K. A., Kersey, H. N., Mesecar (…)2026-08-04
💻 bioinformatics

BWR-finder: BWT-based de novo interspersed repeat detection for gigantic genomes

著者らは、既存のツールと比較して高い感度を維持しつつ、速度とメモリ使用量の面で改善された、並列化されたBWTベースのシード・アンド・エクステンド・アルゴリズムを利用して、巨大なゲノム(10 Gb超)における分散反復配列を効率的に検出する、新規のデータベースフリーなソフトウェアツールであるBWR-finderを提示している。

Takeda, A., Fukunaga, T., Hamada, M.2026-08-04
💻 bioinformatics

crispAIPE: Probabilistic Modelling of Prime Editing Variant Correction Efficiency

crispAIPEは、ディリクレ尤度と分割共形較正を用いた単体上の競合する編集イベントをモデリングすることにより、プライム編集の結果における不確実性を定量化し、変異修復効率の信頼性の高い予測と細胞種を超えた汎用的な設計フィルタリングを可能にする、トランスフォーマーベースの確率的フレームワークである。

Ozden, F., Lu, P., Minary, P.2026-08-03
💻 bioinformatics

RKMR: A Rapid Kernel Machine Regression Framework for Optimal Marker Detection in Spatial Omics Data

RKMRは、非線形カーネルモデリング、スパイク・アンド・スラブ変数選択、および空間依存性を統合することで、高次元空間オミクスデータから堅牢で予測的なマーカーパネルを特定する、スケーラブルで不確実性を考慮したフレームワークであり、精度と解釈性の両面において既存の手法を凌駕する。

Seal, S., Chakraborty, A., Mattila, C., Rubinstein, M., Angel, P., Ghosh, D., Chung, D., Neelon, B.2026-08-03
💻 bioinformatics

PG-LLM: Benchmarking General-Purpose Language Models for Protein Variant Ranking

PG-LLMベンチマークは、汎用言語モデルが構造データや多重配列アライメントへのアクセスを欠いているにもかかわらず、タンパク質変異を効果的にランク付けし、多くの既存の配列ベースの予測器を凌駕できる一方で、依然として特化型の生体分子ツールには及ばないことを示している。

Arora, R. K., Chen, L. T., Du, M., Marks, D., Church, G.2026-08-03
💻 bioinformatics

What limits local ancestry inference at low divergence: a feasibility threshold, a metric that conceals failure, and a deficit of input more than architecture

本研究は、低遺伝的分化における局所的祖先推定が、モデルのアーキテクチャではなく、実現可能性の閾値と既存のリファレンスデータの不十分さによって根本的に制約されていることを明らかにしており、サイトごとの精度指標が深刻な構造的失敗を覆い隠していること、および、より豊かなハプロタイプ情報を提供することがアーキテクチャの革新よりも大きな性能向上をもたらすことを示している。

Tian, Q.2026-08-03
💻 bioinformatics

Discovery of a buried charge-network GFP-fold family spanning prokaryotes and eukaryotes (Draft manuscript)

本研究は、プロカリオートからユーカリオートにわたって進化的に保存された、標準的な蛍光発色団を、2つのアルギニン、2つのグルタミン酸、および1つのチロシンからなる高度に拘束された埋没した電荷ネットワークへと置き換えた、GFPフォールドを持つ新しく発見されたタンパク質ファミリーを明らかにするものであり、このモチーフは、無関係なDUF2490ファミリーにも収斂進化によって見出されている。

Zimmer, M., Schneider, T. L.2026-08-02
💻 bioinformatics

MassGAT: a graph-based collective learning approach for untargeted detection and annotation of LC-MS data

MassGATは、イオン種をグラフとしてモデル化し、グラフ・アテンション・ネットワークを利用することで、既存の独立した処理パイプラインを凌駕する、LC-HRMSデータのためのピーク検出とアノテーションを統合したオープンソースのグラフベースの集合学習手法である。

Pinart, P.-H., Damont, A., Dechaumet, S., Thevenot, E.2026-08-02