バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。

Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。

以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。

💻 bioinformatics

crispAIPE: Probabilistic Modelling of Prime Editing Variant Correction Efficiency

crispAIPEは、ディリクレ尤度と分割共形較正を用いた単体上の競合する編集イベントをモデリングすることにより、プライム編集の結果における不確実性を定量化し、変異修復効率の信頼性の高い予測と細胞種を超えた汎用的な設計フィルタリングを可能にする、トランスフォーマーベースの確率的フレームワークである。

Ozden, F., Lu, P., Minary, P.2026-08-03
💻 bioinformatics

RKMR: A Rapid Kernel Machine Regression Framework for Optimal Marker Detection in Spatial Omics Data

RKMRは、非線形カーネルモデリング、スパイク・アンド・スラブ変数選択、および空間依存性を統合することで、高次元空間オミクスデータから堅牢で予測的なマーカーパネルを特定する、スケーラブルで不確実性を考慮したフレームワークであり、精度と解釈性の両面において既存の手法を凌駕する。

Seal, S., Chakraborty, A., Mattila, C., Rubinstein, M., Angel, P., Ghosh, D., Chung, D., Neelon, B.2026-08-03
💻 bioinformatics

PG-LLM: Benchmarking General-Purpose Language Models for Protein Variant Ranking

PG-LLMベンチマークは、汎用言語モデルが構造データや多重配列アライメントへのアクセスを欠いているにもかかわらず、タンパク質変異を効果的にランク付けし、多くの既存の配列ベースの予測器を凌駕できる一方で、依然として特化型の生体分子ツールには及ばないことを示している。

Arora, R. K., Chen, L. T., Du, M., Marks, D., Church, G.2026-08-03
💻 bioinformatics

What limits local ancestry inference at low divergence: a feasibility threshold, a metric that conceals failure, and a deficit of input more than architecture

本研究は、低遺伝的分化における局所的祖先推定が、モデルのアーキテクチャではなく、実現可能性の閾値と既存のリファレンスデータの不十分さによって根本的に制約されていることを明らかにしており、サイトごとの精度指標が深刻な構造的失敗を覆い隠していること、および、より豊かなハプロタイプ情報を提供することがアーキテクチャの革新よりも大きな性能向上をもたらすことを示している。

Tian, Q.2026-08-03
💻 bioinformatics

Discovery of a buried charge-network GFP-fold family spanning prokaryotes and eukaryotes (Draft manuscript)

本研究は、プロカリオートからユーカリオートにわたって進化的に保存された、標準的な蛍光発色団を、2つのアルギニン、2つのグルタミン酸、および1つのチロシンからなる高度に拘束された埋没した電荷ネットワークへと置き換えた、GFPフォールドを持つ新しく発見されたタンパク質ファミリーを明らかにするものであり、このモチーフは、無関係なDUF2490ファミリーにも収斂進化によって見出されている。

Zimmer, M., Schneider, T. L.2026-08-02
💻 bioinformatics

MassGAT: a graph-based collective learning approach for untargeted detection and annotation of LC-MS data

MassGATは、イオン種をグラフとしてモデル化し、グラフ・アテンション・ネットワークを利用することで、既存の独立した処理パイプラインを凌駕する、LC-HRMSデータのためのピーク検出とアノテーションを統合したオープンソースのグラフベースの集合学習手法である。

Pinart, P.-H., Damont, A., Dechaumet, S., Thevenot, E.2026-08-02
💻 bioinformatics

Elucidating enzyme-substrate specificity through co-folding foundation model

本論文は、ネイティブな共折り畳み(co-folding)を通じて酵素-基質相互作用を予測するために生体分子基盤モデルを活用するエンドツーエンドのフレームワークであるBoltz2ESIを紹介しており、これにより活性部位の可塑性を捉え、既存の手法を凌駕することで、バイオカタリストの発見および経路解明を加速させるものである。

Cheng, X., Seo, S., Huh, C., Chen, J., Jiang, S., Guo, P., Weng, J.-K., Kim, W. Y., Jin, W.2026-08-02
💻 bioinformatics

DPCGS: a computational framework for linking GWAS to single-cell transcriptomics in complex traits and diseases

DPCGSは、GWASの要約統計量と単一細胞RNAシーケンシングデータを統合することで、遺伝的リスクを特定の細胞サブポピュレーションや制御プログラムへと高解像度でマッピングすることを実現し、既存の手法を上回る精度を示しつつ、アルツハイマー病や喘息といった複雑な疾患の細胞メカニズムに関する新たな知見を提供する、新しい計算フレームワークである。

Liu, C., Yuan, B., Shen, B., Li, J., Zhu, R., Yang, P., Wu, B., Xuan, Y., Yang, S., Yang, N., Ma, L., Liu, Q., Dai, S. (…)2026-07-31