バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。

Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。

以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。

💻 bioinformatics

PanGBank: a large-scale resource of precomputed microbial pangenomes built with PPanGGOLiN

PanGBankは、PPanGGOLiNを用いて4,600種を超えるプロカリオティックな種の事前計算済みパンゲノムを提供する包括的なオープンアクセスのデータベースであり、大規模な比較ゲノミクスや微生物の進化と適応の研究を促進するために、標準化されたグラフベースのリソースと複数のアクセスツールを提供しています。

Mainguy, J., Lemane, T., Bazin, A., Arnoux, J., Gautreau, G., Medigue, C., Calteau, A., Vallenet, D.2026-08-09
💻 bioinformatics

Move BeTween modAlities (MBTA) employs flow matching to predict single cell data modalities

本論文は、フローマッチングを利用してモダリティ固有の潜在空間を接続し、単一細胞データにおける構造的な不一致に対処することで、各分子モダリティの独自の構造的完全性を維持しながら正確なクロスモーダル変換を可能にする、新しいフレームワークであるMove BeTween modAlities (MBTA) を導入するものである。

Xu, B., Zhang, Y., Michor, F.2026-08-09
💻 bioinformatics

Scalable Extraction of Information on Protein-Protein Interactions using Topological Data Analysis

本論文は、既存の幾何学的ディープラーニング手法と比較して競争力のある精度を維持しつつ、表面パッチからタンパク質間相互作用インターフェースを予測するための計算コストを大幅に削減する、スケーラブルなトポロジカル・データ解析フレームワークを導入するものである。

Mukherjee, A., Park, B., Malmstrom, A., Cisewski-Kehe, J., Van Lehn, R. C., Zavala, V. M.2026-08-09
💻 bioinformatics

A map of human protein-protein interaction embeddings for functional discovery

本論文は、ヒトのタンパク質相互作用の二次元埋め込みマップを生成することで、個々の相互作用ペアの特定の機能的役割を予測する新しい手法であるMAPPIEを紹介しており、特に機能的知見が乏しいインタラクトームの領域において既存のベースラインを凌駕している。

Cihan, M., Distler, U., Andrade-Navarro, M. A.2026-08-09
💻 bioinformatics

A hierarchical orthology framework reveals viral carbohydrate-active genes across the global virosphere

本研究は、配列、構造、および機能データを統合することで、グローバルなバイロスフィアにおける、これまで過小評価されていた膨大なウイルス糖鎖活性酵素の多様性を明らかにし、それらの複雑な進化の起源とウイルス・宿主相互作用における重要な役割を解明する、階層的オーソロジー・フレームワークであるVirGenesを導入するものである。

Meng, L., Zhang, R., De Castro, C., Uchiyama, I., Kanehisa, M., Ogata, H.2026-08-07
💻 bioinformatics

Phylogeny-aided detection of contamination in nearly 5 million SARS-CoV-2 genomes

本研究は、約500万件のSARS-CoV-2ゲノムを解析して1万件以上のコンタミネーション事象を特定し、約6万5,000件の誤った置換をマスクすることで、病原体の進化および伝播に関するダウンストリーム解析の信頼性を向上させた、系統樹を用いた計算ツールであるPhyCDを紹介するものである。

Anoufa, O., Ly-Trong, N., Goldman, N., De Maio, N.2026-08-07
💻 bioinformatics

SLIM: A small linear model with STRING embeddings for single-cell genetic perturbation prediction

SLIMは、64次元のSTRINGネットワーク埋め込みと閉形式のリッジ回帰推定器を活用することで、遺伝的摂動に対する細胞応答を正確に予測する軽量かつ計算効率の高いモデルであり、最小限の学習パラメータでありながら、複雑なディープラーニングのベースラインをしばしば凌駕します。

Hu, D., Pielies Avelli, M., Jensen, L. J., Rasmussen, S.2026-08-07
💻 bioinformatics

From Abandoned Scripts to FAIR Community Pipelines: Rescuing Orphan Bioinformatics Workflows with nf-core - Lessons from Light-Sheet Fluorescence Microscopy

本論文は、放置されたMATLABベースのNuMorphツールキットのような孤立した科学ソフトウェアが、FAIR原則と現代的なソフトウェアエンジニアリング標準に基づいた体系的な再設計を適用することによって、nf-core/lsmquantのような持続可能で再利用可能なコミュニティワークフローへと、見事に救済・変革され得ることを実証している。

Schwitalla, C., Kuhn Cuellar, L., Hoertenhuber, M., Grote, N., Woller, T., Lamberti, I., Pavie, B., Kuestner, T., Kyere (…)2026-08-06
💻 bioinformatics

Benchmarking Twist Genotyping-by-Sequencing Against Whole-Genome Sequencing in Nuclear Families

本研究は、184の核家族に属する555名の個人を対象に、ジェノタイプの一致度およびメンデルの法則違反率を評価することにより、Twist Bioscience社のゲノムワイドSNPキャプチャ(GxS)プラットフォームを全ゲノムシーケンシングおよびIllumina社のGSA-24アレイと比較・ベンチマークし、この新興のターゲットシーケンシング技術に対する第三者による評価を提供することを目的としている。

Klugerman, J., Iossifov, I., Ye, K.2026-08-06
💻 bioinformatics

A Comprehensive Database of Simulations and Meshes of Coronary Arteries from the Fame 2 Trial

本論文は、データ駆動型モデリングおよび機械学習への応用における数値血行動態データの不足を解消することを目的として、FAME 2試験から再構成された779本の冠動脈に関する3次元非定常ナビエ・ストークス・シミュレーションと高品質な六面体メッシュを含む、公開利用可能なデータベースを提示するものである。

Marcinno', F., Hinz, J., Ando', E., Mahendiran, T., Buffa, A., Deparis, S.2026-08-05