バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。

Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。

以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。

💻 bioinformatics

Predicting optimal growth temperatures of bacteria using learned structural information from a single protein

本論文は、遍在的なタンパク質であるアデニル酸キナーゼからMSA Transformer由来の構造的シグネチャーを活用することで、細菌の最適生育温度を正確に予測し、多様な環境における堅牢で系統発生的に汎用可能なコミュニティレベルの熱推論を可能にする新しいフレームワークであるROSEATEを紹介するものである。

Hoffert, M., Myerscough, D., Dragone, N. B., Gebert, M. J., Silberg, J. J., Fierer, N.2026-06-18
💻 bioinformatics

MetaHarmonizer: robust biomedical metadata harmonization and a contamination control for inflated LLM performance on public benchmarks

MetaHarmonizerは、ハルシネーションやベンチマーク性能の過大評価を防ぐために、制御された語彙集とマルチステージのカスケードを組み合わせた、堅牢で完全ローカルかつ決定論的なバイオメディカル・メタデータ・ハーモナイゼーションのための自動化システムであり、スキーマおよびオントロジーのマッピングにおいて最先端の精度を実現すると同時に、原理に基づいたヒューマン・イン・ザ・ループによるトリアージを可能にする。

Li, C., Dahl, A., Gravel-Pucillo, K. D., Long, K., Waters, M., de Bruijin, I., Davis, S., Oh, S.2026-06-17
💻 bioinformatics

VLab4Mic: prediction of structural resolvability in super-resolution microscopy

VLab4Micは、プローブの配置と立体障害をモデル化することにより、様々な超解像顕微鏡モダリティにおけるタンパク質複合体の構造分解能を予測するシミュレーションプラットフォームであり、それによって研究者が物理的な実験を行う前に実験の実現可能性を評価することを可能にします。

Martinez, D., Saraiva, B. M., Shakespeare, T., Bates, M., Owen, D. M., Leterrier, C., Del Rosario, M., Henriques, R.2026-06-16
💻 bioinformatics

THEOBROMA: an aggregated open database of 1.13 million natural products with per-compound license auditing, three-tier classification, and stereochemistry-aware deduplication

THEOBROMAは、29のソースから113万件以上の天然物を集約したオープンデータベースであり、ライセンスに準拠したバーチャルスクリーニングと異性体特異的な生物活性解析を可能にするため、化合物ごとのライセンス監査、3段階の分類システム、および立体化学を考慮した重複排除を通じて差別化を図っています。

Klamt, T., Jaczkowski, A., Franke, J., Nejdl, W.2026-06-16
💻 bioinformatics

Rapid and consistent clustering of millions of genomes highlights the diversity of prokaryotic life

著者らは、560万件以上の細菌ゲノムを約14時間で92,954の種レベルのゲノム的凝集単位へとクラスタリングする、極めてスケーラブルかつ効率的なツールであるgemsparclを提示しており、それによって計算上のボトルネックを克服し、プロカリオート(原核生物)の多様性と分類学に関する包括的かつリファレンスフリーな解析を可能にしている。

von Wachsmann, J. H., Lorenz, L. J., Gurbich, T. A., Russell, M. J., Rodriguez Bouza, V., Horsfield, S. T., Lees, J. A. (…)2026-06-15
💻 bioinformatics

Biological meaning in protein embedding space is resolution-dependent

本研究は、タンパク質言語モデルの埋め込み表現における生物学的意味合いは固定されたものではなく解像度に依存するものであることを示しており、生物学的階層への整列レベルの違いによって、メンバーシップの境界、機能的なグルーピング、あるいは局所的なファミリー構造といった異なる組織的関係性が選択的に保持される。

Zong, L., Ren, J., Li, Y., Finn, R. D., Wang, J.2026-06-15
💻 bioinformatics

WitChi: Efficient Detection and Pruning of Compositional Bias in Phylogenomic Alignments Using Empirical Chi-Squared Testing

WitChiは、経験的なカイ二乗検定を用いて大規模な系統ゲノムアライメントから組成バイアスのあるサイトを検出および反復的に除去することで、複雑な組成考慮モデルの高い計算コストをかけることなく、正確な系統樹のトポロジーを復元する計算効率の高いツールである。

Koestlbacher, S., Panagiotou, K., Tamarit, D., Ettema, T.2026-06-13
💻 bioinformatics

Testing the reliability of AI-generated protein structures

本研究は、AlphaFold2およびColabFoldが非タンパク質配列の構造予測において非常に低い偽陽性率を示すことを実証すると同時に、ヒトゲノムの非コード領域における一部の高スコアな予測が、これまで注釈付けされていなかった偽遺伝子に対応していることを偶然にも明らかにしており、これは既存の遺伝子注釈における潜在的な誤りを示唆するとともに、さらなる調査に向けた高スコアな構造予測の有用性を検証するものである。

Xu, A., Salzberg, S.2026-06-13
💻 bioinformatics

ADMETron: An AI-driven SaaS platform for comprehensive ADMET prediction and compound prioritisation

ADMETronは、RNN由来の分子埋め込みと勾配ブースティング決定木を統合して34種類のADMETエンドポイントを予測し、インタラクティブなレーダーグラフ可視化ツールを備えることで、創薬における包括的なハイスループットの化合物優先順位付けとデータ駆動型の意思決定を可能にするAI駆動型SaaSプラットフォームである。

Nair, D. N., Yadav, R. S., Jondhale, P. M., Didhate, S., Gunjal, G., Ranjit, A., Patil, P., Dawande, A., Shisode, A., Bh (…)2026-06-13