バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。

Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。

以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。

💻 bioinformatics

TEDlm: domain-centric protein language models with optional structural pre-training

本論文は、構造的に定義されたドメインセグメントを用いて事前学習されたドメイン中心のタンパク質言語モデルであるTEDLMを紹介しており、これは、ドメイン固有の信号に焦点を当てることがコンパクトで構造的に情報に基づいた表現を生み出すことを示しながら、遠縁ホモロジー検出および分子機能予測において、より大規模な全配列モデルを凌駕するものである。

Wei, T., Kandathil, S. M., Buchan, D. W. A., Jones, D. T.2026-07-13
💻 bioinformatics

amR: an R package suite to predict antimicrobial resistance in bacterial pathogens

amR Rパッケージスイートは、マルチスケールなゲノム特徴抽出、機械学習モデルのトレーニング、およびインタラクティブな可視化を統合することで、種を越えた耐性および多剤耐性のメカニズムを解明し、細菌病原体における薬剤耐性を予測するための、包括的かつ解釈可能なフレームワークを提供する。

Ghosh, A., Brenner, E. P., Boyer, E. A., McKim, A. P., Vang, C. K., Wolfe, E. P., Mayer, D. A., Lesiyon, R. L., Ravi, J.2026-07-13
💻 bioinformatics

Capabilities, specificity gaps and training-data dependence of AlphaFold3 across diverse application areas

本論文は、AlphaFold3の多様な生体分子への応用における性能を評価しており、同モデルが強力な全原子モデリング能力を提供する一方で、その精度と信頼性は一様ではなく、学習セットとの重複に大きく依存するため、前身のモデルと比較して慎重な解釈を要することを明らかにしている。

Follonier, O., Liu, Y., Campomanes, P., Lafrenaye, L., Racle, J., Alvarez, D., van Gerwen, J., Heinzmann, R., Jänes, J. (…)2026-07-13
💻 bioinformatics

Genomic Annotation Infrastructure (GAIn): Pipelines and Resource Repositories for Annotating Variants, Positions, and Regions

Genomic Annotation Infrastructure (GAIn)は、宣言型パイプライン、公開リソースリポジトリ、およびカスタム拡張や自動再アノテーションをサポートする柔軟なウェブおよびコマンドラインインターフェースを通じて、透明、再現可能、かつスケーラブルなゲノム変異アノテーションを可能にするプラットフォームである。

Cokol, M., Chorbadjiev, L., Lee, Y.-h., Jamsandekar, M., Gergova, I., Todorov, I., Iossifov, I.2026-07-12
💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

本研究は、マルチモーダルタンパク質言語モデルESM3において、異なる物理的モダリティ(配列、構造、二次構造、および溶媒接近性)が、層25から35の間で共有された低次元表現へと融合する前に、最初は別々の部分空間を占有していること、ならびに機能注釈は全層を通じて直交性を維持し続けていること、そしてこの融合プロセスがタンパク質の長さに依存しない学習された普遍的な特性である一方で、構造的無秩序によって遅延されることを明らかにしている。

Steenwyk, J. L.2026-07-12
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

ProtBLIP2-SSTは、構造認識型言語モデルとQ-Formerプロジェクターを介してタンパク質の配列情報と3D構造情報を統合することで、大規模言語モデルが柔軟でオープンエンドな機能キャプションを生成することを可能にし、従来の硬直的な遺伝子オントロジー分類の限界を克服する新しい2段階フレームワークである。

Chen, Z., Luo, Q.2026-07-12
💻 bioinformatics

EcoMorph: Universal morphological trait quantification from natural language prompts for ecological research

EcoMorphは、プロンプトベースのSegment Anything Model 3(SAM3)を活用することで、分類群ごとの学習を必要とせずに、多様な生態学的文脈における面積、サイズ、個体数といった形態学的形質を正確に定量化し、それによって異種混合な画像ソースからの高スループットな生態学研究を可能にするモジュール式システムである。

Amoah, E. I., Bunch, Z., Thomas, H. M., Patch, H. M., Grozinger, C.2026-07-12
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

本論文は、連続的な単一細胞トランスクリプトーム・プロファイルを、事前学習済みの大規模言語モデルと互換性のある離散的なシーケンスへとトークン化する新しい手法であるCellTokを紹介しており、それによって、細胞データ、生物学的コンテキスト、およびテキストによる指示を共同で処理して、細胞識別、疾患推論、状態生成といった多様なタスクを実行するための統一されたフレームワークを可能にしている。

Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.2026-07-11
💻 bioinformatics

scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data

本論文は、シングルセルトランスクリプトミクスデータにおける複雑または誤解を招く細胞型アノテーションを体系的に検出するために設計されたオープンソースのRパッケージであるscDiagnosticsを紹介しており、それによって、ダウンストリームの解釈の信頼性を確保し、現在の解析ワークフローにおける決定的な欠落を解消する。

Christidis, A., Ghazi, A. R., Chawla, S., Turaga, N., Gentleman, R., Geistlinger, L.2026-07-11
💻 bioinformatics

onsite: An Integrated Framework for Phosphosite Localization and False Localization Rate Estimation

本論文は、複数のリン酸化部位局在化アルゴリズムにわたる偽局在化率(false localization rate)推定の標準化を実現するためにアラニンデコイ戦略を統合したオープンソースのPythonフレームワークである**onsite**を紹介し、大規模な質量分析データセットにおける優れたスケーラビリティと精度を実証する。

Yue, Q.-X., Wei, Z., Dai, C., Bai, M., Perez-Riverol, Y., Sachsenberg, T.2026-07-11