Prediction of protein-carbohydrate binding sites from protein primary sequence
本研究は、従来の配列特徴量と学習済みタンパク質言語モデルの埋め込みを組み合わせることで、一次配列から直接、残基レベルでのタンパク質-炭水化物結合部位を正確に予測する新しいアンサンブル機械学習モデルであるStackCBEmbedを導入するものである。
1018 件の論文
バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。
Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。
以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。
本研究は、従来の配列特徴量と学習済みタンパク質言語モデルの埋め込みを組み合わせることで、一次配列から直接、残基レベルでのタンパク質-炭水化物結合部位を正確に予測する新しいアンサンブル機械学習モデルであるStackCBEmbedを導入するものである。
本論文は、単一の組織検体内における質量分析由来の測定値に焦点を当て、多様な空間マルチオミクスデータのエンドツーエンドの解析と統合を容易にするために設計されたRパッケージであるspammRを紹介するものである。
本研究は、CANDOプラットフォームによるマルチターゲット創薬再開発アプローチが、化合物とプロテオームの相互作用シグネチャーを解析することにより、神経伝達物質系およびカルシウムシグナル伝達経路に関わる既知および潜在的な新メカニズムの両方を明らかにし、統合失調症に対する新規の治療候補を特定し検証することに成功したことを示している。
本論文は、広く用いられている総和ペア(sum-of-pairs)スコアが最も正確な多重配列アライメントを特定できないことが多いことを示し、代替アライメントを効果的にランク付けして下流の系統再構築を改善する、深層学習ベースのスコアリングフレームワーク、具体的にはモデル2を提案するものである。
LongPolyASEは、シンテニックな遺伝子の同定、転写産物の定量化、および発現変動解析のための統合されたコンポーネントを通じて、ポリプロイド(倍数体)におけるアレル特異的な遺伝子およびアイソフォーム解析を可能にするために設計された、ロングリードRNA-seqデータを用いた包括的かつエンドツーエンドのフレームワークであり、これらの生物種に対する専門的なツールの欠如という現状に対処するものである。
本研究は、ポリA濃縮RNA-seqデータは高い偽陽性率と解析ツールの不一致により信頼できるcircRNA検出には不適であることを示し、正確なcircRNAプロファイリングには効果的なリボソームRNA除去を伴う全RNAシーケンシングが必須の標準であることを確立している。
RareCapsNetは、大規模な単一細胞RNA-seqデータにおいて希少な細胞集団とそのトランスクリプトーム・シグネチャーを堅牢に特定し、異なる実験バッチ間での知識転移を可能にしながら、最先端の手法を凌駕する説明可能なカプセルネットワーク・フレームワークである。
本論文は、タンパク質の主鎖を、キラル性と方位を保持しつつ4,096トークンの離散的な語彙へと変換する、SE(3)等変かつ幾何学的に完全なトカナイザーであるGCP-VQVAEを導入しており、従来の手法と比較して、最先端の再構成精度、堅牢なゼロショット汎化性能、および大幅に高速な推論速度を実現している。
本研究は、AlphaGenomeモデルが局所的な調節文法を捉えることでクロマチンアクセシビリティの変動を効果的に予測する一方で、個体間の差異に求められる長距離の調節統合のモデリングという課題により、遺伝子発現の変動予測においては著しく性能が低下することを明らかにしている。
MLMarkerは、健康な組織で学習させたランダムフォレストモデルを利用して、連続的な類似度スコアを算出し、希薄なバイオフルイド試料や転移腫瘍を含む複雑なプロテオミクスデータにおける組織の起源を特定する、解釈可能な機械学習フレームワークである。