stMCP: Spatial Transcriptomics with a Model Context Protocol Server
本論文は、大規模言語モデルへのデータ送信を不要とし、プライバシーとコストを削減しながら自然言語による空間トランスクリプトミクス解析を可能にする「stMCP」という新しいフレームワークを提案し、研究者のデータ探索と仮説検証を加速する AI ネイティブな研究基盤の確立を目指しています。
1014 件の論文
バイオインフォマティクスは、膨大な生物学的データをコンピュータの力で解析し、生命の謎を解き明かす分野です。ゲノム情報やタンパク質の構造といった複雑なデータから、新たな発見を引き出すための重要な橋渡し役となっています。
Gist.Science では、bioRxiv から公開される最新のプレプリントをすべて対象に、この分野の論文を網羅的に扱っています。専門的な詳細な要約に加え、難しい専門用語を避け、誰でも理解できる平易な日本語での解説も併せて提供しています。
以下に、bioRxiv から更新されたばかりのバイオインフォマティクスに関する最新論文の一覧を掲載します。
本論文は、大規模言語モデルへのデータ送信を不要とし、プライバシーとコストを削減しながら自然言語による空間トランスクリプトミクス解析を可能にする「stMCP」という新しいフレームワークを提案し、研究者のデータ探索と仮説検証を加速する AI ネイティブな研究基盤の確立を目指しています。
10x Genomics Xenium 技術においてプローブのオフターゲット結合が遺伝子発現プロファイルの精度を損なう可能性を明らかにし、新規解析ツール「OPT」を開発してその影響を検証・評価する手法を提案することで、空間トランスクリプトミクスデータの生物学的解釈性と再現性を向上させることを目的とした研究です。
この論文は、最新の深層学習を用いた RNA 構造予測手法が既知の構造や規則的な二次構造を持つ RNA では一定の精度を示すものの、新規な折りたたみ構造への汎化能力やモデルの精度評価の信頼性に限界があることを、独立したベンチマークを通じて明らかにしたものである。
本論文では、タンパク質構造の全体的な最適化ではなく重なり合う残基サブ構造を個別に最適化することで計算時間を線形に削減し、GFN-FF 力場を用いた「PROPTIMUS RAPHAN」法を開発し、AlphaFold DB の 461 構造におけるα炭素拘束法と同等の精度を大幅に短時間で達成できることを実証しました。
この論文は、10x Genomics 技術で生成された大規模な単一細胞 RNA シーケンシングデータを、再現性とスケーラビリティを確保しつつ、Snakemake パイプライン「scprocess」を用いて統合的に処理・可視化するための包括的なソリューションを提案しています。
本研究は、発現ベースのアノテーション戦略を開発することで、ヒト細胞における小バールト RNA(svtRNA)の体系的な同定と定量化を可能にし、これらがマイクロ RNA と同等の豊富さを持つ重要な小 RNA 成分であることを示しました。
本研究は、GBIF の画像から AI 支援 segmentation とオントロジーに基づく構造化データ収集を可能にするブラウザ型クラウドソーシングプラットフォーム「Descriptron-GBIF Annotator」を開発し、市民科学と専門家による AI 学習データの相互強化を通じて、形態に基づく生物多様性データの生成を加速させることを提案しています。
この論文は、短鎖および長鎖リードのシーケンスデータからがんにおけるエクストラクロモソーム DNA(ecDNA)の構造を高速かつ高精度に再構築する新しいツール「Cycle-Extractor」を開発し、既存手法と比較して大幅な高速化と、特に長鎖リードを用いた場合のより完全な構造解明の実現を報告しています。
この論文は、右側打ち切り生存データに対して多様な学習器を統合し、比較・アンサンブル構築・解釈を可能にする包括的な R パッケージ「SuperSurv」を提案し、その有効性を METABRIC 乳がんデータセットを用いて実証したものである。
この論文は、合成 DNA のデータ保存において、合成・増幅・シーケンシングに伴うノイズや欠落を克服し、既存のコーデックを上回る信頼性と資源効率を実現する新しいコーデック「DNA-MGC+」を提案し、Illumina および Nanopore 両方のシーケンシング技術を用いた広範な評価でその優位性を実証したものである。