✨ 要約🔬 技術概要
奇妙で変化し続けるフォントで印刷された本を読もうとしている場面を想像してみてください。さらに、数語ごとに、余白に秘密のコードが隠されています。これは、強力な新しい遺伝物質の読み取り方法に取り組んでいる科学者たちが直面している現実です。長年、研究者たちはDNAを小さく扱いやすい断片に切り刻んで読み取る機械に頼ってきましたが、新しい世代の技術は、一度に非常に長いDNA鎖を読み取ることができます。これらの長い鎖は、単なる一文ではなく、本の一章全体のようなものです。これにより、科学者は遺伝子がどのように修飾されているか、あるいは個々の細胞内でどのように振る舞っているかを含め、遺伝子の物語の全貌を見ることができるのです。しかし、これらの機械は非常に新しく、鎖も非常に長いため、生成されるデータはしばしば乱雑になります。機械は小さなミスを犯すことがあり、また、遺伝子の鎖には、コンピュータにデータをどのように分類するかを伝えるバーコードやアダプターのような追加の塩基配列が付加されています。鎖が数千文字の長さがあり、そこに複数のタグが含まれている場合、それらを目視で見つけ出すことは、特に機械が途中でいくつかのエラーを起こしている場合には、ほぼ不可能です。これらのタグを明確に把握できなければ、科学者はデータを適切に分類したり、研究している遺伝物質の構造を理解したりすることができません。
この問題を解決するために、研究者のChangqing Wang、Matthew E. Ritchie、そしてNadia M. Davidsonは、「seqsizzle」と呼ばれる新しいツールを作成しました。このツールを、科学者がデータを管理するために使用する端末画面専用に設計された、特殊な拡大鏡だと考えてください。コンピュータにタグが何かを推測させるのではなく、seqsizzleは人間が画面上で生の遺伝コードを直接見ることができるようにします。このツールは、探している特定の配列を強調表示しますが、たとえ機械がその読み取りにおいていくつかの小さなミスを犯していたとしても、それを可能にします。ユーザーは異なるタグに異なる色を割り当てることができるため、どこでバーコードが始まり、どこでアダプターが終わるのかを容易に識別でき、機械が躓いた箇所を特定することもできます。また、数千の鎖をスキャンして最も一般的な反復パターンを見つけることもできるため、事前に何をすべきか分からなかったとしても、どのようなタグが存在するかを発見することができます。
研究者たちは、速度と信頼性で知られるプログラミング言語を使用してこのツールを構築し、個人のノートパソコンから研究センターで使用される巨大なスーパーコンピュータまで、ほぼあらゆるコンピュータシステムで動作するようにしました。重いグラフィカル・インターフェースを必要とせず、コマンドライン上で直接動作するため、データが存在するリモートサーバー上で使用することができ、時間と計算資源を節約できます。チームは、2つの主要なロングリード・シーケンシング技術のデータを用いてseqsizzleのテストを行いました。あるテストでは、遺伝子の鎖に特定の順序で複数のバーコードが付加された複雑なシングルセル実験のデータを分析するためにこれを使用しました。このツールは隠されたタグを特定し、それらを異なる色で強調表示し、約3分の1の鎖が期待通りのパターンに従っていることを研究者に示しました。別のテストでは、遺伝コードの重複部分を持つことが知られている特定の細胞株からのRNAを調査するためにこれを使用しました。ツールは、半数の鎖にこの重複が含まれていることを迅速に確認し、そうでなければ見逃されていたかもしれない構造的な異常を特定できることを証明しました。
seqsizzleを他のソフトウェアと差別化しているのは、人間の目と、迅速かつインタラクティブなトラブルシューティングの必要性に焦点を当てている点です。他のプログラムは、数百万の鎖を自動的に処理することには優れていますが、多くの場合、生の詳細は分析の層の背後に隠されてしまいます。もし科学者が、なぜ新しい実験がうまくいかないのかを突き止めようとしているのであれば、エラーを見つけるために、乱雑で未処理のデータを見る必要があります。seqsizzleは、データをスクロールし、色を切り替え、一致の判定基準を厳格に調整できる機能を提供することで、この空白を埋めます。このツールは単にデータを処理するだけではありません。実験自体の構造を理解することを科学者に助けるのです。これらの複雑でエラーが発生しやすい配列を直接可視化することを可能にすることで、このツールは研究者がプロトコルをトラブルシューティングし、予期せぬアーティファクトを発見し、伝えようとしている遺伝子の物語が正しく読み取られていることを確認する手助けとなります。
「seqsizzle: ロングリードシーケンシングデータにおける複雑なバーコードおよびアダプター構造のデコーディング」に関する技術要約
問題提起 ロングリードシーケンシング技術(Oxford Nanopore、PacBioなど)はゲノムプロファイリングを進展させてきたが、短リードプラットフォームと比較して、一般的に高いエラー率(1〜3%)を示す。このエラー率は、2 kbを超えるリードにおけるプライマー配列、バーコード、アダプターなどの正確な配列マッチングを必要とするタスクにおいて、重大な課題をもたらす。既存のツールはアライメント、デマルチプレキシング、あるいはバリアントコーリングには優れているが、生の ロングリードデータのインタラクティブな視覚的トラブルシューティングにおける顕著な空白が存在する。新しいプロトコルを開発している研究者は、人間の視覚的検査の限界や、ファジーマッチングおよび未処理のリードのインタラクティブな可視化をサポートするオープンソースツールの不足により、合成配列(プライマー、UMI、バーコード)の配置を特定したり、予期しないアーティファクトを検出したりすることに苦慮している。
手法 著者らは、Rustで記述されたクロスプラットフォームのターミナルベースのユーザーインターフェース(TUI)ツールであるseqsizzle を開発した。これは、グラフィカルなインターフェースや重い計算リソースを必要とせず、コマンドラインからFASTQおよびFASTAファイルを直接可視化するように設計されている。
コアエンジン: 本ツールは、Myersの高速近似文字列マッチングアルゴリズム(Rust-bioライブラリ経由)を利用して、ユーザー指定の配列を、設定可能なファジーマッチング閾値(特定の許容エラー数を許容する)を用いてリードに対してマッチングさせる。
可視化: TUIは、マッチした領域をハイライトした状態でリードを表示する。不一致(ミスマッチ)は太字で示され、クオリティスコアはイタリック体または背景色の変更によってスタイリングされる。ユーザーはマウスサポートの切り替えや、インタラクティブなリードのナビゲーションが可能である。
配列エンリッチメント (enrich サブコマンド): アダプター配列が未知の場合を支援するため、seqsizzleはk-merエンリッチメント解析を実行する。k-merをカウントし(デフォルトはk=8, 10, 12)、二項零モデルに基づくZスコア閾値を超えるものを保持する。アルゴリズムは、ローリングウィンドウによるカウントで蓄積しやすい高ホモポリマーk-merをフィルタリングし、オーバーレプレゼンテーション(過剰表現)されたアダプターやアーティファクトを特定するために、重複するk-merをより長い配列へと組み立てる。また、生物学的なターゲットがエンリッチメントレポートを支配するのを防ぐため、リファレンス配列を除外する機能も備えている。
リードの要約 (summarize サブコマンド): この機能は、リードを簡潔なパターン記述(例:..[linker1]..[linker2]..)に集約する。特定の配列配置の頻度を、正確なパーセンテージと、そのパターンを含むより長い配置を含む累積パーセンテージの両方を含めて集計する。
ポータビリティ: 単一の静的にリンクされたバイナリ(約4.0 MB)として実装されたseqsizzleは、Linux、macOS、Windowsで動作し、複雑なインストールやGUIを必要とせず、ハイパフォーマンスコンピューティング(HPC)クラスターやリモートログインノードでの実行に適している。
主な貢献
生のデータのインタラクティブな可視化: seqsizzleは、ファジーマッチングと明確なカラーコーディングを用い、複数の配列を同時にハイライトしながら、生のロングリード配列をインタラクティブにページングできる初のオープンソースツールとして提示されている。
アダプターの発見: 内蔵されたk-merエンリッチメント解析により、プロトコルのアーキテクチャに関する事前知識なしに、未知のプライマー配列やアーティファクトを発見することができる。
プロトコルのトラブルシューティング: 本ツールは、配列配置の頻度を要約することで、新しいプロトコル(例:シングルセル・コンビナトリアル・バーコーディング)のリード構造の推論を容易にする。
軽量な展開: 複雑な環境を必要とする多くのバイオインフォマティクスツールとは異なり、seqsizzleはリモートサーバー上で即座に実行できるように設計された軽量なバイナリである。
結果およびユースケース 著者らは、2つの異なるデータセットを用いてseqsizzleを検証した。
LR-split-seq (PacBio): シングルセルRNA-seqデータセットに適用したところ、enrich コマンドは事前情報なしにリンカー配列とpolyAテールを特定することに成功した。summarize コマンドは、約33%のリードが期待されるアーキテクチャ(Linker 1 – Insert – Linker 2 – PolyT)に従っていることを確認し、リード構造を定量化するツールの能力を実証した。
Direct RNA-seq (Nanopore): MOLM-13細胞株の、FLT3 遺伝子における既知の21塩基のヘテロ接合型重複を含むデータセットにおいて、本ツールは(リファレンスを除外した際に)重複部位をトップのエンリッチ配列として正しく特定し、その配列が約半数のリードで重複していることを正確に報告した。
8コアのLinuxインスタンスでの性能テストでは、高い効率性が示された。enrich コマンドは1,000リードを0.7秒未満で処理し、ピークRAM使用量は約356 MBであった。一方、summarize コマンドは54ミリ秒未満で完了し、約11 MBのRAMを消費した。
意義 論文は、seqsizzleをロングリードシーケンシング解析の「トラブルシューティング」段階における重要なユーティリティとして位置づけている。これは、デマルチプレキシングやUMIデデュープリケーションといったダウンストリームの処理ステップの前に、リードの構造を推論し、アーティファクトを特定するための、未処理リードの検査という特定のニーズに応えるものである。生のデータ検査とパターン認識の間のギャップを埋めることで、seqsizzleは新しいシーケンシングプロトコルの開発と検証を合理化することを目指している。著者らは、高度な検査ツール(例:IGV)は「処理済み」のデータに対して存在するが、seqsizzleは「生の」データ分析のための独自のニッチを埋めるものであり、インタラクティブでファジーマッチングを伴う配列可視化において、Geneious Primeのような商用ソフトウェアに対するオープンソースの代替手段を提供すると述べている。
毎週最高の bioinformatics 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×