생물학 데이터의 거대한 바다를 해석하는 열쇠가 바로 생물정보학입니다. 이 분야는 방대한 유전체 정보를 컴퓨터 과학과 통계학으로 연결하여 생명 현상을 이해하는 새로운 방식을 제시합니다. 복잡한 DNA 서열이나 단백질 구조를 단순히 나열하는 것을 넘어,这些数据가 실제로 어떤 의미를 지니는지 찾아내는 과정이 핵심입니다.

Gist.Science 는 bioRxiv 에 매일 올라오는 최신 생물정보학 프리프린트들을 면밀히 검토합니다. 우리는 전문가가 작성한 기술적 요약을 제공함과 동시에, 비전문가도 쉽게 이해할 수 있는 평이한 설명을 함께 준비하여 연구의 핵심을 명확하게 전달합니다.

아래에는 bioRxiv 에서 선별된 최신 생물정보학 연구 논문들이 나열되어 있습니다.

💻 bioinformatics

PanGBank: a large-scale resource of precomputed microbial pangenomes built with PPanGGOLiN

PanGBank는 PPanGGOLiN을 사용하여 4,600종 이상의 원핵생물에 대한 사전 계산된 범유전체(pangenome)를 제공하는 포괄적인 오픈 액세스 데이터베이스로서, 대규모 비교 유전체학 및 미생물 진화와 적응 연구를 용이하게 하기 위해 표준화된 그래프 기반 리소스와 다양한 액세스 도구를 제공합니다.

Mainguy, J., Lemane, T., Bazin, A., Arnoux, J., Gautreau, G., Medigue, C., Calteau, A., Vallenet, D.2026-08-09
💻 bioinformatics

Move BeTween modAlities (MBTA) employs flow matching to predict single cell data modalities

본 논문은 단일 세포 데이터의 구조적 불일치를 해결하기 위해 플로우 매칭(flow matching)을 활용하여 양식별 잠재 공간을 연결함으로써, 각 분자 양식의 고유한 구조적 무결성을 보존하면서도 정확한 교차 양식 변환을 가능하게 하는 새로운 프레임워크인 Move BeTween modAlities (MBTA)를 소개한다.

Xu, B., Zhang, Y., Michor, F.2026-08-09
💻 bioinformatics

Scalable Extraction of Information on Protein-Protein Interactions using Topological Data Analysis

이 논문은 기존의 기하학적 딥러닝 방법들과 비교하여 경쟁력 있는 정확도를 유지하면서도, 표면 패치로부터 단백질-단백질 상호작용 인터페이스스를 예측하는 데 드는 계산 비용을 크게 줄이는 확장 가능한 위상 데이터 분석 프레임워크를 소개한다.

Mukherjee, A., Park, B., Malmstrom, A., Cisewski-Kehe, J., Van Lehn, R. C., Zavala, V. M.2026-08-09
💻 bioinformatics

A hierarchical orthology framework reveals viral carbohydrate-active genes across the global virosphere

본 연구는 서열, 구조 및 기능 데이터를 통합하여 전 세계 바이로스피어(virosphere)에 걸친 방대하고 이전에 과소평가되었던 바이러스 탄수화물 활성 효소의 다양성을 밝혀내고, 이들의 복잡한 진화적 기원과 바이러스-숙주 상호작용에서의 중요한 역할을 드러내는 계층적 직계 존속성 프레임워크인 VirGenes를 소개한다.

Meng, L., Zhang, R., De Castro, C., Uchiyama, I., Kanehisa, M., Ogata, H.2026-08-07
💻 bioinformatics

SLIM: A small linear model with STRING embeddings for single-cell genetic perturbation prediction

SLIM은 64차원 STRING 네트워크 임베딩과 폐쇄형 릿지 회귀 추정치를 활용하여 유전적 섭동에 대한 세포 반응을 정확하게 예측하며, 최소한의 학습 가능한 파라미터로 복잡한 딥러닝 베이스라인 모델들을 종종 능가하는 가볍고 계산 효율적인 모델이다.

Hu, D., Pielies Avelli, M., Jensen, L. J., Rasmussen, S.2026-08-07
💻 bioinformatics

From Abandoned Scripts to FAIR Community Pipelines: Rescuing Orphan Bioinformatics Workflows with nf-core - Lessons from Light-Sheet Fluorescence Microscopy

이 논문은 버려진 MATLAB 기반의 NuMorph 툴킷과 같은 고립된 과학 소프트웨어가 FAIR 원칙과 현대적 소프트웨어 공학 표준에 따라 체계적인 재설계를 적용함으로써 nf-core/lsmquant와 같이 지속 가능하고 재사용 가능한 커뮤니티 워크플로로 성공적으로 구조될 수 있음을 입증한다.

Schwitalla, C., Kuhn Cuellar, L., Hoertenhuber, M., Grote, N., Woller, T., Lamberti, I., Pavie, B., Kuestner, T., Kyere (…)2026-08-06
💻 bioinformatics

Benchmarking Twist Genotyping-by-Sequencing Against Whole-Genome Sequencing in Nuclear Families

본 연구는 184개 핵가족 555명의 개인을 대상으로 유전자형 일치도와 멘델 위반율을 평가함으로써 Twist Bioscience의 전유전체 SNP 캡처(GxS) 플랫폼을 전유전체 시퀀싱 및 Illumina GSA-24 어레이와 벤치마킹하며, 이를 통해 이 신흥 표적 시퀀싱 기술에 대한 제3자 평가를 제공하는 것을 목표로 한다.

Klugerman, J., Iossifov, I., Ye, K.2026-08-06
💻 bioinformatics

A Comprehensive Database of Simulations and Meshes of Coronary Arteries from the Fame 2 Trial

본 논문은 데이터 기반 모델링 및 머신러닝 응용 분야를 위한 수치 혈역학 데이터의 부족 문제를 해결하기 위해, FAME 2 임상 시험에서 재구성된 779개의 관상동맥에 대한 3D 비정상 유동 나비에-스토크스 시뮬레이션과 고품질 육면체 격자를 포함하는 공개 가능한 데이터베이스를 제시한다.

Marcinno', F., Hinz, J., Ando', E., Mahendiran, T., Buffa, A., Deparis, S.2026-08-05