생물학 데이터의 거대한 바다를 해석하는 열쇠가 바로 생물정보학입니다. 이 분야는 방대한 유전체 정보를 컴퓨터 과학과 통계학으로 연결하여 생명 현상을 이해하는 새로운 방식을 제시합니다. 복잡한 DNA 서열이나 단백질 구조를 단순히 나열하는 것을 넘어,这些数据가 실제로 어떤 의미를 지니는지 찾아내는 과정이 핵심입니다.

Gist.Science 는 bioRxiv 에 매일 올라오는 최신 생물정보학 프리프린트들을 면밀히 검토합니다. 우리는 전문가가 작성한 기술적 요약을 제공함과 동시에, 비전문가도 쉽게 이해할 수 있는 평이한 설명을 함께 준비하여 연구의 핵심을 명확하게 전달합니다.

아래에는 bioRxiv 에서 선별된 최신 생물정보학 연구 논문들이 나열되어 있습니다.

💻 bioinformatics

crispAIPE: Probabilistic Modelling of Prime Editing Variant Correction Efficiency

crispAIPE는 디리클레 가능도(Dirichlet likelihood)와 분할 콤포럴 보정(split-conformal calibration)을 통해 심플렉스(simplex) 상의 경쟁적인 편집 이벤트를 모델링함으로써 프라임 편집 결과의 불확실성을 정량화하고, 변이 교정 효율에 대한 신뢰할 수 있는 예측과 세포 유형 전반에 걸친 일반화 가능한 설계 필터를 가능하게 하는 트랜스포머 기반 확률론적 프레임워크이다.

Ozden, F., Lu, P., Minary, P.2026-08-03
💻 bioinformatics

RKMR: A Rapid Kernel Machine Regression Framework for Optimal Marker Detection in Spatial Omics Data

RKMR은 비선형 커널 모델링, 스파이크 앤 슬래브(spike-and-slab) 변수 선택, 그리고 공간적 의존성을 통합하여 고차원 공간 오믹스 데이터로부터 강건하고 예측력 있는 마커 패널을 식별하는 확장 가능하며 불확실성을 고려한 프레임워크로, 기존 방법들보다 정확도와 해석력 측면에서 뛰어난 성능을 보인다.

Seal, S., Chakraborty, A., Mattila, C., Rubinstein, M., Angel, P., Ghosh, D., Chung, D., Neelon, B.2026-08-03
💻 bioinformatics

PG-LLM: Benchmarking General-Purpose Language Models for Protein Variant Ranking

PG-LLM 벤치마크는 범용 언어 모델이 구조적 데이터나 다중 서열 정렬에 대한 접근 권한이 없음에도 불구하고 단백질 변이체를 효과적으로 순위 매길 수 있으며 많은 기존 서열 기반 예측 도구들보다 우수한 성능을 보이지만, 여전히 특화된 생체 분자 도구들에는 미치지 못한다는 것을 보여준다.

Arora, R. K., Chen, L. T., Du, M., Marks, D., Church, G.2026-08-03
💻 bioinformatics

What limits local ancestry inference at low divergence: a feasibility threshold, a metric that conceals failure, and a deficit of input more than architecture

이 연구는 낮은 유전적 분화도에서의 국소 조상 추론이 모델 구조보다는 타당성 임계치와 현재 참조 데이터의 불충분함에 의해 근본적으로 제약된다는 점을 밝히며, 사이트별 정확도 지표가 심각한 구조적 실패를 은폐하고 있고 더 풍부한 하플로타입 정보를 제공하는 것이 구조적 혁신보다 더 큰 성능 향상을 가져온다는 것을 입증한다.

Tian, Q.2026-08-03
💻 bioinformatics

Discovery of a buried charge-network GFP-fold family spanning prokaryotes and eukaryotes (Draft manuscript)

이 연구는 전핵생물과 진핵생물을 아우르며, 표준적인 형광 발색단을 두 개의 아르기닌, 두 개의 글루탐산, 그리고 하나의 티로신으로 구성된 고도로 구속되고 매몰된 전하 네트워크로 대체하는, 진화적으로 보존된 새롭게 발견된 GFP-폴드 단백질 가문을 밝혀냈으며, 이 모티프는 서로 관련이 없는 DUF2490 가문에서도 수렴적으로 발견된다.

Zimmer, M., Schneider, T. L.2026-08-02
💻 bioinformatics

MassGAT: a graph-based collective learning approach for untargeted detection and annotation of LC-MS data

MassGAT는 이온 종을 그래프로 모델링하고 그래프 어텐션 네트워크를 활용하여 기존의 독립적인 처리 파이프라인보다 뛰어난 성능을 발휘함으로써 LC-HRMS 데이터를 위한 피크 검출과 주석 달기를 통합하는 오픈 소스 기반의 그래프 기반 집단 학습 접근 방식입니다.

Pinart, P.-H., Damont, A., Dechaumet, S., Thevenot, E.2026-08-02
💻 bioinformatics

Elucidating enzyme-substrate specificity through co-folding foundation model

이 논문은 생체 분자 파운데이션 모델을 활용하여 네이티브 공동 폴딩(native co-folding)을 통해 효소-기질 상호작용을 예측함으로써 활성 부위의 가소성을 포착하고, 기존 방법들을 능가하여 생체 촉매 발견 및 경로 규명을 가속화하는 엔드 투 엔드 프레임워크인 Boltz2ESI를 소개한다.

Cheng, X., Seo, S., Huh, C., Chen, J., Jiang, S., Guo, P., Weng, J.-K., Kim, W. Y., Jin, W.2026-08-02
💻 bioinformatics

DPCGS: a computational framework for linking GWAS to single-cell transcriptomics in complex traits and diseases

DPCGS는 GWAS 요약 통계와 단일 세포 RNA 시퀀싱 데이터를 통합하여 유전적 위험을 특정 세포 하위 집단 및 조절 프로그램으로 고해상도 매핑을 달성함으로써 기존 방법론보다 우수한 정확도를 입증하고 알츠하이머 및 천식과 같은 복합 질환의 세포 기전에 대한 새로운 통찰력을 제공하는 혁신적인 계산 프레임워크이다.

Liu, C., Yuan, B., Shen, B., Li, J., Zhu, R., Yang, P., Wu, B., Xuan, Y., Yang, S., Yang, N., Ma, L., Liu, Q., Dai, S. (…)2026-07-31