Improving genomic language model reliability under distribution shift
이 논문은 온도 스케일링과 에피스템릭 신경망과 같은 불확실성 정량화 기법을 적용하여 다양한 분포 변화 하에서 게놈 언어 모델의 예측 신뢰성을 향상시키는 방법을 제시합니다.
1018 편의 논문
생물학 데이터의 거대한 바다를 해석하는 열쇠가 바로 생물정보학입니다. 이 분야는 방대한 유전체 정보를 컴퓨터 과학과 통계학으로 연결하여 생명 현상을 이해하는 새로운 방식을 제시합니다. 복잡한 DNA 서열이나 단백질 구조를 단순히 나열하는 것을 넘어,这些数据가 실제로 어떤 의미를 지니는지 찾아내는 과정이 핵심입니다.
Gist.Science 는 bioRxiv 에 매일 올라오는 최신 생물정보학 프리프린트들을 면밀히 검토합니다. 우리는 전문가가 작성한 기술적 요약을 제공함과 동시에, 비전문가도 쉽게 이해할 수 있는 평이한 설명을 함께 준비하여 연구의 핵심을 명확하게 전달합니다.
아래에는 bioRxiv 에서 선별된 최신 생물정보학 연구 논문들이 나열되어 있습니다.
이 논문은 온도 스케일링과 에피스템릭 신경망과 같은 불확실성 정량화 기법을 적용하여 다양한 분포 변화 하에서 게놈 언어 모델의 예측 신뢰성을 향상시키는 방법을 제시합니다.
이 논문은 사전 훈련된 게놈 언어 모델인 Evo2 가 숙주 라벨 학습 없이도 박테리오파지 숙주 예측에 유효한 신호를 포착할 수 있음을 입증하고, 이를 기존 정렬 및 k-mer 기반 방법과 결합한 하이브리드 접근법이 예측 성능을 향상시킬 수 있음을 제시합니다.
PanXpress 는 단일 참조 게놈의 편향을 극복하고 복잡한 세균 샘플에서 정밀한 유전자 발현 정량을 가능하게 하기 위해, 게놈 및 주석 파일로부터 직접 팬-전사체를 구축하고 gapped k-mer 인덱스를 활용한 정렬 없는 매핑을 수행하는 통합 프레임워크를 제안합니다.
본 논문은 찬드라이트인 자그 운석에서 시퀀싱된 핵산 분자가 생물학적 문법을 따르지 않으면서도 무작위 모델과는 구별되는 구조적 제약을 보인다고 보고하여, 기존 생물학적 또는 기술적 모델로 설명하기 어려운 새로운 영역에 존재할 가능성을 제시하고 독립적인 재현 및 추가 연구를 촉구합니다.
이 연구는 대규모 언어 모델 (LLM) 을 활용하여 에빙 육종 병리 보고서의 비정형 데이터를 추출하고, NSE 와 S100 이 예후에 유의미한 영향을 미치는 생체표지자임을 확인함으로써 향후 위험도 stratification 개선과 임상 시험 설계에 기여할 수 있음을 시사합니다.
FlashS 는 주파수 도메인 기법을 활용하여 거리 행렬 구축 없이 대규모 공간 전사체 데이터에서 정확하고 확장 가능한 공간 변이 유전자 검출을 가능하게 하는 새로운 방법론입니다.
이 논문은 인간 기반 모델 어노테이션을 활용하여 27 개 장기와 250 만 개 이상의 세포를 통합한 가장 큰 마카크 원숭이 단일 세포 지도를 구축함으로써, 전임상 연구에서 표적 평가의 정확성을 높이고 비인간 영장류 사용을 줄이는 데 기여하는 통합 자원을 제시합니다.
이 논문은 단백질 공학의 복잡한 조건부 설계와 다목적 최적화 문제를 해결하기 위해 다양한 머신러닝 모델을 통합하고 실험 데이터와의 반복적 연계를 지원하며 웹 인터페이스를 통해 비전문가도 접근할 수 있도록 설계된 오픈소스 프레임워크 'evedesign'을 제안합니다.
StrucTTY 는 HPC 환경 및 SSH 세션과 같은 텍스트 기반 터미널에서 실시간으로 단백질 구조를 시각화하고 비교 분석할 수 있도록 설계된 대화형 터미널 네이티브 도구입니다.
이 논문은 시스토크롬 P450 의 극심한 서열 다양성과 불일치된 주석으로 인해 PDB 내 모든 P450 구조를 식별하고 분류하는 데 어려움이 있었던 문제를 해결하기 위해, 키워드 검색과 은닉 마르코프 모델, 구조 정렬을 결합한 워크플로우를 개발하여 1,513 개의 PDB 등재물 (674 개 고유 서열) 을 식별하고 5 개의 새로운 아과를 발견하며 표준화된 명명법을 적용한 최초의 엄격하게 큐레이션된 P450 레지스트리를 구축했다고 요약할 수 있습니다.