Prediction of protein-carbohydrate binding sites from protein primary sequence
본 연구는 전통적인 서열 특징과 사전 학습된 단백질 언어 모델 임베딩을 결합하여, 1차 서열로부터 잔기 수준에서 단백질-탄수화물 결합 부위를 정확하게 예측하는 새로운 앙상블 머신러닝 모델인 StackCBEmbed를 소개한다.
1018 편의 논문
생물학 데이터의 거대한 바다를 해석하는 열쇠가 바로 생물정보학입니다. 이 분야는 방대한 유전체 정보를 컴퓨터 과학과 통계학으로 연결하여 생명 현상을 이해하는 새로운 방식을 제시합니다. 복잡한 DNA 서열이나 단백질 구조를 단순히 나열하는 것을 넘어,这些数据가 실제로 어떤 의미를 지니는지 찾아내는 과정이 핵심입니다.
Gist.Science 는 bioRxiv 에 매일 올라오는 최신 생물정보학 프리프린트들을 면밀히 검토합니다. 우리는 전문가가 작성한 기술적 요약을 제공함과 동시에, 비전문가도 쉽게 이해할 수 있는 평이한 설명을 함께 준비하여 연구의 핵심을 명확하게 전달합니다.
아래에는 bioRxiv 에서 선별된 최신 생물정보학 연구 논문들이 나열되어 있습니다.
본 연구는 전통적인 서열 특징과 사전 학습된 단백질 언어 모델 임베딩을 결합하여, 1차 서열로부터 잔기 수준에서 단백질-탄수화물 결합 부위를 정확하게 예측하는 새로운 앙상블 머신러닝 모델인 StackCBEmbed를 소개한다.
이 논문은 단일 조직 샘플 내 질량 분석 유래 측정값에 특히 초점을 맞추어, 다양한 공간 멀티오믹스 데이터셋의 엔드 투 엔드 분석 및 통합을 용이하게 하도록 설계된 R 패키지인 spammR을 소개한다.
본 연구는 CANDO 플랫폼의 다중 표적 약물 재창출 접근 방식이 화합물-프로테옴 상호작용 시그니처를 분석함으로써 조현병에 대한 새로운 치료 후보 물질을 성공적으로 식별하고 검증하며, 신경전달물질 시스템 및 칼슘 신호 전달 경로와 관련된 기존의 확립된 기전과 잠재적인 새로운 기전을 모두 밝혀냈음을 입증한다.
이 논문은 널리 사용되는 합-쌍(sum-of-pairs) 점수가 가장 정확한 다중 서열 정렬을 식별하는 데 종종 실패한다는 것을 입증하며, 특히 모델 2라는 딥러닝 기반의 스코어링 프레임워크를 제안하여 하류의 계통 발생 재구성을 개선하기 위해 대안적 정렬들의 순위를 효과적으로 매깁니다.
LongPolyASE는 합성 유전자 식별, 전사체 정량화 및 차등 발현 분석을 위한 통합된 구성 요소를 통해, 롱리드 RNA-seq 데이터를 이용한 배수체에서의 대립유전자 특이적 유전자 및 이소형 분석을 가능하게 하도록 설계된 포괄적인 엔드 투 엔드 프레임워크로서, 이러한 생물체들을 위한 전문화된 도구의 현재 부재를 해결한다.
본 연구는 poly(A) 농축 RNA-seq 데이터가 높은 위양성률과 도구 간의 불일치로 인해 신뢰할 수 있는 circRNA 검출에 부적합함을 입증하며, 효과적인 리보솜 RNA 제거를 동반한 total RNA 시퀀싱이 정확한 circRNA 프로파일링을 위한 필수적인 표준임을 확립한다.
RareCapsNet은 대규모 단일 세포 RNA-seq 데이터에서 희귀 세포 집단과 그 전사체 시그니처를 견고하게 식별하는 설명 가능한 캡슐 네트워크 프레임워크로서, 서로 다른 실험 배치 간의 지식 전이를 가능하게 하는 동시에 최신 기술들을 능가하는 성능을 보여준다.
이 논문은 단백질 백본을 카이랄성과 방향성을 보존하면서 4,096개의 토큰 어휘로 변환하는 SE(3)-등변 기하학적 완전성(geometry-complete)을 갖춘 토크나이저인 GCP-VQVAE를 소개하며, 이를 통해 기존 방식 대비 최첨단 재구성 정확도, 강력한 제로샷 일반화 성능, 그리고 현저히 빠른 추론 속도를 달성하였다.
이 연구는 AlphaGenome 모델이 국소적 조절 문법을 포착함으로써 염색질 접근성 변화를 효과적으로 예측하는 반면, 개체 간 차이에 요구되는 장거리 조절 통합을 모델링하는 데 따르는 어려움으로 인해 유전자 발현 변화를 예측하는 데 있어서는 현저히 성능이 떨어진다는 것을 밝혀냈다.
MLMarker는 건강한 조직으로 학습된 랜덤 포레스트 모델을 활용하여 연속적인 유사도 점수를 계산하고, 희소한 체액 샘플과 전이성 종양을 포함한 복잡한 단백질체 데이터에서 조직의 기원을 식별하는 해석 가능한 머신러닝 프레임워크입니다.