CodonMamba: a foundation model for programmable mRNA coding sequence design
CodonMamba는 대규모 코퍼스에 대한 사전 학습을 통해 예측 작업에서 탁월한 성능을 달성하고, 재학습 없이도 특정 숙주 또는 응용 분야의 선호도를 충족하기 위해 추론 시 코돈 최적화를 프로그래밍 가능하게 제어할 수 있는 mRNA 코딩 서열 설계를 위한 최첨단 파운데이션 모델입니다.
1012 편의 논문
생물학 데이터의 거대한 바다를 해석하는 열쇠가 바로 생물정보학입니다. 이 분야는 방대한 유전체 정보를 컴퓨터 과학과 통계학으로 연결하여 생명 현상을 이해하는 새로운 방식을 제시합니다. 복잡한 DNA 서열이나 단백질 구조를 단순히 나열하는 것을 넘어,这些数据가 실제로 어떤 의미를 지니는지 찾아내는 과정이 핵심입니다.
Gist.Science 는 bioRxiv 에 매일 올라오는 최신 생물정보학 프리프린트들을 면밀히 검토합니다. 우리는 전문가가 작성한 기술적 요약을 제공함과 동시에, 비전문가도 쉽게 이해할 수 있는 평이한 설명을 함께 준비하여 연구의 핵심을 명확하게 전달합니다.
아래에는 bioRxiv 에서 선별된 최신 생물정보학 연구 논문들이 나열되어 있습니다.
CodonMamba는 대규모 코퍼스에 대한 사전 학습을 통해 예측 작업에서 탁월한 성능을 달성하고, 재학습 없이도 특정 숙주 또는 응용 분야의 선호도를 충족하기 위해 추론 시 코돈 최적화를 프로그래밍 가능하게 제어할 수 있는 mRNA 코딩 서열 설계를 위한 최첨단 파운데이션 모델입니다.
본 논문은 이질적인 데이터로부터의 베이지안 네트워크 구조 학습의 강건성, 해석 가능성 및 통계적 교정(calibration)을 향상시키기 위해 해상도 인식형(resolution-aware)의 교정된 최소 불확실성 기준과 판별력 평가 프레임워크를 도입한다.
Delta-Marches는 신장암 등급 판정 및 대장 결선성 변화에서 입증된 바와 같이, 병리적 변화를 주도하는 세포 내 특징을 정확히 찾아내기 위해 조직 클래스 간의 이상적인 형태학적 전이를 시뮬레이션함으로써 질병 기전을 해독하는 생성형 AI 프레임워크이다.
KRAKEN은 다양한 생물 의학 소스를 표준화된 의미론, 내장된 분석 도구, 그리고 인간과 AI 기반 연구 모두를 위한 다중 모드 인터페이스를 특징으로 하는 모듈형 1,500만 노드 시스템으로 통합함으로써 멀티오믹스 및 웰니스 데이터의 과소 표현 문제를 해결하는 확장 가능하고 출처 추적이 가능한 지식 그래프입니다.
이 연구는 명시적인 Pfam 도메인 함량이 생합성 유전자 클러스터를 검색하는 데 있어 ESM-2 서열 유래 표현형보다 우수하거나 대등한 성능을 보임을 입증하며, 이는 서열 임베딩이 현재 기존의 도메인 기반 지표를 넘어 대안적 생합성 경로의 회복을 개선하지 못함을 나타낸다.
이 논문은 단백질 서열만으로 근접성을 유도하고 표적 단백질 분해를 유도하는 거대 고리 분자 글루(macrocyclic molecular glue)의 데 노보(de novo) 설계를 가능하게 하는 딥러닝 프레임워크인 EvoBind-multimer를 소개하며, 또한 이러한 글루의 기능적 결과가 서로 다른 환자 유래 모델 사이에서 맥락 의존적으로 달라질 수 있음을 밝혀낸다.
이 논문은 현재의 최첨단 효소 기능 예측 모델들이 계통 발생학적 지름길에 크게 의존하며 촉매 능력이 없는 변이체와 기능적 효소를 구분하는 데 실패한다는 점을 입증하기 위해 구조적으로 붕괴된 효소 디코이(decoy)로 구성된 새로운 벤치마크 데이터셋인 EnzymARC를 소개하며, 이를 통해 모델 학습 및 평가 과정에서 구조를 인지하는 부정적 예시(negative examples)가 필수적임을 강조한다.
이 논문은 인플루엔자 변이 할당 및 성장률 추정 방법의 정확도와 구체적인 실패 모드를 밝히기 위해, 유전 서열을 항원 표현형과 연결하여 숙주 선택 하에 지면 진실(ground-truth) 데이터를 생성하는 순방향 시간 역학 시뮬레이터인 antigen-prime을 소개한다.
이 연구는 표준적인 차수 기반 유전자 우선순위 지정 방식이 생물학적 과정을 조율하는 데 필수적인 비허브 커넥터 유전자를 체계적으로 간과한다는 점을 밝히고, 기능적 주석이나 커뮤니티 탐지에 의존하지 않고도 이러한 누락된 유전자들을 성공적으로 복구하는 분할 불필요한 정보 이론적 중심성 척도인 EDVS를 제안한다.
SVlog는 유전체 데이터를 관계형 사실로 변환하고 결합 가능한 논리 규칙을 적용함으로써, 임상 질환 큐레이션을 위한 구조적 변이의 빠르고 결정론적이며 설명 가능한 분석, 주석 달기 및 우선순위 지정을 가능하게 하는 Souffle 기반의 투명한 선언적 논리 프로그래밍 프레임워크입니다.