💻 bioinformatics

POTTR: Identifying Recurrent Trajectories in Evolutionary and Developmental Processes using Posets

यह शोध पत्र POTTR प्रस्तुत करता है, जो एक नवीन कॉम्बिनेटोरियल एल्गोरिदम है जो विविध जैविक डेटासेटों में सांख्यिकीय रूप से महत्वपूर्ण आवर्ती आनुवंशिक प्रक्षेपवक्रों और संरक्षित विभेदन मार्गों की पहचान करने के लिए अपूर्ण आंशिक क्रमबद्ध सेटों (posets) और एक संघर्ष ग्राफ दृष्टिकोण का उपयोग करता है, जिससे ट्यूमर फाइलोजी और वंश अनुरेखण में निहित अनिश्चितताओं को प्रभावी ढंग से हल किया जा सके, और यह NP-hard मैक्सिमम k-कॉमन इंड्यूस्ड इनकम्प्लीट सबपोसेट समस्या को हल करता है।

Käufler, S. C., Schmidt, H., Jürgens, M., Klau, G. W., Sashittal, P., Raphael, B.2026-02-26
💻 bioinformatics

MaxGeomHash: An Algorithm for Variable-Size Random Sampling of Distinct Elements

यह शोध पत्र MaxGeomHash को प्रस्तुत करता है, जो एक नवीन समानांतर करने योग्य (parallelizable) और क्रम-अपरिवर्तनीय (permutation-invariant) स्केचिंग एल्गोरिदम है जो उप-रैखिक जटिलता (sub-linear complexity) के साथ विशिष्ट k-mers के परिवर्तनीय-आकार के यादृच्छिक नमूनों को उत्पन्न करता है, जो मौजूदा निश्चित-आकार (MinHash) और रैखिक-आकार (FracMinHash) विधियों की तुलना में भंडारण दक्षता और समानता अनुमान सटीकता के बीच एक संतुलित समझौता प्रदान करता है।

Hera, M. R., Koslicki, D., Martinez, C.2026-02-25
💻 bioinformatics

PMGen: From Peptide-MHC Structure Prediction to Peptide Generation

PMGen एक एकीकृत ढांचा है जो परिवर्तनशील-लंबाई वाले पेप्टाइड-MHC परिसरों के लिए अत्याधुनिक संरचनात्मक भविष्यवाणी प्राप्त करने हेतु नवीन रणनीतियों के साथ AlphaFold2 का लाभ उठाता है, जिससे उच्च-सटीकता वाली संरचना-निर्देशित पेप्टाइड डिजाइन और उन्नत प्रतिरक्षात्मक मॉडलों को प्रशिक्षित करने के लिए बड़े पैमाने पर डेटासेट का निर्माण सक्षम होता है।

Asgary, A. H., Aleyasin, A., Mehl, J. A., Fallah, S., Aintablian, H., Ludewig, B., Mishto, M., Liepe, J., Soeding, J.2026-02-25
💻 bioinformatics

PaNDA: Efficient Optimization of Phylogenetic Diversity in Networks

यह शोधपत्र PaNDA प्रस्तुत करता है, जो एक ऐसा सॉफ़्टवेयर पैकेज है जिसमें बाउंडेड स्कैनविड्थ (bounded scanwidth) वाले फाइलोजेनेटिक नेटवर्क में फाइलोजेनेटिक विविधता को कुशलतापूर्वक अधिकतम करने के लिए एक नवीन बहुपद-समय (polynomial-time) एल्गोरिदम है, साथ ही यह विविधता की परिभाषा को सेमी-डायरेक्टेड (semi-directed) नेटवर्क तक विस्तारित करता है और उस संदर्भ में अनुकूलन समस्या की NP-कठोरता (NP-hardness) को सिद्ध करता है।

Holtgrefe, N., van Iersel, L., Meuwese, R., Murakami, Y., Schestag, J.2026-02-25
💻 bioinformatics

Protein Compositional Ratio Representation (PCRR)Systematically Improves Human Disease Prediction

यह अध्ययन प्रदर्शित करता है कि प्लाज्मा प्रोटिओमिक्स डेटा को प्रोटीन के युग्म-आधारित अनुपातों (pairwise protein ratios) का उपयोग करके कम्पोजिशनल सिस्टम के रूप में मॉडल करना, मानव रोगों की भविष्यवाणी करने में पारंपरिक प्रचुरता-आधारित (abundance-based) दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे अल्जाइमर के उपप्रकारों में और यूके बायोबैंक में विभिन्न स्थितियों के एक विस्तृत स्पेक्ट्रम में पर्याप्त सटीकता प्राप्त होती है।

Madduri, A. V., Ellis, R. J., Patel, C. J.2026-02-25
💻 bioinformatics

KuPID: Kmer-based Upstream Preprocessing of Long Reads forIsoform Discovery

kuPID लॉन्ग RNAseq रीड्स के लिए एक kmer-आधारित प्रीप्रोसेसिंग टूल है जो रीड्स को सूडो-अलाइन करने और अतिरिक्त डेटा को फ़िल्टर करने के लिए kmer स्केचिंग का उपयोग करके नए आइसोफॉर्म की खोज को तेज़ करता है, जिससे पाइपलाइन की गति और सटीकता दोनों में महत्वपूर्ण सुधार होता है।

Borowiak, M., Yu, Y. W.2026-02-25
💻 bioinformatics

GaugeFixer: overcoming parameter non-identifiability in models of sequence-function relationships

यह शोध पत्र GaugeFixer को पेश करता है, जो एक स्केलेबल पायथन पैकेज है जो लीनियर-टाइम गेज-फिक्सिंग के माध्यम से सीक्वेंस-फंक्शन मॉडल्स में पैरामीटर नॉन-आइडेंटिफिएबिलिटी (parameter non-identifiability) को हल करता है, जिससे लाखों पैरामीटर्स वाले जटिल लैंडस्केप्स की जैविक रूप से सार्थक व्याख्या संभव हो पाती है।

Marti-Gomez, C., McCandlish, D. M., Kinney, J. B.2026-02-25
💻 bioinformatics

Generating Structurally Diverse Therapeutic Peptides with GFlowNet

यह शोध पत्र यह प्रदर्शित करता है कि GFlowNet, अनुपातिक रिवॉर्ड सैंपलिंग के माध्यम से स्वाभाविक रूप से समान अनुक्रम सैंपलिंग (uniform sequence sampling) प्राप्त करके, संरचनात्मक रूप से विविध चिकित्सीय पेप्टाइड्स उत्पन्न करने में GRPO जैसे पारंपरिक सुदृढीकरण शिक्षण (reinforcement learning) विधियों से बेहतर प्रदर्शन करता है, जिससे स्पष्ट विविधता दंड (explicit diversity penalties) की आवश्यकता समाप्त हो जाती है और मोड कोलैप्स (mode collapse) को रोका जा सकता है।

Wijaya, E.2026-02-25
💻 bioinformatics

Distilling Protein Language Models with Complementary Regularizers

यह शोध पत्र यह प्रदर्शित करता है कि दो पूरक प्रोटीन-विशिष्ट रेगुलराइज़रों—अनिश्चितता-जागरूक स्थिति भारण (uncertainty-aware position weighting) और अंशांकन-जागरूक लेबल स्मूथिंग (calibration-aware label smoothing)—का उपयोग करके एक बड़े प्रोटीन लैंग्वेज मॉडल को संक्षिप्त स्टूडेंट मॉडल्स में डिस्टिल करना, अनुमान गति (inference speed), मेमोरी दक्षता और दुर्लभ डेटा पर सैंपल दक्षता में महत्वपूर्ण सुधार करता है, जिससे उपभोक्ता-ग्रेड हार्डवेयर पर उच्च-गुणवत्ता वाला डोमेन अनुकूलन सक्षम होता है।

Wijaya, E.2026-02-25
💻 bioinformatics

ARCH3D: A foundation model for global genome architecture

यह शोध पत्र ARCH3D को प्रस्तुत करता है, जो वैश्विक जीनोम आर्किटेक्चर के लिए एक फाउंडेशन मॉडल है जो जीनोम-व्यापी स्थानिक संरचनाओं को कैप्चर करने और जटिल गुणसूत्र अंतःक्रियाओं के पुनर्निर्माण को सक्षम करने के लिए एक नवीन मास्क्ड लोकस मॉडलिंग कार्य का उपयोग करता है, जो अंततः जीनोम व्यवहार के अनुकरण के लिए एक संरचनात्मक आधार के रूप में कार्य करता है।

Galioto, N., Stansbury, C., Gorodetsky, A. A., Rajapakse, I.2026-02-25