🧬 biology

PROTOCOL: Late Interaction Retrieval for Protein Homolog Search

यह शोध पत्र ProtoCol को प्रस्तुत करता है, जो एक प्रोटीन होमोलॉजी खोज मॉडल है जो अनुक्रम समानता के "ट्वाइलाइट ज़ोन" (twilight zone) के भीतर रिमोट होमोलॉग्स की पहचान करने में मौजूदा अलाइनमेंट-आधारित और पूल्ड रिप्रेजेंटेशन विधियों से बेहतर प्रदर्शन करने के लिए अवशेष-स्तर (residue-level) के एम्बेडिंग्स पर ColBERT-शैली के लेट इंटरैक्शन का लाभ उठाता है।

Gabrielle Cohn, Rohan Gumaste, Minh Hoang, Vihan Lakshman2026-05-29
🤖 machine learning

TIMEGATE: Sustainable Time-Boxed Promotion Gates for Continual ML Adaptation Under Resource Constraints

यह शोधपत्र TIMEGATE को पेश करता है, जो टिकाऊ निरंतर मशीन लर्निंग (continual machine learning) के लिए एक नीति ढांचा (policy framework) है, जो समय और कंप्यूट का बजट निर्धारित करके संसाधन-सीमित अनुकूलन चक्रों को अनुकूलित करता है, और एक मीट्रिक-उपलब्धता संकेत (metric-availability signal) का उपयोग करके आंशिक मूल्यांकन को सक्षम करता है जो विविध मॉडलों और डेटासेटों में सटीकता बनाए रखते हुए ऊर्जा और वॉल-क्लॉक लागतों को महत्वपूर्ण रूप से कम करता है।

Abhijit Chakrabroty, Suddhasvatta Das, Kevin A. Gary, Yash Shah2026-05-29
🤖 machine learning

Stochastic Lifting for Generating Trajectories of Stochastic Physical Systems

यह शोध पत्र स्टोकेस्टिक लिफ्टिंग (Stochastic Lifting) प्रस्तुत करता है, जो एक ऐसी विधि है जो विविध, गैर-संकुचित (non-collapsing) प्रक्षेप पथों को ऑटोरेग्रेसिव इन्फरेंस के माध्यम से उत्पन्न करने में सक्षम एक नियतात्मक मानचित्र (deterministic map) सीखने के लिए स्वतंत्र उच्च-आयामी यादृच्छिक लेबल के साथ अवस्था संक्रमणों (state transitions) को संवर्धित करके सुचारू स्टोकेस्टिक भौतिक प्रणालियों को मॉडल करती है।

Jules Berman, Tobias Blickhan, Benjamin Peherstorfer2026-05-29
🤖 machine learning

Auditing Training Data in Generative Music Models via Black-Box Membership Inference

यह शोध पत्र एक ब्लैक-बॉक्स मेंबरशिप इन्फरेंस विधि प्रस्तावित करता है जो मॉडल मापदंडों (parameters) तक पहुंच के बिना डेटा उत्पत्ति (data provenance) को सत्यापित करने के लिए प्रशिक्षण डेटा और कैप्शन-कंडीशन्ड मॉडल आउटपुट के बीच मजबूत सेमेंटिक और स्ट्रक्चरल संरेखण का लाभ उठाकर जनरेटिव म्यूजिक मॉडल्स के ऑडिटिंग में 98.6% तक सटीकता प्राप्त करता है।

Yi Chen Liu, Jiawei Yu, Kexin Cao, Syed Irfan Ali Meerza, Trishika Movva, Jian Liu2026-05-29
💻 computer science

libhmm: A Modern C++20 Library for Hidden Markov Models with Correct MLE Emission M-Steps

यह शोधपत्र libhmm को प्रस्तुत करता है, जो हिडन मार्कोव मॉडल के लिए एक आधुनिक, ज़ीरो-डिपेंडेंसी C++20 लाइब्रेरी है, जो विविध एमिशन डिस्ट्रीब्यूशन के लिए सही मैक्सिमम लाइकलीहुड एस्टिमेटर्स, पूर्ण लॉग-स्पेस गणनाओं और पायथन बाइंडिंग्स के साथ SIMD-एक्सेलेरेटेड प्रदर्शन को लागू करके प्रोडक्शन-रेडी सॉफ़्टवेयर में महत्वपूर्ण कमियों को पूरा करती है।

Gary Wolfman2026-05-29
🤖 machine learning

Inferring the Size of Large Language Models From Popular Text Memorization

यह शोध पत्र एक ब्लैक-बॉक्स पद्धति प्रस्तुत करता है जो लोकप्रिय ग्रंथों की उनकी स्मृति सटीकता (memorization accuracy) का विश्लेषण करके बड़े भाषा मॉडलों के पैरामीटर गणनाओं पर रूढ़िवादी निचली सीमाएं (conservative lower bounds) निकालता है, जिससे मॉडल आकारों की रैंकिंग सक्षम होती है और बंद-भार वाले सिस्टम (closed-weight systems) के लिए भी छिपी हुई उद्योग स्केलिंग रणनीतियों का खुलासा होता है।

Ivica Nikolic2026-05-29
🧬 biology

Traditional machine learning vs. deep learning from dynamic graph representations of proteins' 3D folds in the task of protein structure classification

यह अध्ययन प्रदर्शित करता है कि जबकि डायनेमिक प्रोटीन संरचना नेटवर्क पर लागू डीप लर्निंग, प्रोटीन संरचना वर्गीकरण के लिए पारंपरिक मशीन लर्निंग के समान सटीकता प्राप्त करती है, फिर भी यह काफी कम कुशल है, जो औसतन 10 गुना अधिक धीमी है।

Aydin Wells, Francis A. Gatsi, Aaron Striegel, Tijana Milenković2026-05-29
🤖 machine learning

BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference

BlockBatch एक ट्रेनिंग-फ्री इन्फरेंस फ्रेमवर्क है जो कई ब्लॉक-साइज शाखाओं को समानांतर में निष्पादित करके और उन्हें कॉन्फिडेंस-गेटेड सिंक्रोनाइज़ेशन के माध्यम से मर्ज करके डिफ्यूजन लैंग्वेज मॉडल्स को तेज़ करता है, जिससे सटीकता से समझौता किए बिना डिनोइजिंग स्टेप्स और एंड-टू-एंड स्पीड में सुधार होता है।

Xiaoyou Wu (Celine), Cheng-Jhih Shih (Celine), Binfei Ji (Celine), Yong Liu (Celine), Yingyan (Celine), Lin2026-05-29
💻 computer science

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

यह शोध पत्र डेटासेट, मॉडल और उत्पन्न सामग्री के बीच संपत्ति संरक्षण और उत्पत्ति सत्यापन की खंडित स्थिति को संबोधित करने के लिए एक व्यापक जीवनचक्र-आधारित वर्गीकरण और मूल्यांकन ढांचे का प्रस्ताव करते हुए, एलएलएम (LLM) फिंगरप्रिंटिंग और वॉटरमार्किंग तकनीकों को एकीकृत और सर्वेक्षण करने हेतु "निहित पहचान" (इम्प्लिसिट आइडेंटिटी) की अवधारणा प्रस्तुत करता है।

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo2026-05-29
🤖 machine learning

KLAS: Using Similarity to Stitch Neural Networks for Improved Accuracy-Efficiency Tradeoffs

यह शोध पत्र KLAS को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो सबसे समान मध्यवर्ती निरूपणों (intermediate representations) की पहचान करने के लिए KL डाइवर्जेंस का लाभ उठाकर प्रीट्रेंड न्यूरल नेटवर्क की स्टिचिंग को स्वचालित और अनुकूलित करता है, जिससे मौजूदा ह्यूरिस्टिक-आधारित दृष्टिकोणों की तुलना में सटीकता-दक्षता ट्रेड-ऑफ में महत्वपूर्ण सुधार होता है।

Debopam Sanyal, Anantharaman Iyer, Alind Khare, Trisha Jain, Akshay Jajoo, Myungjin Lee, Clayton Kerce, Alexey Tumanov2026-05-29