🤖 machine learning

Early Adoption of Agentic Coding Tools by GitHub Projects

यह अध्ययन 2,300 GitHub रिपॉजिटरीज़ में एजेंट-जनरेटेड 25,000 से अधिक पुल रिक्वेस्ट्स का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि जहाँ एजेंटिक कोडिंग टूल्स का गहन उपयोग परियोजनाओं के एक छोटे उपसमुच्चय (subset) में केंद्रित बना हुआ है, वहीं सफल एकीकरण काफी हद तक एकल-मानव निरीक्षण मॉडलों पर निर्भर करता है और परियोजना के आकार एवं उत्पादकता के आधार पर महत्वपूर्ण रूप से भिन्न होता है।

Maliha Noushin Raida, Daqing Hou2026-07-16
🤖 machine learning

Screening of Biosecurity Features in Metagenomic Data with Evo 2 Probes

यह अध्ययन प्रदर्शित करता है कि फ्रोजन इवो 2 (Evo 2) मॉडल एक्टिवेशन्स पर प्रशिक्षित लाइटवेट लीनियर और अटेंशन प्रोब्स, मेटाजीनोमिक डेटा में उच्च सटीकता के साथ एंटीमाइक्रोबियल रेजिस्टेंस और बैक्टीरियल विरुलेंसनेस का प्रभावी ढंग से पता लगा सकते हैं, जो एक अनअसेम्बल्ड शॉर्ट रीड्स पर भी कार्य करने वाले बायोसिक्योरिटी के लिए एक तेज़, सस्ते फर्स्ट-पास स्क्रीनिंग टूल के रूप में विकल्प प्रदान करते हैं।

Jeremy Guntoro, Alexander Dack, Dylan Danno, Michaela Jančovičová, Križan Jurinović, Vanessa Smilansky2026-07-16
🤖 machine learning

MetaPerch: Learning from metadata for bioacoustics foundation models

यह शोध पत्र MetaPerch को प्रस्तुत करता है, जो एक बायोअकौस्टिक फाउंडेशन मॉडल है जो विविध ध्वनिक डोमेन और प्रजातियों के वितरण में बेहतर सामान्यीकरण करने के लिए समृद्ध, अधिक सुदृढ़ प्रजाति निरूपण सीखने हेतु रिकॉर्डिंग मेटाडेटा (जैसे स्थान और समय) को सहायक पर्यवेक्षण संकेतों के रूप में उपयोग करता है।

Mustafa Chasmai, Vincent Dumoulin, Jenny Hamer2026-07-16
🤖 machine learning

Leveraging unlabelled data for generalizable neural population decoding

यह शोध पत्र MOJO को पेश करता है, जो स्पाइक-टोकेनाइजिंग न्यूरल मॉडल्स के लिए सेल्फ-सुपरवाइज्ड मास्क ऑटोएनकोइंग को सुपरवाइज्ड लर्निंग के साथ संयोजित करने वाला एक प्रशिक्षण ढांचा है, जो यह प्रदर्शित करता है कि अनलेबल डेटा का लाभ उठाना डिकोडिंग प्रदर्शन, प्रजातियों और मोडैलिटीज के बीच सामान्यीकरण क्षमता, और व्याख्यात्मकता को महत्वपूर्ण रूप से सुधारता है, विशेष रूप से सीमित लेबल वाले डेटा वाले परिदृश्यों में।

Ximeng Mao, Nanda H. Krishna, Avery Hee-Woon Ryoo, Matthew G. Perich, Guillaume Lajoie2026-07-16
📊 statistics

Propheticus: Machine Learning Framework for the Development of Predictive Models for Reliable and Secure Software

यह शोध पत्र प्रोफेटिकस (Propheticus) को प्रस्तुत करता है, जो एक मशीन लर्निंग फ्रेमवर्क है जिसे जटिलता को कम करके और वर्कफ़्लो को सुव्यवस्थित करके विश्वसनीय और सुरक्षित सॉफ़्टवेयर के लिए भविष्य कहनेवाला मॉडल (predictive models) विकसित करने की प्रक्रिया को सरल बनाने के लिए डिज़ाइन किया गया है, जैसा कि भेद्यता (vulnerability) और ऑनलाइन विफलता भविष्यवाणी के केस स्टडीज के माध्यम से प्रदर्शित किया गया है।

João R. Campos, Marco Vieira, Ernesto Costa2026-07-15
🧬 biology

Deciphering the Language of Nature: A transformer-based language model for deleterious mutations in proteins

यह शोधपत्र MutFormer को प्रस्तुत करता है, जो एक ट्रांसफॉर्मर-आधारित मॉडल है जो मानव प्रोटीन में हानिकारक मिसेंस म्यूटेशन (missense mutations) की भविष्यवाणी करने के लिए सेल्फ-अटेंशन और कनवल्शनल परतों को संयोजित करता है, और अल्प-दूरी (short-range) एवं दीर्घ-दूरी (long-range) की अनुक्रम निर्भरताओं (sequence dependencies) को प्रभावी ढंग से कैप्चर करके मौजूदा उपकरणों के समान या बेहतर प्रदर्शन प्रदर्शित करता है।

Theodore Jiang, Li Fang, Kai Wang2026-07-15✓ Author reviewed
📊 statistics

Spectral Diffusion Processes

यह शोध पत्र स्पेक्ट्रल डिफ्यूजन प्रोसेसेज (Spectral Diffusion Processes) का परिचय देता है, जो एक ऐसा ढांचा है जो डेटा को एक कर्नेल के माध्यम से स्पेक्ट्रल डोमेन में निरूपित करके मानक परिमित-आयामी डिफ्यूजन मॉडल्स को स्टोकेस्टिक प्रक्रियाओं पर लागू करता है, जिससे वैध प्रक्रिया निरंतरता सुनिश्चित होती है और बहुविध वितरणों (multimodal distributions) तथा सशर्त नमूनाकरण (conditional sampling) की प्रभावी मॉडलिंग सक्षम होती है।

Angus Phillips, Thomas Seror, Michael Hutchinson, Valentin De Bortoli, Arnaud Doucet, Emile Mathieu2026-07-15
🤖 machine learning

Classification of integers based on residue classes via modern deep learning algorithms

यह शोध पत्र यह प्रदर्शित करता है कि अभाज्य अवशेषों (prime residues) द्वारा पूर्णांकों को वर्गीकृत करने की स्पष्ट सरलता के बावजूद, उपयुक्त फीचर इंजीनियरिंग के बिना डीप लर्निंग मॉडल, ऑटोएमएल (AutoML) प्लेटफॉर्म और लार्ज लैंग्वेज मॉडल्स विफल हो जाते हैं, जबकि फूरियर सीरीज़ बेस वेक्टर्स (Fourier series basis vectors) पर लीनियर रिग्रेशन का उपयोग करने वाली एक विधि सफल होती है, जो आधुनिक मशीन लर्निंग में फीचर इंजीनियरिंग के निरंतर महत्वपूर्ण महत्व को रेखांकित करती है।

Da Wu, Jingye Yang, Mian Umair Ahsan, Kai Wang2026-07-15
💬 NLP

Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models

यह अध्ययन प्रकट करता है कि जहाँ द्विदिश (bidirectional) BERT मॉडल उस "रिवर्सल कर्से" (Reversal Curse) से मुक्त हैं जो सममित तार्किक अनुमान (symmetric logical deduction) में ऑटो-रिग्रेसिव GPT मॉडलों को बाधित करता है, वहीं दोनों आर्किटेक्चर जटिल मल्टी-सेट निगमनात्मक तर्क (complex multi-set deductive reasoning) के साथ संघर्ष करते हैं, जो यह सुझाव देता है कि मॉडल का चयन बायोमेडिकल नॉलेज ग्राफ निर्माण जैसे कार्यों की विशिष्ट तार्किक मांगों के अनुरूप तैयार किया जाना चाहिए।

Da Wu, Jingye Yang, Kai Wang2026-07-15
📊 statistics

The Limits and Potentials of Local SGD for Distributed Heterogeneous Learning with Intermittent Communication

यह शोध पत्र यह प्रदर्शित करके लोकल SGD की व्यावहारिक सफलता और सैद्धांतिक सीमाओं के बीच के सैद्धांतिक अंतराल को हल करता है कि मौजूदा प्रथम-क्रम विषमता (first-order heterogeneity) धारणाएं इसके प्रभुत्व को समझाने के लिए अपर्याप्त हैं, जबकि यह भी दिखाता है कि उच्च-क्रम सुगमता (higher-order smoothness) धारणाएं कम-विषमता वाले परिवेश में मिनी-बैच SGD पर इसके सैद्धांतिक लाभ को पुनः स्थापित कर सकती हैं।

Kumar Kshitij Patel, Margalit Glasgow, Ali Zindari, Lingxiao Wang, Sebastian U. Stich, Ziheng Cheng, Nirmit Joshi, Natha (…)2026-07-15