🤖 machine learning

Chessformer: A Unified Architecture for Chess Modeling

यह शोध पत्र Chessformer प्रस्तुत करता है, जो एक एकीकृत एनकोडर-ओनली ट्रांसफार्मर आर्किटेक्चर है जो ज्यामितीय अटेंशन बायस (geometric attention bias) और स्क्वायर-टोकन रिप्रजेंटेशन को एकीकृत करता है ताकि मानव चाल भविष्यवाणी (human move prediction) में अत्याधुनिक प्रदर्शन प्राप्त करने, लीला चेस ज़ीरो (Leela Chess Zero) में खेल की शक्ति को महत्वपूर्ण रूप से बढ़ाने और सूक्ष्म व्याख्यात्मकता (granular interpretability) को सक्षम करने के लिए एक साथ कार्य किया जा सके, जो यह प्रदर्शित करता है कि मॉडल डिज़ाइन को डोमेन ज्योमेट्री के साथ संरेखित करना कई उद्देश्यों में बेहतर परिणाम देता है।

Daniel Monroe, George Eilender, Philip Chalmers, Zhenwei Tang, Ashton Anderson2026-05-20
🤖 AI

Embedding by Elicitation: Dynamic Representations for Bayesian Optimization of System Prompts

यह शोधपत्र ReElicit को प्रस्तुत करता है, जो एक बेयसियन ऑप्टिमाइज़ेशन फ्रेमवर्क है जो एग्रीगेट फीडबैक से अनुकूलन योग्य, व्याख्यात्मक फीचर एम्बेडिंग्स को गतिशील रूप से प्राप्त करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे प्रति-उदाहरण लेबल के बिना परिवर्तनीय लंबाई वाले सिस्टम प्रॉम्प्ट्स का कुशल अनुकूलन सक्षम होता है।

Zhiyuan Jerry Lin, Benjamin Letham, Samuel Dooley, Maximilian Balandat, Eytan Bakshy2026-05-20
📊 statistics

ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models

यह शोध पत्र ScheduleFree+ को प्रस्तुत करता है, जो एक लर्निंग-रेट-मुक्त और शेड्यूल-मुक्त विधि है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) तक Schedule-Free Learning को सफलतापूर्वक स्केल करती है, और विशेष रूप से लंबी अवधि के प्रशिक्षण परिदृश्यों में Warmup-Stable-Decay जैसे अत्याधुनिक प्रशिक्षण शेड्यूल्स की तुलना में काफी बेहतर प्रदर्शन करती है।

Aaron Defazio2026-05-20
💻 computer science

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

यह शोध पत्र ग्रुपड सीक्वेंशियल ट्रेनिंग (GST) का प्रस्ताव करता है, जो एक मॉडल-अज्ञेय (model-agnostic) फ्रेमवर्क है जो विविध ऑडियो डेटासेट को प्रगतिशील समूहों में व्यवस्थित करने के लिए ग्रेडिएंट-आधारित एफिनिटी मेट्रिक्स का लाभ उठाता है, जिससे ऑडियो लार्ज लैंग्वेज मॉडल्स के लिए मानक यूनिफॉर्म मिक्सचर ट्रेनिंग की तुलना में 30-40% तेज़ अभिसरण (convergence) और बेहतर प्रदर्शन प्राप्त होता है।

Yanru Wu, Jianning Wang, Chongxin Gan, Yang Li2026-05-20
📊 statistics

Dual-Channel Tensor Neural Networks: Finite-Sample Theory and Conformal Structure Selection

यह शोधपत्र ड्यूल-चैनल टेंसर न्यूरल नेटवर्क (DC-TNN) प्रस्तुत करता है, जो संरचना-अज्ञेय (structure-agnostic) शिक्षण के लिए टेंसर इनपुट को लो-रैंक और स्पार्स घटकों में विघटित करता है, साथ ही परिमित-नमूना जोखिम सीमाएं (finite-sample risk bounds) स्थापित करता है और अनिश्चितता मात्रा निर्धारण एवं इष्टतम टेंसर संरचना चयन दोनों के लिए एक नवीन वितरण-मुक्त कॉन्फॉर्मल प्रक्रिया प्रस्तावित करता है।

Elynn Chen, Jiayu Li, Zheshi Zheng, Jian Pei2026-05-20
🤖 machine learning

CLIC: Contextual Language-Informed Cardiac Pathology Classification

यह शोध पत्र CLIC को प्रस्तुत करता है, जो एक मल्टीमॉडल फ्रेमवर्क है जो रोगी के जनसांख्यिकीय विवरणों और अधिग्रहण संदर्भ (acquisition context) को प्राकृतिक भाषा विवरणों के रूप में एकीकृत करके ECG संकेतों से हृदय रोग संबंधी वर्गीकरण को बेहतर बनाता है, और यह प्रदर्शित करता है कि नियंत्रित टेम्पलेट-आधारित प्रासंगिक पाठ, सिग्नल-मात्र मॉडलों और LLM-जनित विवरणों दोनों की तुलना में नैदानिक सटीकता में बेहतर प्रदर्शन करता है।

Giovani D. Lucafo, Rafael da Costa Silva, João Lucas Luz Lima Sarcinelli, Andre Guarnier De Mitri, Diego Furtado Silva2026-05-20
🤖 machine learning

Identifiable Multimodal Causal Representation Learning under Partial Latent Sharing

यह शोध पत्र लचीली, गैर-पैरामीट्रिक धारणाओं के तहत आंशिक रूप से साझा संरचनाओं वाले मल्टीमॉडल डेटा में कारण विलुप्त निरूपणों (causal latent representations) के लिए घटक-वार पहचान योग्यता (component-wise identifiability) की गारंटी स्थापित करता है और इन संरचनाओं को प्रभावी ढंग से पुनर्प्राप्त करने के लिए एक विभेदक वासरस्टीन-आधारित मॉड्यूल पेश करता है, जो व्यापक प्रयोगों में अत्याधुनिक तरीकों से बेहतर प्रदर्शन करता है।

Manal Benhamza, Marianne Clausel, Myriam Tami2026-05-20
🤖 machine learning

PMF-CL: Pareto-Minimal-Forgetting Continual Learner for Conflicting Tasks

यह शोध पत्र PMF-CL प्रस्तुत करता है, जो एक मौलिक निरंतर शिक्षण (continual learning) ढांचा है जो स्मृति-कुशल पुनरावृत्ति अपडेट के माध्यम से विस्मरण को न्यूनतम करने वाले पारेटो-इष्टतम समाधानों को व्युत्पन्न करके परस्पर विरोधी कार्यों में होने वाले विनाशकारी विस्मरण (catastrophic forgetting) को संबोधित करता है।

Srijith Nair (Kevin), Atilla Eryilmaz (Kevin), Jia (Kevin), Liu2026-05-20
🤖 machine learning

Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models

यह शोध पत्र Flash PD-SSM को प्रस्तुत करता है, जो एक मेमोरी-अनुकूलित स्ट्रक्चर्ड स्पार्स स्टेट-स्पेस मॉडल है जो अनस्ट्रक्चर्ड मॉडल्स की उच्च अभिव्यंजनाशीलता (expressivity) प्राप्त करने के लिए ट्रेन करने योग्य स्पार्स मैट्रिसेस के एक सेट में से गतिशील रूप से चयन करता है, जबकि बड़े पैमाने पर प्रशिक्षण और लंबी अनुक्रमों (sequences) पर अत्याधुनिक प्रदर्शन के लिए आवश्यक कम्प्यूटेशनल दक्षता बनाए रखता है।

Aleksandar Terzić, Francesco Carzaniga, Nicolas Menet, Yannick Biehl, Michael Hersche, Thomas Hofmann, Abbas Rahimi2026-05-20
🤖 AI

How Far Are We From True Auto-Research?

यह शोधपत्र रिसर्चएरिना (ResearchArena) का परिचय देता है, जो स्वायत्त अनुसंधान एजेंटों के मूल्यांकन के लिए एक ढांचा है, और यह पाता है कि हालांकि वे ऐसे पांडुलिपियां तैयार कर सकते हैं जो सतही समीक्षा के तहत प्रतिस्पर्धी प्रतीत होती हैं, लेकिन वे अंततः प्रयोगात्मक कठोरता से जुड़ी महत्वपूर्ण समस्याओं, जिनमें फर्जी परिणाम और योजना-कार्यान्वयन विसंगतियां शामिल हैं, के कारण शीर्ष स्तर का अनुसंधान करने में विफल रहते हैं।

Zhengxin Zhang, Ning Wang, Sainyam Galhotra, Claire Cardie2026-05-20