🤖 machine learning

When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

यह शोध पत्र इस पारंपरिक दृष्टिकोण को चुनौती देता है कि त्रुटि संचय (error accumulation) ऑनलाइन इमिटेशन लर्निंग की सफलता को संचालित करता है, और इसके बजाय यह प्रदर्शित करता है कि ऑफलाइन विधियों पर इसका लाभ मुख्य रूप से गैर-यथार्थता (non-realizability) द्वारा निर्धारित होता है, जहाँ ऑनलाइन इंटरेक्शन उन सूचनात्मक बाधाओं (information-theoretic bottlenecks) को दूर करता है जो मिसस्पेसिफाइड सेटिंग्स में ऑफलाइन दृष्टिकोणों द्वारा एक हॉराइजन (horizon) के स्तर पर भी हल नहीं की जा सकती हैं।

Huaqing Zhang, Jingchu Gai, Juno Kim, Bingbin Liu, Andrej Risteski2026-06-30
🤖 machine learning

Internal-State Probes Read the Situation, Not the Action: Three Negative Results for Pre-Action Misalignment Monitoring

यह शोधपत्र तीन नकारात्मक परिणाम प्रस्तुत करता है जो यह प्रदर्शित करते हैं कि वर्तमान आंतरिक-अवस्था प्रोब (internal-state probes), विशिष्ट संदर्भों में आशाजनक होने के बावजूद, एक सुदृढ़ प्री-एक्शन मिसअलाइनमेंट मॉनिटर के रूप में कार्य करने में विफल रहते हैं क्योंकि वे विश्वसनीय रूप से सामान्यीकरण और विशिष्टता परीक्षणों के माध्यम से हानिकारक भविष्य की कार्रवाइयों की भविष्यवाणी करने के बजाय मुख्य रूप से प्रॉम्प्ट निर्माण या वर्तमान प्रक्षेपवक्र को दर्शाते हैं।

Max Fomin, Elad David, Amit LeVi2026-06-30
🤖 machine learning

MuonSSM: Orthogonalizing State Space Models for Sequence Modeling

MuonSSM एक सामान्य ढांचा है जो एक मोमेंटम-आधारित पाथवे और मेमोरी अपडेट की ज्यामिति को स्पष्ट रूप से अनुकूलित करने के लिए एक हल्के न्यूटन-शुल्ज़ ट्रांसफॉर्मेशन को पेश करके लंबी-अनुक्रम मॉडलिंग के लिए स्टेट स्पेस मॉडल्स को स्थिर करता है, जिससे समानांतर स्कैन जटिलता को संरक्षित करते हुए भाषा, दृष्टि और टाइम-सीरीज कार्यों में ग्रेडिएंट प्रसार और प्रदर्शन में सुधार होता है।

Thai-Khanh Nguyen, Ngoc-Bich-Uyen Vo, Thieu N. Vo, Tan M. Nguyen, Cuong Pham2026-06-30
📊 statistics

Factorizable Normalizing Flows for parameter-dependent density morphing

यह शोध पत्र फैक्टरिजेबल नॉर्मलाइजिंग फ्लोज़ (FNFs) को प्रस्तुत करता है, जो एक स्केलेबल और व्याख्या योग्य ढांचा है जो एक निश्चित संदर्भ प्रवाह (fixed reference flow) को एक सीखने योग्य, फैक्टरिज़्ड बहुपद रूपांतरण (learnable, factorized polynomial transformation) के साथ जोड़कर पैरामीटर-निर्भर घनत्व विरूपणों को मॉडल करता है, जिससे घातीय रूप से बड़े संयुक्त पैरामीटर स्थानों के नमूनाकरण की कम्प्यूटेशनल जटिलता के बिना कुशल अनुमान सक्षम होता है।

Davide Valsecchi, Mauro Donegà, Rainer Wallny2026-06-30
📊 statistics

Doubly Robust Adaptive Conformal Inference for Causal Effects Under Temporal Dependence

यह शोध पत्र डबली रोबस्ट अडैप्टिव कॉन्फॉर्मल इन्फरेंस (DR-ACI) का प्रस्ताव करता है, जो एक नवीन विधि है जो टेम्पोरल डिपेंडेंस (सामयिक निर्भरता) की उपस्थिति में डबली रोबस्ट सूडो-आउटकम्स के लिए वैध प्रेडिक्शन इंटरवल्स का निर्माण करती है।

Andreas Koukorinis, Ricardo Silva2026-06-30
🤖 machine learning

Muon learns balanced solutions in matrix factorization without slow saddle-to-saddle dynamics

यह शोध पत्र यह प्रदर्शित करता है कि म्यूऑन (Muon) ऑप्टिमाइज़र धीमी सैडल-टू-सैडल (saddle-to-saddle) गतिशीलता से बचकर मैट्रिक्स फैक्टराइजेशन को तेज़ करता है, उच्च लर्निंग रेट के साथ स्थिर प्रशिक्षण सक्षम करता है, और विशिष्ट संरक्षित मात्राओं (conserved quantities) एवं तीव्र भार संरेखण (weight alignment) के माध्यम से संतुलित समाधान प्राप्त करता है।

Mark Rhee, Jamie Simon, Dhruva Karkada2026-06-30
⚛️ quantum physics

Bridging the NISQ and Fault-Tolerant Regimes: Generative-ML-Assisted Quantum Selected CI for Molecular Simulations

यह शोध पत्र एक हाइब्रिड क्वांटम-क्लासिकल वर्कफ़्लो पेश करता है जो LCNot-UCCSD इनिशियलाइज़ेशन और एक रिस्ट्रिक्टेड बोल्ट्ज़मैन मशीन-आधारित जनरेटिव मॉडल (QSCI-RBM) को संयोजित करता है ताकि शोर वाले इंटरमीडिएट-स्केल क्वांटम हार्डवेयर पर प्रोटीन-लिगैंड बाइंडिंग ऊर्जाओं का कुशलतापूर्वक अनुकरण किया जा सके, जो अमानटाडाइन और SARS-CoV-2 प्रोटीज जैसे उद्योग-प्रासंगिक ड्रग लक्ष्यों पर कम कम्प्यूटेशनल संसाधनों के साथ इसकी प्रभावकारिता को प्रदर्शित करता है।

Anurag K. S. V., Ashish Kumar Patra, Manas Mukherjee, Ruchika Bhat, Sai Shankar P., Rahul Maitra, Jaiganesh G2026-06-30
🤖 machine learning

TraceLab: Characterizing Coding Agent Workloads for LLM Serving

यह शोध पत्र TraceLab प्रस्तुत करता है, जो 4,300 से अधिक वास्तविक दुनिया के कोडिंग-एजेंट सत्रों का एक व्यापक डेटासेट और विश्लेषण है, ताकि लंबे स्वायत्त लूप (long autonomous loops) और विविध टूल कॉल्स जैसे अद्वितीय वर्कलोड पैटर्न को चित्रित किया जा सके, जिससे LLM सर्विंग सिस्टम को अनुकूलित करने के विशिष्ट अवसरों की पहचान की जा सके।

Kan Zhu, Mathew Jacob, Chenxi Ma, Yi Pan, Stephanie Wang, Arvind Krishnamurthy, Baris Kasikci2026-06-30
🤖 machine learning

Forensic Trajectory Signatures for Agent Memory Poisoning Detection

यह शोध पत्र LLM एजेंट प्रक्षेपवक्रों (trajectories) में एक सुदृढ़, फॉरेंसिक रूप से कार्रवाई योग्य व्यवहारिक अपरिवर्तनीयता (behavioral invariant) की पहचान करता है—विशेष रूप से निरंतर मेमोरी पॉइजनिंग के तहत डेटा एक्सफिल्ट्रेशन से पहले एक अनिवार्य मेमोरी रिट्रीवल चरण—जो विविध मॉडलों में अत्यधिक सटीक पहचान (AUC 0.9904 तक) और वास्तविक समय में ब्लॉकिंग को सक्षम बनाता है, जबकि मेमोरी-चैनल हमलों को प्रॉम्प्ट-इंजेक्शन प्रयासों से अलग करता है।

Jun Wen Leong2026-06-30
🤖 machine learning

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

यह शोध पत्र SWE-Interact को प्रस्तुत करता है, जो एक नया बेंचमार्क है जो यथार्थवादी, मल्टी-टर्न, उपयोगकर्ता-संचालित सॉफ्टवेयर इंजीनियरिंग कार्यों पर कोडिंग एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि पारंपरिक सिंगल-टर्न बेंचमार्क पर मजबूत प्रदर्शन प्रभावी वास्तविक दुनिया के विकास के लिए आवश्यक इंटरैक्टिव, इटरेटिव वर्कफ़्लो में विश्वसनीय रूप से परिवर्तित नहीं होता है।

Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He2026-06-30