🤖 machine learning

Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

यह शोध पत्र यह प्रदर्शित करता है कि LLM एजेंट फीडबैक लूप में मूल्यांकनकर्ता के निर्णयों पर प्रायिकता अंशांकन (probability calibration) लागू करना प्रभावी रूप से मूल्यांकनकर्ता प्राथमिकता युग्मन (evaluator preference coupling) को कम करता है, जो मानक बाइनरी फीडबैक विधियों की तुलना में युग्मन गुणांक और वितरण विचलन (distributional divergence) दोनों को महत्वपूर्ण रूप से कम करता है।

Zewen Liu2026-07-01
🤖 machine learning

Mixture-of-Control: State-Aware Fine-Tuning for Transformer-based Models

यह शोध पत्र 'मिक्सचर-ऑफ-कंट्रोल' (MoC) को प्रस्तुत करता है, जो एक हल्का फाइन-ट्यूनिंग फ्रेमवर्क है जो ब्लॉक-वाइज कंट्रोल स्टेट्स को एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स प्रक्रिया में विशेषज्ञों के रूप में मानकर ट्रांसफॉर्मर्स के लिए स्टेट-आधारित अनुकूलन को बढ़ाता है, जिससे मेमोरी या कम्प्यूटेशनल दक्षता से समझौता किए बिना कुशल क्रॉस-ब्लॉक संचार और श्रेष्ठ रिप्रेजेंटेशन लर्निंग सक्षम होती है।

Duc Anh Nguyen, Tien Ngoc Luu, Tung Pham, Toan Tran2026-07-01
💬 NLP

Linguistic Bias Mitigation for Spoofing Detection via Gradient Reversal and A Variational Information Bottleneck

यह शोधपत्र एक भाषाई-अपरिवर्तनीय (linguistic-invariant) स्पूफिंग डिटेक्शन फ्रेमवर्क प्रस्तावित करता है जो भाषाई पूर्वाग्रह को कम करने के लिए ग्रेडिएंट रिवर्सल और एक वेरिएशनल इंफॉर्मेशन बॉटलनेक के साथ टीचर-स्टूडेंट एडवर्सरियल लर्निंग दृष्टिकोण को जोड़ता है, जिससे नौ डेटासेट्स में बेसलाइन्स की तुलना में इक्वल एरर रेट (Equal Error Rate) में 36.2% की सापेक्ष कमी प्राप्त होती है।

Anh-Tuan Dao, Driss Matrouf, Mickael Rouvier, Nicholas Evans2026-07-01
🤖 AI

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

यह शोध पत्र Hard-Routed MoR-LoRA का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो एक हल्के राउटर का उपयोग करके स्वतंत्र रूप से प्रशिक्षित फ्रोजन रीजनिंग LoRA विशेषज्ञों को कंपोज़ करता है, जो हार्ड टॉप-1 रूटिंग के माध्यम से प्रति टोकन ठीक एक विशेषज्ञ का चयन करता है, जिससे विशेषज्ञों के मूल यूनिट-स्केल एडिटिव अपडेट को सुरक्षित रखते हुए सॉफ्ट-रूटिंग बेसलाइन की तुलना में काफी कम प्रशिक्षण योग्य पैरामीटरों की आवश्यकता होती है।

Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari2026-07-01
🤖 machine learning

Zero-Shot Quantization for Object Detectors using Off-the-Shelf Generative Models

यह शोध पत्र GoodQ को प्रस्तुत करता है, जो ऑब्जेक्ट डिटेक्टरों के लिए एक ज़ीरो-शॉट क्वांटिज़ेशन फ्रेमवर्क है जो मल्टी-इंस्टेंस जनरेशन, क्लास डिस्ट्रीब्यूशन इम्बैलेंस और सूडो-लेबल नॉइज़ की चुनौतियों से निपटने के लिए विशेष रणनीतियों के साथ ऑफ-द-शेल्फ जेनरेटिव मॉडल्स का लाभ उठाता है, जिससे मूल प्रशिक्षण डेटा तक पहुँच के बिना लो-बिट और एक्सट्रीम बिट-विड्थ क्वांटिज़ेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Hyunho Lee, Kyomin Hwang, Hyeonjin Kim, Suyoung Kim, Sunghyun Wee, Nojun Kwak2026-07-01
🤖 machine learning

TabPATE: Differentially Private Tabular In-Context Learning Without Public Data

यह शोध पत्र TabPATE को प्रस्तुत करता है, जो एक विभेदक रूप से निजी (differentially private) ढांचा है टैबुलर इन-कॉन्टेक्स्ट लर्निंग के लिए, जो बिना किसी सार्वजनिक इन-डिस्ट्रीब्यूशन डेटा की आवश्यकता के, मेंबरशिप इन्फरेंस हमलों से सुरक्षा प्रदान करने के लिए टीचर-स्टूडेंट मॉडल और फीचर रेंज या प्राइवेटाइज्ड मार्जिनल्स से उत्पन्न सिंथेटिक क्वेरीज़ का लाभ उठाता है।

Dariush Wahdany, Matthew Jagielski, Jesse C. Cresswell, Adam Dziedzic, Franziska Boenisch2026-07-01
🤖 machine learning

Fork-Think with Confidence

यह शोध पत्र "फोर्क-थिंक विद कॉन्फिडेंस" (Fork-think with confidence) को पेश करता है, जो एक नवीन तर्क प्रतिमान (reasoning paradigm) है जो कई पथों को सैंपल करने से पहले मॉडल के आत्मविश्वास के आधार पर उच्च-मूल्य वाले फोर्किंग बिंदुओं की पहचान करता है, जिससे पारंपरिक समानांतर विचार विधियों की तुलना में प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए टोकन खपत और रनटाइम को काफी कम कर दिया जाता है।

Zena Al-Khalili, Rafi Hakim, Dietrich Klakow, Ji-Ung Lee2026-07-01
📊 statistics

On the Convergence of Self-Improving Online LLM Alignment

यह शोध पत्र एक नियमित संस्करण, SAIL-RevKL का प्रस्ताव करके सेल्फ-इंप्रूविंग अलाइनमेंट (SAIL) एल्गोरिदम के लिए सैद्धांतिक अभिसरण गारंटी (theoretical convergence guarantees) की कमी को संबोधित करता है, जो पॉलीक-लोजसविक स्थिति (Polyak-Lojasiewicz condition) को संतुष्ट करने के लिए रिवर्स KL डाइवर्जेंस दंड (reverse KL divergence penalty) को शामिल करता है, जिससे लगभग रैखिक नमूना जटिलता (near-linear sample complexity) के साथ वैश्विक अभिसरण स्थापित होता है और LLM अलाइनमेंट एवं MuJoCo बेंचमार्क दोनों पर उत्कृष्ट अनुभवजन्य प्रदर्शन प्रदर्शित करता है।

Xudong Wu, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen2026-07-01
🤖 machine learning

Beyond the Expressivity-Trainability Paradox: A Dynamical Lie Algebra Perspective on Navigating Barren Plateaus in Quantum Machine Learning

यह शोध पत्र यह प्रदर्शित करके क्वांटम मशीन लर्निंग में अभिव्यंजकता-प्रशिक्षण क्षमता (expressivity-trainability) के विरोधाभास को हल करता है कि डायनेमिकल ली अल्जेब्रा (Dynamical Lie Algebra) की बाधाएं संरचनात्मक नियमितकर्ता (structural regularizers) के रूप में कार्य करती हैं, जो मॉडल क्षमता और अनुकूलन परिदृश्य ज्यामिति (optimization landscape geometry) के बीच संतुलन बनाकर बैरन प्लेटो (barren plateaus) को प्रभावी ढंग से कम करती हैं और स्केलेबल प्रशिक्षण को सक्षम करती हैं।

Kung-Ming Lan2026-07-01
⚡ electrical engineering

Improving multichannel speech enhancement through accurate room-acoustic simulations

यह शोध पत्र प्रदर्शित करता है कि उच्च-निष्ठा वाले वेव-आधारित रूम-अकॉस्टिक सिमुलेशन के साथ संवर्धित डेटासेट्स पर डीप-लर्निंग-आधारित मल्टीचैनल स्पीच एन्हांसमेंट मॉडल्स को प्रशिक्षित करने से प्रदर्शन में महत्वपूर्ण सुधार होता है, जो लोअर-फिडेलिटी ज्योमेट्रिकल अकॉस्टिक्स डेटा पर प्रशिक्षित मॉडल्स की तुलना में मीडियन वर्ड एरर रेट में 38% तक की सापेक्ष कमी प्राप्त करता है।

Georg Götz, Alessia Milo, Steinar Gu{\dh}jónsson, Daniel Gert Nielsen, Jesper Pedersen, Finnur Pind2026-07-01