💬 NLP

Domain Adaptation and Reasoning Frameworks in Language Models: A Controlled Experiment with Historical Cosmology

यह नियंत्रित प्रयोग प्रदर्शित करता है कि भाषा मॉडलों में डोमेन अनुकूलन (domain adaptation) मुख्य रूप से पीढ़ी के लिए उपयोग किए जाने वाले भाषाई व्याख्यात्मक ढांचों को नया आकार देता है, जिसमें ब्रह्मांड संबंधी दृष्टिकोण (cosmological stance) में परिवर्तन मॉडल के अंतर्निहित विश्वासों के प्रत्यक्ष संशोधन के बजाय इन संरचनात्मक परिवर्तनों से द्वितीयक रूप से उभरते हैं।

Francesco De Bernardis2026-06-01
🤖 machine learning

Calibrated Preference Learning: The Case of Label Ranking

यह शोध पत्र संभाव्य लेबल रैंकिंग (probabilistic label ranking) के लिए अंशांकन अवधारणाओं (calibration concepts) के एक पदानुक्रम को औपचारिक रूप से स्थापित करता है, यह प्रदर्शित करता है कि मौजूदा मॉडलों में अक्सर इस अंशांकन का अभाव होता है, और यह दर्शाता है कि अंशांकन मानक सटीकता से परे रिवॉर्ड मॉडलों (reward models) के लिए एक विशिष्ट और मूल्यवान गुणवत्ता मीट्रिक के रूप में कार्य करता है।

Santo M. A. R. Thies, Viktor Bengs, Timo Kaufmann, Sebastian J. Vollmer, Eyke Hüllermeier2026-06-01
🤖 machine learning

Scalable Constrained Multi-Agent Reinforcement Learning via State Augmentation and Consensus for Separable Dynamics

यह शोध पत्र एक स्केलेबल, वितरित मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क का प्रस्ताव करता है जो पृथक गतिकी (separable dynamics) वाले सिस्टम में वैश्विक संसाधन बाधाओं को कुशलतापूर्वक लागू करने के लिए स्टेट-ऑगमेंटेड पॉलिसी लर्निंग को लैग्रेंज मल्टीप्लायर्स पर पड़ोसी-से-पड़ोसी आम सहमति के साथ जोड़ता है, जिससे रैखिक स्केलेबिलिटी और गारंटीकृत व्यवहार्यता प्राप्त होती है जहाँ स्वतंत्र शिक्षण और केंद्रीकृत विधियाँ विफल हो जाती हैं।

Santiago Amaya-Corredor, Miguel Calvo-Fullana, Anders Jonsson2026-06-01
📊 statistics

Improved Distribution Estimation in \ell_\infty

यह शोध पत्र \ell_\infty नॉर्म के तहत डिस्क्रीट प्रोबेबिलिटी डिस्ट्रीब्यूशन को अनुमानित करने के लिए बेहतर मिनिमैक्स और हाई-प्रोबेबिलिटी बाउंड्स प्रस्तुत करता है, जो एक पूर्णतः एम्पिरिकल रिस्क बाउंड प्रदान करके, सबसे खराब स्थिति वाले एक्सट्रीमल डिस्ट्रीब्यूशन को अभिलक्षणित करके और उत्साहजनक एम्पिरिकल परिणाम प्रदर्शित करके कोंटोरोविच और पेनस्की (2025) के खुले प्रश्नोंों को हल करता है।

Doron Cohen, Aryeh Kontorovich, Yonatan Livshitz2026-06-01
💬 NLP

Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages

यह अध्ययन प्रदर्शित करता है कि LLM-जनित सिंथेटिक बहुभाषी डेटा पर फाइन-ट्यून किया गया एक टू-स्टेज क्लिनिकल कोडिंग रिट्रीवल सिस्टम, गैर-अंग्रेजी भाषाओं में इंग्लिश-प्रीट्रेन्ड बेसलाइन्स से बेहतर प्रदर्शन करता है, जो व्यापक नेटिव बायोमेडिकल प्रीट्रेनिंग के बिना डोमेन-विशिष्ट मेडिकल रिट्रीवर्स बनाने के लिए एक स्केलेबल रेसिपी प्रदान करता है।

David Rey-Blanco, Roberto Cruz2026-06-01
🤖 AI

Physically Viable World Models: A Case for Query-Conditioned Embodied AI

यह शोध पत्र तर्क देता है कि एम्बॉडीड एआई (embodied AI) के लिए भौतिक रूप से व्यवहार्य विश्व मॉडलों की आवश्यकता है जो सटीक परिणामों के लिए आवश्यक सरलतम भौतिक अमूर्तता (physical abstraction) की पहचान करके हस्तक्षेप संबंधी प्रश्नों का उत्तर देने में सक्षम हों, न कि केवल अवलोकन-अनुमानित मॉडलों पर निर्भर हों जो अक्सर भौतिक हस्तक्षेपों के तहत विफल हो जाते हैं।

Adam J. Thorpe, Stepan Tretiakov, Cheng-Hsi Hsiao, Su Ann Low, Xingjian Li, Hassan Iqbal, Neel P. Bhatt, Ufuk Topcu, Kri (…)2026-06-01
🤖 AI

Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode

यह शोध पत्र प्रकट करता है कि जहाँ फिजिकल एआई (Physical AI) का बैच-1 एलएलएम (LLM) इन्फरेंस मेमोरी-डॉमिनेटेड है, वहीं तेज़ जीपीयू (GPU) असंगत रूप से अधिक लॉन्च-साइड ओवरहेड्स से ग्रस्त होते हैं जो आनुपातिक लेटेंसी लाभ को रोकते हैं, और मानक क्वांटाइजेशन विधियाँ अक्सर अपेक्षित स्पीडअप प्राप्त करने में विफल रहती हैं जब तक कि उन्हें GPTQ+ExLlamaV2 जैसे अत्यधिक अनुकूलित कर्नेल्स के साथ जोड़ा न जाए।

Josef Chen2026-06-01
🤖 AI

Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving

यह शोध पत्र स्वायत्त ड्राइविंग के लिए एक अनिश्चितता-जागरूक सुदृढीकरण शिक्षण (अनसर्टेंटी-अवेयर रीइन्फोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो अनुकूलन योग्य अनिश्चितता थ्रेशोल्ड और एक कमिटमेंट-कूलडाउन रणनीति के आधार पर विशेषज्ञ सलाह को गतिशील रूप से ट्रिगर और विनियमित करता है, जिससे अनसिग्नल वाले चौराहों पर सुरक्षित और अधिक कुशल अन्वेषण सक्षम होता है और विशेषज्ञ मार्गदर्शन पर दीर्घकालिक निर्भरता से बचा जा सकता है।

Ahmed Abouelazm, Felix Klingebiel, Philip Schörner, J. Marius Zöllner2026-06-01
💬 NLP

ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law

यह शोध पत्र ImmigrationQA प्रस्तुत करता है, जो अमेरिकी आव्रजन नियमों से प्राप्त 17,000 से अधिक प्रश्न-उत्तर युग्मों का एक स्रोत-आधारित डेटासेट है, और यह प्रदर्शित करता है कि इस डेटा पर एक छोटे 3B-पैरामीटर वाले Llama 3.2 मॉडल को फाइन-ट्यून करने से बड़े बेस मॉडल्स की तुलना में प्रक्रियात्मक आव्रजन प्रश्नों पर इसके प्रदर्शन में काफी सुधार होता है, और वह भी कम कम्प्यूटेशनल लागत बनाए रखते हुए।

Nazarii Shportun2026-06-01
🤖 machine learning

Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents

यह शोध पत्र कॉज़ल सेंसिटिविटी स्कोर (CSS) को प्रस्तुत करता है, जो एक हस्तक्षेप संबंधी मीट्रिक (interventional metric) है जो मानक कवरेज-आधारित बेंचमार्क पर नैदानिक एआई मॉडलों के प्रदर्शन और रोगी डेटा में महत्वपूर्ण परिवर्तनों के प्रति उनकी वास्तविक प्रतिक्रियाशीलता के बीच महत्वपूर्ण विसंगतियों को प्रकट करता है, जिससे छिपी हुई क्षमता प्रोफाइल और वे सार्वभौमिक सुरक्षा ब्लाइंड स्पॉट सामने आते हैं जिन्हें पारंपरिक मूल्यांकन विधियाँ नहीं देख पाती हैं।

Matt Turk2026-06-01