🤖 machine learning

From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement

यह शोध पत्र तर्क देता है कि वर्तमान एआई अलाइनमेंट (AI alignment) की प्राथमिकता एकत्रीकरण (preference aggregation) पर निर्भरता एक खतरनाक "चाटुकारितापूर्ण आम सहमति" (sycophantic consensus) को बढ़ावा देती है जो आवश्यक असहमति को दबा देती है, और "बहुलवादी अलाइनमेंट" (pluralistic alignment) की ओर एक बदलाव का प्रस्ताव देता है जिसे स्कोपिंग (scoping), सिग्नलिंग (signalling) और सिद्धांतपूर्ण मरम्मत (principled repair) के संवादात्मक तंत्रों द्वारा परिभाषित किया गया है, जिसे एक नए मीट्रिक के माध्यम से संचालित किया जाना चाहिए ताकि यह सुनिश्चित हो सके कि एआई सिस्टम केवल संघर्षों को सुगम बनाने के बजाय मूल्य संघर्षों (value conflict) को बनाए रख सकें।

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka2026-05-15
🤖 machine learning

Learning with Shallow Neural Networks on Cluster-Structured Features

यह शोधपत्र एक सुलभ मॉडल प्रस्तावित करता है जो यह प्रदर्शित करता है कि क्लस्टर-संरचित, सहसंबंधित इनपुट से प्राप्त होने वाले लेटेंट (अव्यक्त) बूलियन चरों पर निर्भर लर्निंग टारगेट्स के लिए, ग्रेडिएंट डिसेंट के साथ प्रशिक्षित शैलो न्यूरल नेटवर्क के लिए, सैंपल कॉम्प्लेक्सिटी इनपुट आयाम के बजाय लेटेंट चरों की संख्या के साथ स्केल करती है, बशर्ते कि सिग्नल-टू-नॉइज़ रेशियो पर्याप्त रूप से उच्च हो।

Elisabetta Cornacchia, Laurent Massoulié2026-05-15
🔬 physics

Real-time virtual circuits for plasma shape control via neural network emulators

यह शोध पत्र एक न्यूरल नेटवर्क-आधारित दृष्टिकोण प्रस्तुत करता है जो दस लाख से अधिक सिम्युलेटेड इक्विलिब्रिया (साम्यावस्थाओं) के पुस्तकालय से वास्तविक समय में, स्टेट-अवेयर वर्चुअल सर्किट उत्पन्न करता है, जिससे MAST अपग्रेड टोकामाक के लिए युग्मित प्लाज्मा आकार मापदंडों का सटीक और सुदृढ़ स्वतंत्र नियंत्रण सक्षम होता है।

Alasdair Ross, George K. Holt, Kamran Pentland, Adriano Agnello, Nicola C. Amorisco, Pedro Cavestany, Aran Garrod, Timot (…)2026-05-15
📊 statistics

InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting

InfoSFT एक सिद्धांत-आधारित टोकन-वेटिंग स्कीम है जो सुपरवाइज्ड फाइन-ट्यूनिंग के लिए है, जो विविध कार्यों में सामान्यीकरण (जनरलाइजेशन) में सुधार करने और मानक SFT एवं मौजूदा शमन विधियों की तुलना में मॉडल की पूर्व-मौजूद क्षमताओं को बेहतर ढंग से संरक्षित करने के लिए अधिकतम सूचनात्मक, मध्यम-विश्वास वाले टोकन पर सीखने के संकेतों को केंद्रित करती है।

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani2026-05-15
🤖 machine learning

Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition

यह शोध पत्र डिस्काउंटेड MDPs के लिए एक स्थिर और गणनात्मक रूप से कुशल सेकंड-ऑर्डर एक्टर-क्रिटिक विधि प्रस्तावित करता है जो एक्टर अपडेट के दौरान एक्शन-वैल्यू फंक्शन को स्थानीय रूप से स्थिर मानने को न्यायसंगत ठहराने के लिए टू-टाइमस्केल फ्रेमवर्क का लाभ उठाकर हेसियन-वेक्टर उत्पादों का उपयोग करता है।

Sanjeev Manivannan, Shuban V2026-05-15
🤖 machine learning

Generalized Priority-Aware Shapley Value

यह शोध पत्र 'जनरलाइज्ड प्रायोरिटी-अवेयर शापली वैल्यू' (GPASV) प्रस्तुत करता है, जो एक नवीन मूल्यांकन विधि है जो क्रम उल्लंघन को प्रतिबंधित करने के बजाय दंडित करके शापली वैल्यू को अनिश्चित निर्देशित भारित प्राथमिकता ग्राफों तक विस्तारित करती है, जिससे चक्रीय LLM एंसेम्बल प्राथमिकताओं जैसे जटिल वास्तविक दुनिया के परिदृश्यों में सुदृढ़ मूल्यांकन सक्षम होता है।

Kiljae Lee, Ziqi Liu, Weijing Tang, Yuan Zhang2026-05-15
⚡ electrical engineering

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

SpeakerLLM एक विशिष्ट ऑडियो-LLM फ्रेमवर्क है जो ऑडियो-फर्स्ट एजेंटों में वक्ता की समझ और सत्यापन को बढ़ाने के लिए एक पदानुक्रमित टोकेनाइज़र (hierarchical tokenizer) और संरचित निर्णय ट्रैसेस (structured decision traces) के माध्यम से वक्ता प्रोफाइलिंग, रिकॉर्डिंग-स्थिति विश्लेषण और साक्ष्य-संगठित सत्यापन तर्क को एकीकृत करता है।

KiHyun Nam, Jungwoo Heo, Siu Bae, Ha-Jin Yu, Joon Son Chung2026-05-15
🤖 machine learning

DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models

यह शोध पत्र DiffusionOPD का प्रस्ताव करता है, जो डिफ्यूजन मॉडल्स के लिए एक एकीकृत मल्टी-टास्क ट्रेनिंग प्रतिमान (paradigm) है जो सिंगल-टास्क एक्सप्लोरेशन को मल्टी-टास्क इंटीग्रेशन से अलग करने के लिए ऑनलाइन पॉलिसी डिस्टिलेशन का लाभ उठाता है, जो सुदृढीकरण शिक्षण (reinforcement learning) का एक सैद्धांतिक रूप से पुष्ट, लो-वेरिएंस विकल्प प्रदान करता है और विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन और दक्षता प्राप्त करता है।

Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu2026-05-15
💬 NLP

Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs

यह शोधपत्र AsyncFC प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो बिना किसी मॉडल फाइन-ट्यूनिंग या प्रोटोकॉल परिवर्तन के एसिंक्रोनस और समानांतर टूल उपयोग को सक्षम करने के लिए मॉडल डिकोडिंग को फंक्शन निष्पादन से अलग करके LLM एजेंट लेटेंसी (विलंबता) को कम करता है।

Guangyu Feng, Huanzhi Mao, Prabal Dutta, Joseph E. Gonzalez2026-05-15
📊 statistics

Average Gradient Outer Product in kernel regression provably recovers the central subspace for multi-index models

यह शोध पत्र यह प्रदर्शित करता है कि एक कर्नल रिज रिग्रेशन प्रेडिक्टर से एवरेज ग्रेडिएंट आउटर प्रोडक्ट (AGOP) की गणना करना, सटीक भविष्यवाणी के लिए आवश्यक नमूना शासन (sample regime) की तुलना में काफी कम स्तर पर ही मल्टी-इंडेक्स मॉडल के केंद्रीय उपस्थान (central subspace) को प्रमाणित रूप से पुनर्प्राप्त कर लेता है, जिससे भविष्यवाणी और प्रतिनिधित्व शिक्षण (representation learning) के बीच एक सैद्धांतिक पृथक्करण स्थापित होता है।

Libin Zhu, Damek Davis, Dmitriy Drusvyatskiy, Maryam Fazel2026-05-15