🤖 machine learning

Dynamic Expert-Guided Model Averaging for Causal Discovery

यह शोध पत्र एक गतिशील विशेषज्ञ-निर्देशित मॉडल औसत फ्रेमवर्क प्रस्तावित करता है जो विविध कारण खोज एल्गोरिदम के बीच अनिश्चितताओं को हल करने के लिए अपूर्ण विशेषज्ञों से चुनिच्छा रूप से पूछताछ करता है, जिससे एज अस्तित्व और ओरिएंटेशन के बीच अंतर करके स्वच्छ और शोर वाले दोनों प्रकार के डेटा पर प्रदर्शन में सुधार होता है।

Adrick Tench, Thomas Demeester2026-05-08
💬 NLP

LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning

LLM-AutoDP एक नवीन फ्रेमवर्क है जो संवेदनशील डेटा तक सीधी मानवीय पहुँच के बिना, मॉडल फाइन-ट्यूनिंग के लिए डेटा प्रोसेसिंग रणनीतियों को स्वचालित रूप से उत्पन्न करने और उन्हें पुनरावृत्ति (iteratively) के माध्यम से अनुकूलित करने के लिए LLM एजेंटों का लाभ उठाता है, जिससे विशेष त्वरण तकनीकों के माध्यम से उच्च-गुणवत्ता वाले परिणाम प्राप्त होते हैं और खोज समय में काफी कमी आती है।

Wei Huang, Anda Cheng, Yinggui Wang, Lei Wang, Tao Wei2026-05-08
📊 statistics

Fast and Efficient Gossip Algorithms for Robust and Non-smooth Decentralized Learning

यह शोध पत्र AsylADMM को प्रस्तुत करता है, जो एक नवीन एसिंक्रोनस गॉसिप एल्गोरिदम है जो केवल प्रति नोड दो वेरिएबल्स की आवश्यकता के साथ नॉन-स्मूथ ऑब्जेक्टिव्स के लिए सुदृढ़, मेमोरी-कुशल विकेंद्रीकृत शिक्षण को सक्षम बनाता है, जिससे मौजूदा विधियों की स्केलेबिलिटी सीमाओं को पार करते हुए क्वांटाइल एस्टिमेशन और रोबस्ट रिग्रेशन जैसे चुनौतीपूर्ण कार्यों पर बेहतर अभिसरण (convergence) प्रदर्शित किया गया है।

Anna van Elst, Igor Colin, Stephan Clémençon2026-05-08
🤖 machine learning

Theoretically Optimal Attention/FFN Ratios in Disaggregated LLM Serving

यह शोध पत्र एक विश्लेषणात्मक ढांचे और एक क्लोज्ड-फॉर्म प्रोविजनिंग नियम को प्रस्तुत करता है ताकि डिसैग्रिगेटेड (disaggregated) LLM सर्विंग में सैद्धांतिक रूप से इष्टतम अटेंशन-टू-एफएफएन (Attention-to-FFN) संसाधन अनुपात निर्धारित किया जा सके, जो डिवाइस के आइडल टाइम और स्टेप-लेवल ब्लॉकिंग को कम करने के लिए स्टोकेस्टिक वर्कलोड डायनेमिक्स और सिंक्रोनाइज़ेशन ओवरहेड्स को ध्यान में रखता है।

Chendong Song, Meixuan Wang, Hang Zhou, Hong Liang, Yuan Lyu, Zixi Chen, Yuwei Fan, Zijie Zhou2026-05-08
💬 NLP

Leviathan: Decoupling Input and Output Representations in Language Models

यह शोध पत्र लेविआथन (Leviathan) का परिचय देता है, जो एक ट्रांसफॉर्मर आर्किटेक्चर है जो मानक टाइड एम्बेडिंग मैट्रिक्स (tied embedding matrix) को एक सीखे हुए एम्बेडिंग वेक्टराइजेशन (learned embedding vectorization - LEV) से बदलकर इनपुट और आउटपुट रिप्रजेंटेशन को अलग करता है, जिससे न्यूनतम पैरामीटर ओवरहेड के साथ भाषा मॉडलिंग प्रदर्शन और डाउनस्ट्रीम बेंचमार्क में महत्वपूर्ण सुधार प्राप्त होता है।

Reza T. Batley, Sourav Saha2026-05-08
🔢 mathematics

SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing

यह योगदान सांख्यिकीय सदस्यता अनुमान (Statistical Membership Inference - SMI) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ऑडिटिंग फ्रेमवर्क है जो मॉडल विस्मरण (model forgetting) के सत्यापन को गैर-सदस्य मिश्रण अनुपातों (non-member mixture proportions) के अनुमान की समस्या के रूप में पुनर्गठित करके पारंपरिक सदस्यता अनुमान हमलों की मौलिक सीमाओं और कम्प्यूटेशनल ओवरहेड को दूर करता है, जिससे सैद्धांतिक गारंटियों के साथ अधिक विश्वसनीय और कुशल प्रदर्शन मूल्यांकन सक्षम होता है।

Jialong Sun, Zeming Wei, Jiaxuan Zou, Jiacheng Gong, Jie Fu, Chengyang Dong, Heng Xu, Jialong Li, Bo Liu2026-05-08
🤖 machine learning

Parity, Sensitivity, and Transformers

यह शोध पत्र संवेदनशीलता संबंधी बाधाओं के कारण यह सिद्ध करते हुए इस खुले प्रश्न का समाधान करता है कि क्या एक-परत वाले ट्रांसफॉर्मर PARITY कार्य को कंप्यूट कर सकते हैं कि वे ऐसा नहीं कर सकते, और साथ ही एक व्यावहारिक चार-परत वाले ट्रांसफॉर्मर निर्माण को प्रस्तुत करता है जो लंबाई-निर्भर पोजीशनल एनकोडिंग या हार्डमैक्स जैसे पहले से आवश्यक अव्यवहारिक अनुमानों पर निर्भर किए बिना PARITY को हल करता है।

Alexander Kozachinskiy, Tomasz Steifer, Przemysław Wał\cega2026-05-08
🤖 AI

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

यह शोध पत्र VeriTime को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो प्रोसेस-वेरिफिएबल (प्रक्रिया-सत्यापनीय) चेन-ऑफ-थॉट डेटा को संश्लेषित करके, एक सिद्धांतपूर्ण डेटा शेड्यूलिंग तंत्र को लागू करके, और अनुकूलित दो-चरणीय सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) को लागू करके टाइम सीरीज़ रीजनिंग के लिए लार्ज लैंग्वेज मॉडल्स को उन्नत करता है, जिससे कॉम्पैक्ट मॉडल्स बड़े प्रोप्रायटरी सिस्टम के प्रदर्शन के बराबर या उससे अधिक प्रदर्शन करने में सक्षम होते हैं।

Jiahui Zhou, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Lin Li, Zhuomin Chen, Jian Lou, See-Kiong Ng2026-05-08
🤖 AI

Latent Generative Solvers for Generalizable Long-Term Physics Simulation

लेटेंट जेनरेटिव सॉल्वर (LGS), एक साझा लेटेंट मैनिफोल्ड, सेल्फ-कंडीशनिंग और इनपुट नॉइज़ के साथ एक फ्लो-मैचिंग ट्रांसफॉर्मर को संयोजित करके बारह अलग-अलग PDE परिवारों में सामान्यीकरण योग्य और स्थिर दीर्घकालिक भौतिक सिमुलेशन प्राप्त करता है, जिससे यह मल्टी-स्टेप सटीकता में नियत बेसलाइन मॉडलों से काफी बेहतर प्रदर्शन करता है और साथ ही गणनात्मक लागतों को भी भारी रूप से कम करता है।

Zituo Chen, Sili Deng2026-05-08
🤖 AI

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

यह शोध पत्र विजुअल पैरा-थिंकर (Visual Para-Thinker) को प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए पहला समानांतर तर्क ढांचा (parallel reasoning framework) है, जो विविध और कुशल दृश्य समझ प्राप्त करने के लिए विजुअल पार्टिशनिंग (visual partitioning), पा-अटेंशन (Pa-Attention) और एलपीआरओपीई (LPRoPE) का लाभ उठाकर पारंपरिक वर्टिकल स्केलिंग की अन्वेषण सीमाओं को दूर करता है।

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan2026-05-08