💬 NLP

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

Vision-OPD एक सेल्फ-डिस्टिलेशन फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सूक्ष्म-स्तरीय विज़ुअल समझ को बढ़ाता है, जो एक फुल-इमेज पॉलिसी को अपने स्वयं के जनरेटेड रोलआउट्स पर क्रॉप-कंडीशन्ड टीचर के बेहतर प्रदर्शन की नकल करने के लिए प्रशिक्षित करता है, जिससे मॉडल को बिना किसी बाहरी पर्यवेक्षण या टूल्स के प्रासंगिक साक्ष्य पर ध्यान केंद्रित करने के लाभों को आत्मसात करने में सक्षम बनाया जा सके।

Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu2026-05-19
💬 NLP

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

यह शोध पत्र ESI-Bench को प्रस्तुत करता है, जो OmniGibson और स्पेलके (Spelke) के मुख्य ज्ञान प्रणालियों पर निर्मित एम्बोडीड स्थानिक बुद्धिमत्ता (embodied spatial intelligence) के लिए एक व्यापक बेंचमार्क है, जो यह प्रदर्शित करता है कि सक्रिय धारणा-क्रिया लूप (active perception-action loops) छिपी हुई स्थानिक जानकारी को उजागर करने में सक्षम बनाकर निष्क्रिय अवलोकन की तुलना में काफी बेहतर प्रदर्शन करते हैं, जबकि यह भी प्रकट करते हैं कि वर्तमान मॉडल मुख्य रूप से कमजोर धारणा के कारण नहीं, बल्कि 'एक्शन ब्लाइंडनेस' (action blindness) और मेटाकॉग्निटिव अंतराल (metacognitive gaps) के कारण विफल होते हैं।

Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi2026-05-19
💬 NLP

DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention

DashAttention, α\alpha-entmax का उपयोग करके परिवर्तनीय संख्या में KV ब्लॉक्स को गतिशील रूप से चुनने के लिए एक पूर्णतः विभेदनीय (differentiable) और अनुकूलन योग्य विरल पदानुक्रमित अटेंशन (sparse hierarchical attention) तंत्र पेश करता है, जो NSA और InfLLMv2 जैसी मौजूदा विधियों की तुलना में बेहतर लॉन्ग-कॉन्टेक्स्ट मॉडलिंग सटीकता और इन्फरेंस गति प्राप्त करता है।

Yuxiang Huang, Nuno M. T. Gonçalves, Federico Alvetreti, Lei Li, Xu Han, Edoardo M. Ponti, André F. T. Martins, Marcos V (…)2026-05-19
🤖 AI

Epistemic Monte Carlo Tree Search

यह शोध पत्र एपिस्टेमिक एमसीटीएस (EMCTS) प्रस्तुत करता है, जो एक ऐसी विधि है जो स्पार्स-रिवॉर्ड (sparse-reward) वातावरणों में मानक अल्फाज़ीरो/म्यूज़ीरो (AlphaZero/MuZero) दृष्टिकोणों की तुलना में सैंपल दक्षता और अन्वेषण क्षमताओं में महत्वपूर्ण सुधार करने के लिए मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) में एपिस्टेमिक अनसर्टेन्टी (epistemic uncertainty) को एकीकृत करती है।

Yaniv Oren, Viliam Vadocz, Matthijs T. J. Spaan, Wendelin Böhmer2026-05-18
🤖 machine learning

Approximate and Weighted Data Reconstruction Attack in Federated Learning

यह शोध पत्र एक एप्रोक्सिमेट एंड वेटेड अटैक (AWA) पद्धति का प्रस्ताव करता है जो इंटरपोलेशन का उपयोग करके मध्यवर्ती मॉडल अपडेट उत्पन्न करने और पुनर्निर्माण गुणवत्ता में उल्लेखनीय सुधार करने के लिए एक बेयसियन-अनुकूलित लेयर-वार वेटेड लॉस फंक्शन का उपयोग करके हॉरिजॉन्टल फेडरेटेड एवरेजिंग (FedAvg) पर मौजूदा डेटा रिकंस्ट्रक्शन हमलों की सीमाओं को दूर करता है।

Yongcun Song, Ziqi Wang, Enrique Zuazua2026-05-18
💬 NLP

Subgraph-level Universal Prompt Tuning

यह शोध पत्र सबग्राफ-स्तरीय यूनिवर्सल प्रॉम्प्ट ट्यूनिंग (SUPT) प्रस्तुत करता है, जो एक बहुमुखी विधि है जो मौजूदा ग्राफ प्रॉम्प्ट ट्यूनिंग दृष्टिकोणों की संदर्भ सीमाओं को दूर करने के लिए सबग्राफ स्तर पर प्रॉम्प्ट विशेषताओं को असाइन करती है, जिससे काफी कम मापदंडों के साथ फुल-शॉट और फ्यू-शॉट दोनों परिदृश्यों में फाइन-ट्यूनिंग की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Junhyun Lee, Wooseong Yang, Jaewoo Kang2026-05-18
🤖 AI

Social and Ethical Risks Posed by General-Purpose LLMs for Settling Newcomers in Canada

यह शोध पत्र चेतावनी देता है कि कनाडा के सेटलमेंट क्षेत्र में सामान्य-उद्देश्य वाले लार्ज लैंग्वेज मॉडल्स का अनियंत्रित उपयोग नए आगमनकर्ताओं के लिए महत्वपूर्ण जोखिम पैदा करता है, और सुरक्षित एवं प्रभावी एकीकरण सहायता सुनिश्चित करने के लिए एआई साक्षरता कार्यक्रमों और समुदाय-संरेखित, मानव-पर्यवेक्षित एआई उपकरणों के विकास का आग्रह करता है।

Isar Nejadgholi, Maryam Molamohammadi, Samir Bakhtawar2026-05-18
🤖 machine learning

Tube Loss: A Novel Approach for Prediction Interval Estimation

यह शोध पत्र "ट्यूब लॉस" (Tube Loss) प्रस्तुत करता है, जो रिग्रेशन के लिए एक नवीन लॉस फंक्शन है जो उच्च-गुणवत्ता वाले प्रेडिक्शन इंटरवल्स का निरंतर अनुमान लगाने, घने संभाव्यता क्षेत्रों (विशेष रूप से विषम वितरणों के लिए) को कैप्चर करने हेतु समायोज्य स्थिति निर्धारण, और ग्रेडिएंट डिसेंट के माध्यम से कुशल अनुकूलन को सक्षम बनाता है, जो कर्नेल मशीनों, न्यूरल नेटवर्क और कॉन्फॉर्मल प्रेडिक्शन फ्रेमवर्क में उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

Pritam Anand, Tathagata Bandyopadhyay, Suresh Chandra2026-05-18
🤖 AI

TrainMover: An Interruption-Resilient Runtime for ML Training

TrainMover बड़े पैमाने पर ML ट्रेनिंग के लिए एक लचीला रनटाइम है जो न्यूनतम डाउनटाइम (लगभग 20 सेकंड) और व्यवधानों के दौरान शून्य मेमोरी ओवरहेड प्राप्त करने के लिए इलास्टिक और स्टैंडबाय मशीनों का लाभ उठाता है, जो मौजूदा समाधानों की तुलना में बर्बाद हुए GPU घंटों को 55% तक कम कर सकता है।

ChonLam Lao, Jiaqi Gao, Jiamin Cao, Zhipeng Zhang, Pengcheng Zhang, Jiangfei Duan, Zhilong Zheng, Yu Guan, Yichi Xu, Yon (…)2026-05-18
🤖 machine learning

Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach

यह शोध पत्र एक अर्ध-पर्यवेक्षित (semi-supervised) रिवॉर्ड शेपिंग दृष्टिकोण प्रस्तावित करता है जो ट्रजेक्टरी रिप्रजेंटेशन सीखने के लिए नवीन डेटा ऑग्मेंटेशन के माध्यम से गैर-शून्य और शून्य-रिवॉर्ड ट्रांज़िशन का लाभ उठाता है, जो एटाारी (Atari) और रोबोटिक मैनिपुलेशन जैसे विरल-रिवॉर्ड (sparse-reward) वातावरण में पर्यवेक्षित बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Wenyun Li, Wenjie Huang, Chen Sun2026-05-18