💬 NLP

Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

यह शोधपत्र म्यूचुअल रीइन्फोर्समेंट लर्निंग (Mutual Reinforcement Learning) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विषम भाषा मॉडलों (heterogeneous language models) को एक साझा सबस्ट्रेट (substrate) और टोकेनाइज़र एलाइनमेंट लेयर के माध्यम से टाइप किए गए अनुभवों को समवर्ती रूप से आदान-प्रदान करने में सक्षम बनाता है, यह प्रदर्शित करते हुए कि डेटा-स्तर या वैल्यू-स्तर की साझाकरण रणनीतियों की तुलना में आउटकम-स्तर (outcome-level) का सफलता स्थानांतरण सबसे अनुकूल स्थिरता-समर्थन व्यापार-संतुलन (stability-support trade-off) प्रदान करता है।

Xiaoze Liu, Dhananjay Ram, Yuting Zhang, Zhaoyang Zhang, Wei Xia, Stefano Soatto2026-05-11
🤖 AI

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

यह शोधपत्र ChemCost को प्रस्तुत करता है, जो पहचान स्थापित करने, आपूर्तिकर्ता उद्धरणों (supplier quotes) को प्राप्त करने और अंकगणित करने के माध्यम से रासायनिक अभिक्रिया लागतों का अनुमान लगाने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए एक कठोर बेंचमार्क है, जो यह प्रकट करता है कि भंगुर पार्सिंग (brittle parsing), अप्रभावी साक्ष्य एकीकरण और खराब शोर मजबूती (noise robustness) के कारण उन्नत एजेंट भी इस कार्य में संघर्ष करते हैं।

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang (…)2026-05-11
⚡ electrical engineering

Resource-Element Energy Difference for Noncoherent Over-the-Air Federated Learning

यह शोध पत्र रिसोर्स-एलिमेंट एनर्जी डिफरेंस (REED) को प्रस्तुत करता है, जो ओवर-द-एयर फेडरेटेड लर्निंग के लिए एक नॉनकोहेरेंट एग्रीगेशन प्रिमिटिव है जो हस्ताक्षरित अपडेट्स को ऑर्थोगोनल रिसोर्स एलिमेंट्स में मैप करके इंस्टेंटेनियस चैनल स्टेट इंफॉर्मेशन की आवश्यकता को समाप्त करता है, जिससे डेटा विषमता के तहत सिद्ध अभिसरण दरों और सुदृढ़ प्रदर्शन के साथ निष्पक्ष एग्रीगेशन प्राप्त होता है।

Hao Chen, Zavareh Bozorgasl2026-05-11
🤖 AI

From Clouds to Hallucinations: Atmospheric Retrieval Hijacking in Remote Sensing Vision-Language RAG

यह शोधपत्र क्लाउडवेब (CloudWeb) को प्रस्तुत करता है, जो पहला वायुमंडलीय रिट्रीवल हाइजैकिंग हमला (atmospheric retrieval hijacking attack) है जो अनुकूलित क्लाउड और हेज़ पैटर्न के साथ रिमोट सेंसिंग छवियों को सूक्ष्म रूप से संशोधित करता है ताकि मल्टीमॉडल आरएजी (RAG) सिस्टम को अप्रासंगिक मौसम-संबंधी साक्ष्य खोजने के लिए मजबूर किया जा सके, जिससे अंततः उत्पन्न प्रतिक्रियाओं में डाउनस्ट्रीम मतिभ्रम (hallucinations) और सिमेंटिक शिफ्ट (semantic shifts) उत्पन्न होते हैं।

Jiaju Han, Chao Li, Chengyin Hu, Qike Zhang, Xuemeng Sun, Xin Wang, Fengyu Zhang, Xiang Chen, Yiwei Wei, Jiahuan Long, J (…)2026-05-11
🤖 AI

Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair

यह शोध पत्र कमजोर-फीडबैक वाले एजेंटिक कोड रिपेयर (agentic code repair) में GRPO के लिए एक सिग्नल रीशेपिंग फ्रेमवर्क प्रस्तावित करता है जो लेयर्ड आउटकम रिवार्ड्स (layered outcome rewards), स्टेप-लेवल प्रोसेस स्कोर्स (step-level process scores) और फेलियर-कॉज़-अवेयर रोलआउट गवर्नेंस (failure-cause-aware rollout governance) को संयोजित करता है ताकि मानक बाइनरी रिवार्ड्स या टोकन-लेवल डिस्टिलेशन की तुलना में सिमेंटिक सटीकता और दक्षता में महत्वपूर्ण सुधार किया जा सके।

Jia Li, Yuxin Su, Ting Peng, Hailiang Huang, Yuetang Deng, Michael R. Lyu2026-05-11
🤖 machine learning

Bifurcation Models: Learning Set-Valued Solution Maps with Weight-Tied Dynamics

यह शोधपत्र द्विभाजन मॉडल (bifurcation models) प्रस्तुत करता है, जो एक वेट-टाइड डायनामिकल फ्रेमवर्क है जो एक एकल मनमाने ब्रांच के बजाय एक अट्रैक्टर लैंडस्केप को प्रदर्शित करके सेट-वैल्यूड सॉल्यूशन मैप्स सीखता है, जिससे मैनुअल सेलेक्टर्स की अनियमितता से बचा जा सके और फ्रस्ट्रेटेड आइसिंग मॉडल्स जैसी समस्याओं के लिए कई वैध इक्विलिब्रिया की खोज करने में बेहतर प्रदर्शन प्रदर्शित किया जा सके।

Caleb Jore, Jialin Liu2026-05-11
🤖 machine learning

Mask2Cause: Causal Discovery via Adjacency Constrained Causal Attention

Mask2Cause एक एंड-टू-एंड डीप लर्निंग फ्रेमवर्क है जो टाइम सीरीज़ फोरकास्टिंग के दौरान सीधे कॉज़ल ग्राफ को रिकवर करने के लिए एडजसेंसी-कंस्ट्रेंड मास्क्ड अटेंशन और इनवर्टेड वेरिएबल एम्बेडिंग्स को एकीकृत करता है, जिससे मॉडल की जटिलता को काफी कम करते हुए स्टेट-ऑफ-द-आर्ट डिस्कवरी सटीकता प्राप्त होती है।

Omar Muhammad, Pasupuleti Dhruv Shivkant, Deepak N. Subramani2026-05-11
🤖 AI

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

यह शोध पत्र Sword का प्रस्ताव करता है, जो एक सुदृढ़ वर्ल्ड मॉडल फ्रेमवर्क है जो क्लोज्ड-लूप रोलआउट्स में सामान्यीकरण विफलताओं और त्रुटि संचय को कम करने के लिए स्ट्रक्चर-गाइडेड स्टाइल ऑग्मेंटेशन और डायनेमिक लेटेंट बूटस्ट्रैपिंग का उपयोग करता है, जिससे LIBERO बेंचमार्क पर विजन-लैंग्वेज-एक्शन पॉलिसियों की फिडेलिटी और रिइन्फोर्समेंट लर्निंग पोस्ट-ट्रेनिंग सफलता को महत्वपूर्ण रूप से बढ़ाया जाता है।

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen2026-05-11
🤖 AI

SOM: Structured Opponent Modeling for LLM-based Agents via Structural Causal Model

यह शोध पत्र स्ट्रक्चर्ड अपोनेंट मॉडलिंग (SOM) का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो स्ट्रक्चरल कॉज़ल मॉडल्स का लाभ उठाते हुए प्रतिद्वंद्वी प्रतिनिधित्व निर्माण को भविष्यवाणी से स्पष्ट रूप से अलग करता है, जिससे गतिशील मल्टी-एजेंट वातावरण में LLM-आधारित एजेंटों की सटीकता और अनुकूलन क्षमता में वृद्धि होती है।

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang2026-05-11
💬 NLP

MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs

यह शोध पत्र MedAction को प्रस्तुत करता है, जो एक ट्री-स्ट्रक्चर्ड डिस्टिलेशन पाइपलाइन है जो सक्रिय निदान (active diagnosis) में मौजूदा LLMs की सीमाओं को दूर करने के लिए नॉलेज-ग्राफ-ग्राउंडेड मेट्रिक्स का उपयोग करके उच्च-गुणवत्ता वाले मल्टी-टर्न क्लिनिकल डायग्नोस्टिक ट्रेजेक्टरीज उत्पन्न करता है, जिसके परिणामस्वरूप MedAction-32K डेटासेट और अत्याधुनिक ओपन-सोर्स मेडिकल मॉडल्स प्राप्त हुए हैं।

Hsin-Ling Hsu, Zizheng Wang, Donghua Zhang, Nai-Chia Chen, Jerry Wang, Jun-En Ding, Chia-Hsuan Hsu, Guoan Wang, Feng Liu (…)2026-05-11