📈 economics

Failure Modes of Deep Multi-Agent RL in Asynchronous Pricing: Reproducible Triggers, Trace Diagnostics, and a Partial Fix

यह शोध पत्र निरंतर-समय मूल्य निर्धारण बाजारों में डीप मल्टी-एजेंट सुदृढीकरण शिक्षण (डीप मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग) के दो पुनरुत्पादनीय विफलता मोडों—गुप्त कार्टेल गठन और एक्टर-क्रिटिक अस्थिरता—की पहचान और विश्लेषण करता है—यह प्रदर्शित करते हुए कि अतुल्यता (एसिंक्रोनी) और अवलोकन विलंबता को पेश करने से मिलीभगत (कोल्यूजन) आंशिक रूप से कम हो जाती है, लेकिन यह प्रतिस्पर्धी मूल्य निर्धारण को पूरी तरह से बहाल करने में विफल रहता है और उच्च घटना दरों पर क्रिटिक विचलन को रोकने में सक्षम नहीं है।

Shree Murthy, Rohan Pandey2026-06-10
🤖 machine learning

SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs

SHAPE एक टास्क-ड्रिवन एक्सपर्ट प्रूनिंग फ्रेमवर्क है जो स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स (Sparse Mixture-of-Experts) LLMs के लिए है, जो इंट्रा-लेयर एक्सपर्ट को-ऑपरेशन को एक को-ऑपरेटिव गेम के रूप में मॉडल करता है ताकि शैप्ली-स्टाइल एट्रिब्यूशन (Shapley-style attribution) के माध्यम से आवश्यक सहयोगी उपसमुच्चयों (collaborative subsets) की पहचान और उन्हें बनाए रखा जा सके, जिससे बिना किसी अतिरिक्त प्रशिक्षण के सटीकता बनाए रखते हुए मेमोरी फुटप्रिंट को कम किया जा सके।

Yuhao Zhang2026-06-10
🤖 machine learning

Representation Curriculum: Stagewise Training for Robust Ranking and Allocation

यह शोध पत्र "रिप्रजेंटेशन करिकुलम" (Representation Curriculum) का प्रस्ताव करता है, जो एक चरणबद्ध प्रशिक्षण पद्धति है जो शॉर्टकट लर्निंग को कम करने के लिए एक्सपोज़र-डिपेंडेंट बिलीफ सिग्नल्स (exposure-dependent belief signals) को पेश करने से पहले कंटेंट-आधारित मेरिट सिग्नल्स (content-based merit signals) को प्राथमिकता देती है, जिससे रैंकिंग मजबूती और कोल्ड-स्टार्ट जनरलाइजेशन में सुधार होता है और हेड परफॉरमेंस के साथ ट्रेड-ऑफ को प्रबंधित किया जाता है।

Ehsan Ebrahimzadeh, Sina Baharlouei, Abraham Bagherjeiran2026-06-10
🤖 AI

HMAF: A Hierarchical Multi-Slot GD-RTB Allocation Framework

यह शोध पत्र HMAF का प्रस्ताव करता है, जो एक एकीकृत पदानुक्रमित ढांचा (unified hierarchical framework) है जो जटिल मल्टी-स्लॉट विज्ञापन परिवेशों में दीर्घकालिक गारंटीकृत डिलीवरी अनुबंध पूर्ति और अल्पकालिक रियल-टाइम बिडिंग राजस्व अधिकतमकरण के बीच प्रभावी ढंग से संतुलन बनाने के लिए ऑफलाइन बाधा अनुकूलन (offline constraint optimization) को ऑनलाइन लिस्टवाइज निर्णय लेने (online listwise decision-making) के साथ एकीकृत करता है, जिससे मीटुआन (Meituan) के मार्केटिंग परिदृश्यों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Tianxing Bu, Zhaoqi Zhang, Linyou Cai, Miao Xie, Shengri Xue, Tan Qu, Qianlong Xie, Xingxing Wang, Siqiang Luo, Gao Cong2026-06-10
🤖 machine learning

When Attribution Patching Lies: Diagnosis and a Second-Order Correction

यह शोध पत्र डाउनस्ट्रीम नेटवर्क में गैर-रेखीयताओं (non-linearities) को एट्रिब्यूशन पैचिंग (attribution patching) में त्रुटि के प्राथमिक स्रोत के रूप में पहचानता है और एक गणनात्मक रूप से कुशल हेसियन-वेक्टर-प्रोडक्ट (Hessian-vector-product) सुधार प्रस्तुत करता है जो विभिन्न मॉडल पैमानों पर मैकेनिस्टिक इंटरप्रिटेबिलिटी सर्किट की सटीकता और विश्वसनीयता में महत्वपूर्ण सुधार करता है।

Luyang Zhang, Jialu Wang2026-06-10
💬 NLP

Less Context, More Accuracy: A Bi-Temporal Memory Engine for LLM Agents Where a Lean Retrieved Context Beats the Full History

यह शोध पत्र एंग्राम (Engram) को पेश करता है, जो एक ओपन-सोर्स बाइटेंपोरल मेमोरी इंजन है जो एक लॉसलेस राइट पाथ को बाइटेंपोरल नॉलेज ग्राफ से कॉम्पैक्ट, प्रोवेनेंस-टैग्ड कॉन्टेक्स्ट को असेंबल करने वाली एक हाइब्रिड रीड स्ट्रैटेजी के साथ जोड़कर सटीकता और दक्षता में फुल-कॉन्टेक्स्ट बेसलाइन्स से बेहतर प्रदर्शन करता है, जिससे काफी कम टोकन का उपयोग करते हुए LongMemEval_S पर 83.6% स्कोर प्राप्त होता है।

Liuyin Wang2026-06-10
🤖 AI

The Whale That Outswam Evolution: Swarm Intelligence Maximises Memory in Connectome Reservoirs

यह अध्ययन प्रदर्शित करता है कि जैविक कनेक्टोम्स (connectomes) के एज वेट्स (edge weights) पर बायो-इंस्पायर्ड, ग्रेडिएंट-फ्री ऑप्टिमाइजेशन एल्गोरिदम—विशेष रूप से व्हेल ऑप्टिमाइजेशन एल्गोरिदम—को लागू करने से छह प्रजातियों में रिज़र्वोयर कंप्यूटिंग प्रदर्शन में महत्वपूर्ण सुधार होता है, जो यह सिद्ध करता है कि जैविक वेट वैल्यूज एक महत्वपूर्ण इंडक्टिव बायस (inductive bias) के रूप में कार्य करती हैं जिसे केवल टोपोलॉजी द्वारा प्रतिस्थापित नहीं किया जा सकता है।

Anmol Guragain, Savvas Kakalis, Juan Ignacio Godino-Llorente2026-06-10
🤖 machine learning

LongMoE: Longitudinal Multimodal Learning via Trajectory-Aware Mixture-of-Experts

LongMoE एक एकीकृत ढांचा है जो संदर्भ-जागरूक प्रतिस्थापन (context-aware imputation), आवृत्ति-डोमेन टेम्पोरल टोकनाइज़ेशन (frequency-domain temporal tokenization), और प्रक्षेपवक्र-जागरूक स्पार्स मिक्चर-ऑफ-एक्सपर्ट्स रूटिंग (trajectory-aware Sparse Mixture-of-Experts routing) को एकीकृत करके क्लिनिकल लर्निंग में मोडैलिटी की अनुपलब्धता और अनुदैर्ध्य गतिशीलता (longitudinal dynamics) की दोहरी चुनौतियों का समाधान करता है ताकि अनियमित, अपूर्ण मल्टीमॉडल विज़िट अनुक्रमों के माध्यम से सुदृढ़ रोगी-विशिष्ट मॉडलिंग सक्षम की जा सके।

Maxx Richard Rahman, Prakhar Kumar, Wolfgang Maass2026-06-10
🤖 AI

IDP-Bench: Benchmarking ability of LLMs to protect personal information in interdependent privacy contexts

यह शोध पत्र IDP-Bench प्रस्तुत करता है, जो परस्पर निर्भर गोपनीयता को संभालने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए कॉन्टेक्स्टुअल इंटीग्रिटी फ्रेमवर्क पर आधारित पहला बेंचमार्क है, जो यह प्रकट करता है कि हालांकि मॉडल डेटा सह-स्वामित्व को पहचानते हैं, वे विशिष्ट गोपनीयता मापदंडों को पहचानने और जटिल, बहु-पक्षीय संदर्भों में सूचना साझा करने की उपयुक्तता का निर्णय लेने में काफी संघर्ष करते हैं।

Ayana Hussain, Soumya Sharma, Golnoosh Farnadi, Nicholas Vincent, Héber Hwang Arcolezi, Ulrich Aïvodji2026-06-10
🤖 AI

Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization

यह शोध पत्र TS-LFO को प्रस्तुत करता है, जो एक दो-चरणीय लेटेंट फीचर ऑप्टिमाइज़ेशन हमला है जो लेटेंट डिनोइजिंग और पुनर्निर्माण के माध्यम से बाधित इनपुट-टू-लेटेंट मैपिंग को बहाल करके डिफ्यूजन-आधारित अनुकूलन (कस्टमाइजेशन) में मौजूदा कॉपीराइट सुरक्षा प्रणालियों को प्रभावी ढंग से दरकिनार करता है।

Ziang Xu, Wenbo Yu, Hongyao Yu, Hao Fang, Jiawei Kong, Bin Chen, Hao Wu, Shu-Tao Xia, Zhiyong Wu2026-06-10