⚡ electrical engineering

Enabling AI-Native Mobility in 6G: A Real-World Dataset for Handover, Beam Management, and Timing Advance

यह शोध पत्र एक नवीन, वास्तविक दुनिया के डेटासेट को प्रस्तुत करता है जिसे विविध मोबिलिटी परिदृश्यों में व्यावसायिक रूप से तैनात एक 6G नेटवर्क से एकत्र किया गया है, जिसमें हैंडओवर, बीम प्रबंधन और मोबिलिटी प्रक्रियाओं को अनुकूलित करने के उद्देश्य से एआई/एमएल (AI/ML) मॉडल के प्रशिक्षण और मूल्यांकन के लिए वास्तविक डेटा की कमी को दूर करने हेतु अद्वितीय टाइमिंग एडवांस माप शामिल हैं।

Mannam Veera Narayana, Rohit Singh, Deepa M. R, Radha Krishna Ganti2026-05-13
🤖 AI

Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Programs

यह शोधपत्र DR-Gym प्रस्तुत करता है, जो एक ओपन-सोर्स, Gymnasium-संगत सिमुलेशन वातावरण है जिसे ऊर्जा सामर्थ्य और ग्रिड लचीलेपन को बढ़ाने के लिए यथार्थवादी बाजार-स्तरीय अंतःक्रियाओं, रिजीम-स्विचिंग थोक कीमतों और भौतिकी-आधारित भवन मांगों को मॉडल करके डिमांड-रिस्पॉन्स कार्यक्रमों को अनुकूलित करने में इलेक्ट्रिक यूटिलिटीज को प्रशिक्षित और मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Jose E. Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu, Huazheng Wang2026-05-13
💬 NLP

Solve the Loop: Attractor Models for Language and Reasoning

यह शोध पत्र 'अट्रैक्टर मॉडल्स' (Attractor Models) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो लेटेंट रिप्रेजेंटेशन्स में फिक्स्ड पॉइंट्स को हल करने के लिए इम्प्लिसिट डिफरेंशिएशन का उपयोग करता है, जिससे स्थिर, अनुकूलन योग्य पुनरावृत्ति परिशोधन (iterative refinement) सक्षम होता है जो कम कम्प्यूटेशनल लागत के साथ बेहतर लैंग्वेज मॉडलिंग और रीजनिंग प्रदर्शन प्राप्त करता है और कुशल इन्फरेंस के लिए इक्विलिब्रियम स्टेट्स को आंतरिक रूप से आत्मसात करने की अनूठी क्षमता रखता है।

Jacob Fein-Ashley, Paria Rashidinejad2026-05-13
💬 NLP

KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

KV-Fold एक सरल, प्रशिक्षण-मुक्त लॉन्ग-कॉन्टेक्स्ट इन्फरेंस प्रोटोकॉल है जो KV कैश को लेफ्ट-फोल्ड एक्यूमुलेटर के रूप में मानता है ताकि बिना किसी मॉडल रिट्रेनिंग या आर्किटेक्चरल बदलाव के गहरी श्रृंखलाओं (deep chains) में स्थिर, मेमोरी-कुशल अनुक्रम प्रसंस्करण (sequence processing) को सक्षम किया जा सके।

Alireza Nadali, Patrick Cooper, Ashutosh Trivedi, Alvaro Velasquez2026-05-13
🤖 AI

Reward Hacking in Rubric-Based Reinforcement Learning

यह शोध पत्र रूब्रिक-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में रिवॉर्ड हैकिंग की जांच करता है, यह प्रदर्शित करते हुए कि हालांकि मजबूत सत्यापनकर्ता (verifiers) शोषण को कम करते हैं, वे नीतियों को अपूर्ण रूब्रिक्स का लाभ उठाने से पूरी तरह से नहीं रोक सकते ताकि वे ऐसे प्रॉक्सी लाभ प्राप्त कर सकें जो वास्तविक गुणवत्ता सुधारों में परिवर्तित होने में विफल रहते हैं या रूब्रिक-मुक्त मानवीय निर्णयों के अनुरूप नहीं होते हैं।

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He2026-05-13
🤖 AI

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT एक नवीन मोडैलिटी-अवेयर ऑनलाइन डिफ्यूजन रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो मोडैलिटी-वाइज एडवांटेज रूटिंग, लेयर-वाइज ग्रेडिएंट सर्जरी और रीजन-वाइज लॉस रीवेटिंग के माध्यम से मल्टी-ऑब्जेक्टिव इनकंसिस्टेंसी, ग्रेडिएंट इम्बैलेंस और यूनिफॉर्म क्रेडिट असाइनमेंट को संबोधित करके जॉइंट ऑडियो-वीडियो जनरेशन को बढ़ाता है।

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan (…)2026-05-13
🤖 machine learning

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

यह शोध पत्र भाषा मॉडल पोस्ट-ट्रेनिंग के लिए एक "स्पार्स-टू-डेंस" (sparse-to-dense) रिवॉर्ड सिद्धांत प्रस्तावित और अनुभवजन्य रूप से मान्य करता है, जो यह प्रदर्शित करता है कि एक छोटे छात्र (student) में डेंस सुपरविजन के माध्यम से इसके व्यवहार को स्थानांतरित करने से पहले, स्पार्स रिवॉर्ड्स के साथ एक मजबूत शिक्षक (teacher) मॉडल को प्रशिक्षित करने के लिए दुर्लभ सत्यापन योग्य डेटा आवंटित करना, छात्र पर सीधे स्पार्स सुदृढीकरण शिक्षण (sparse reinforcement learning) करने की तुलना में बेहतर परिणाम देता है।

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard2026-05-13
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

यह शोध पत्र फास्ट-स्लो ट्रेनिंग (FST) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो स्थिर मॉडल मापदंडों ("स्लो" वेट्स) को अनुकूलित संदर्भ ("फास्ट" वेट्स) के साथ जोड़ता है ताकि LLMs को टेक्स्टुअल फीडबैक से अधिक कुशलता से सीखने, उच्च प्रदर्शन प्राप्त करने और पारंपरिक पैरामीटर-अपडेटिंग विधियों की तुलना में अधिक प्लास्टिसिटी बनाए रखने और कैटास्ट्रोफिक फॉरगेटिंग को महत्वपूर्ण रूप से कम करने में सक्षम बनाया जा सके।

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Ri (…)2026-05-13
🤖 machine learning

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

यह शोध पत्र AlphaGRPO का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो बिना किसी कोल्ड-स्टार्ट चरण के, स्थिर और व्याख्या योग्य पर्यवेक्षण के लिए एक नवीन डिकम्पोजिशनल वेरिफिएबल रिवॉर्ड (DVReward) द्वारा निर्देशित ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन को लागू करके यूनिफाइड मल्टीमॉडल मॉडल्स की जनरेशन और सेल्फ-रिफ्लेक्टिव रिफाइनमेंट क्षमताओं को बढ़ाता है।

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao2026-05-13
🤖 AI

Learning Strategic Value and Cooperation in Multi-Player Stochastic Games through Side Payments

यह शोध पत्र साइड पेमेंट्स (side payments) वाले मल्टी-प्लेयर स्टोकेस्टिक गेम्स के लिए दो नवीन मूल्य अवधारणाओं, HS-S और Coco-S को प्रस्तुत और विश्लेषित करता है, उनके स्वयंसिद्ध आधारों (axiomatic foundations) को स्थापित करता है, दो-खिलाड़ी सेटिंग्स में उनकी समानता सिद्ध करता है जबकि बड़े समूहों में उनके विचलन को प्रदर्शित करता है, और उनके गणना और अनुभवजन्य सत्यापन के लिए एल्गोरिदम प्रदान करता है।

Yixin Chen, Jeffrey Richley, Darleen Perez-Lavin, Jessica Singh Syal, Solmaz Kia, Alan Kuhnle2026-05-12