🤖 AI

Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic Methods

यह शोध पत्र PAVE का प्रस्ताव करता है, जो एक क्रिटिक-केंद्रित (critic-centric) रेगुलेराइज़ेशन फ्रेमवर्क है जो पॉलिसी ऑसिलेशन्स (policy oscillations) को Q-फंक्शन की डिफरेंशियल ज्योमेट्री (differential geometry) से सैद्धांतिक रूप से जोड़कर और एक्टर में संशोधन किए बिना Q-ग्रेडिएंट वोलैटिलिटी (Q-gradient volatility) को अनुभवजन्य रूप से कम करके, एक्टर-क्रिटिक विधियों में पॉलिसी स्मूथनेस (policy smoothness) को स्थिर करता है।

Jeong Woon Lee, Kyoleen Kwak, Daeho Kim, Hyoseok Hwang2026-06-19
🤖 AI

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication

यह शोध पत्र LoRDO का प्रस्ताव करता है, जो एक वितरित प्रशिक्षण ढांचा (डिस्ट्रीब्यूटेड ट्रेनिंग फ्रेमवर्क) है जो सबस्पेस एक्सप्लोरेशन को बहाल करने के लिए एक फुल-रैंक क्वासी-हाइपरबोलिक अपडेट पेश करके लो-रैंक ऑप्टिमाइज़ेशन को विरल संचार (इन्फ्रीक्वेंट कम्युनिकेशन) के साथ एकीकृत करता है, जिससे मानक DDP प्रदर्शन के साथ लगभग समानता प्राप्त करते हुए संचार ओवरहेड को लगभग 10 गुना कम किया जा सकता है।

Andrej Jovanović, Alex Iacob, Mher Safaryan, Ionut-Vlad Modoranu, Lorenzo Sani, William F. Shen, Xinchi Qiu, Dan Alistar (…)2026-06-19
🤖 AI

Flickering Multi-Armed Bandits

यह शोध पत्र गतिशील क्रिया उपलब्धता बाधाओं के तहत अनुक्रमिक निर्णय लेने को मॉडल करने के लिए फ्लिकरिंग मल्टी-आर्म्ड बैंडिट्स (FMAB) ढांचे को प्रस्तुत करता है, जो एक दो-चरणीय लेज़ी रैंडम वॉक एल्गोरिदम का प्रस्ताव करता है जो स्टोकेस्टिक रूप से विकसित होने वाले ग्राफ वातावरण में सूचना प्राप्ति और नेविगेशन ओवरहेड के बीच संतुलन बनाकर निकट-इष्टतम उप-रैखिक रिग्रेट (sublinear regret) प्राप्त करता है।

Sourav Chakraborty, Amit Kiran Rege, Claire Monteleoni, Lijun Chen2026-06-19
🤖 AI

Reinforcement-aware Knowledge Distillation for LLM Reasoning

यह शोध पत्र RL-aware Distillation (RLAD) का प्रस्ताव करता है, जो एक विधि है जो वितरण बेमेल (distribution mismatch) और उद्देश्य हस्तक्षेप (objective interference) को दूर करने के लिए Trust Region Ratio Distillation (TRRD) ऑब्जेक्टिव के माध्यम से सुदृढीकरण शिक्षण (reinforcement learning) में चयनात्मक अनुकरण (selective imitation) को एकीकृत करती है, जिससे छोटे भाषा मॉडल अन्वेषण (exploration) और दोहन (exploitation) को संतुलित करते हुए बड़े शिक्षकों से प्रभावी ढंग से लंबी चेन-ऑफ-थॉट (chain-of-thought) तर्क क्षमताओं को विरासत में प्राप्त कर पाते हैं।

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo Yang, Zhuowen Tu, Wei Xia, Stefano Soatto2026-06-19
🤖 AI

Mitigating Legibility Tax with Decoupled Prover-Verifier Games

यह शोध पत्र एक डिकपल्ड प्रूवर-वेरिफायर गेम फ्रेमवर्क का प्रस्ताव करता है जो एक ट्रांसलेटर मॉडल को प्रशिक्षित करके "लेजिबिलिटी टैक्स" को कम करता है ताकि सॉल्वर के सही लेकिन अनचेकेबल आउटपुट्स को एक सत्यापन योग्य प्रारूप में परिवर्तित किया जा सके, जिससे सटीकता को बनाए रखते हुए जांचने की क्षमता को बढ़ाया जा सके।

Yegon Kim, Juho Lee2026-06-19
💻 computer science

Dynamic In-Group Persona Generation for Enhancing Human-AI Rapport

यह शोध पत्र अंतर-वैयक्तिक डोमेन में मानव-एआई तालमेल (रैपो) को बढ़ाने के लिए एक नवीन पद्धति प्रस्तुत और मान्य करता है, जो उपयोगकर्ता की प्राथमिक चिंताओं को साझा करते हुए पृष्ठभूमि विवरणों में भिन्न होने वाले सिंथेटिक इन-ग्रुप व्यक्तित्वों (इन-ग्रुप पर्सोना) को गतिशील रूप से उत्पन्न करती है, जिसे एक मानव-विषय अध्ययन यह दर्शाता है कि यह बेसलाइन एजेंटों की तुलना में कथित तालमेल, व्यक्तिगत प्रासंगिकता और जुड़ाव में महत्वपूर्ण सुधार करता है।

Yoonseok Oh, Inseo Jung, Jinkyu Kim, Jungbeom Lee, Minwoo Kang, Suhong Moon2026-06-19
💻 computer science

From Memorization to Creation: Evaluating the Cognitive Depth of LLM-Generated Educational Questions

यह शोध पत्र ब्लूम के वर्गीकरण (Bloom's Taxonomy) का उपयोग करते हुए विभिन्न डोमेन में शैक्षिक प्रश्न उत्पन्न करने में छह लार्ज लैंग्वेज मॉडल्स की संज्ञानात्मक गहराई का मूल्यांकन करता है, जिसमें एक हाइब्रिड मानव-एआई मूल्यांकन प्रोटोकॉल और नवीन मेट्रिक्स पेश किए गए हैं जो यह प्रदर्शित करते हैं कि कैसे सूक्ष्म-स्तरीय प्रॉम्प्टिंग रणनीतियाँ पुनरावृत्ति को महत्वपूर्ण रूप से कम कर सकती हैं और उच्च-स्तरीय सोच वाले आउटपुट को बढ़ा सकती हैं।

Xiaolong Wang, Zhe Zhao, Song Lai, Chaoli Zhang, Zijie Geng, Yu Tong, Ye Wei, Qingsong Wen2026-06-19
💻 computer science

Synthetic Resonance: A Framework for Growth-Oriented Human-AI Relationships

यह शोध पत्र "सिंथेटिक रेजोनेंस" (कृत्रिम अनुनाद) को सार्थक मानव-एआई संबंधों को समझने के एक नए ढांचे के रूप में प्रस्तुत करता है, जो उन संरचित, गतिशील अंतःक्रियात्मक प्रतिमानों के रूप में हैं जो एआई के लिए व्यक्तिपरक अनुभव या पारस्परिक जागरूकता की आवश्यकता के बिना जुड़ाव की भावना उत्पन्न करते हैं।

Richard A. Fabes (Arizona State University)2026-06-19
💻 computer science

Mitigating Anchoring Bias in LLM-Based Agents for Energy-Efficient 6G Autonomous Networks

यह शोध पत्र 6G नेटवर्क स्लाइसिंग के लिए एक नवीन स्वायत्त एजेंटिक ढांचे (autonomous agentic framework) का प्रस्ताव करता है जो एक यादृच्छिक वेइबुल-आधारित रणनीति (randomized Weibull-based strategy) और डिजिटल ट्विन एकीकरण के माध्यम से LLM-प्रेरित एंकरिंग बायस (anchoring bias) को कम करता है, जो एक हल्के 1B-पैरामीटर मॉडल का उपयोग करते हुए सख्त SLA गारंटियों को बनाए रखते हुए ऊर्जा खपत को 25% तक सफलतापूर्वक कम करता है।

Hatim Chergui, Claudia Carballo González, Farhad Rezazadeh, Merouane Debbah2026-06-19
💻 computer science

IOAH3: Importance-Driven Adaptive Spatial Partitioning

यह शोध पत्र IOAH3 को प्रस्तुत करता है, जो एक तीन-चरणीय कम्प्यूटेशनल पद्धति है जो बहु-स्रोत विशेषताओं के माध्यम से सेल महत्व को स्कोर करके और निरंतरता एवं पदानुक्रमित परिशोधन के लिए अनुकूलित करके डेटा-संचालित, अनुकूलनीय स्थानिक विभाजन का निर्माण करती है, जिससे निश्चित-ग्रिड स्थानिक एकत्रीकरण में निहित परिवर्तनीय क्षेत्रीय इकाई समस्या (modifiable areal unit problem) का समाधान होता है।

Ehsaneddin Jalilian2026-06-19