🤖 AI

Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control

यह शोध पत्र एक पदानुक्रमित बहु-एजेंट सुदृढीकरण शिक्षण ढांचा प्रस्तावित करता है जो निचले स्तर पर एक बाधा मैनिफोल्ड (constraint manifold) के माध्यम से कठोर बाधाओं को लागू करके सैद्धांतिक सुरक्षा गारंटी और स्थिर प्रशिक्षण सुनिश्चित करता है, जबकि उच्च-स्तरीय नीति शिक्षण के माध्यम से प्रभावी समन्वय सक्षम करता है, जिसके परिणामस्वरूप एक ऐसी विधि प्राप्त होती है जो लगभग पूर्ण सुरक्षा दरों और विभिन्न एजेंट एवं बाधा विन्यासों में मजबूत सामान्यीकरण के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करती है।

Zihao Guo, Jianing Zhao, Ling Li, Hao Liang, Giuseppe Loianno, Yali Du2026-06-24
🤖 AI

Reinforcement Learning Towards Broadly and Persistently Beneficial Models

यह शोध पत्र यह प्रदर्शित करता है कि स्वास्थ्य जैसे यथार्थवादी डोमेन के भीतर लाभकारी व्यवहारों पर सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) मॉडलों को प्रशिक्षित करना, उनके आउट-ऑफ-डिस्ट्रीब्यूशन संरेखण (अलाइनमेंट) में महत्वपूर्ण सुधार करता है, धोखे जैसी मिसअलाइनमेंट रणनीतियों को कम करता है, और विविध उच्च-जोखिम वाले परिवेशों में प्रतिकूल हेरफेर के विरुद्ध उनकी निरंतरता को बढ़ाता है।

Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Ka (…)2026-06-24
🤖 AI

Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

यह शोध पत्र AgenticInterpBench और HyVE फ्रेमवर्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडल एजेंट एक पुनरावृत्ति परिकल्पना-सत्यापन लूप (iterative hypothesis-validation loop) के माध्यम से पहचाने गए न्यूरल सर्किटों के लिए घटक-स्तरीय और कार्य-स्तरीय स्पष्टीकरण प्रभावी ढंग से उत्पन्न कर सकते हैं, हालांकि उनकी विश्वसनीयता वर्तमान में सत्यापन चरण में चुनौतियों के कारण सीमित है।

Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao2026-06-24
💬 NLP

Towards Version-aware Operations and Transaction Memories for Multi-layer MeMo

यह शोध पत्र MeMo भाषा मॉडलों के लिए एक वर्ज़न-अवेयर (version-aware) फ्रेमवर्क प्रस्तावित करता है जो ज्ञान अपडेट को प्रिमिटिव मेमोरी एडिट्स के संरचित, प्रतिवर्ती लेनदेन (reversible transactions) के माध्यम से प्रबंधित करने के लिए सहायक वर्ज़न और ट्रांजेक्शन कोरिलेशन मैट्रिक्स मेमोरीज का उपयोग करता है, जिससे ज्ञान परिवर्तन होने पर पूर्ण मॉडल रिट्रेनिंग की आवश्यकता कम हो जाती है।

Peiran Li2026-06-24
🔬 applied physics

Rapid FinFET Modelling Using an Autoencoder

यह शोध पत्र एक ऑटोएनकोडर का उपयोग करने वाले एक मशीन लर्निंग फ्रेमवर्क प्रस्तुत करता है जो कैलिब्रेटेड I-V डेटा को कम-आयामी लेटेंट स्पेस में संकुचित करके FinFETs को कुशलतापूर्वक मॉडल करता है, जिससे न्यूनतम प्रशिक्षण डेटा के साथ डिवाइस विशेषताओं के तीव्र और सटीक पुनर्निर्माण तथा प्रमुख मेट्रिक्स के निष्कर्षण को सक्षम बनाया जा सके।

Amit Sarkar Suman Sau, Swagata Mandal2026-06-24
🤖 AI

Ensemble Feature Selection and Harris Hawks Optimization for Explainable Mental Health Risk Prediction in Female Sex Workers

यह शोध पत्र एक हाइब्रिड मशीन लर्निंग मॉडल प्रस्तावित करता है जो एन्सेम्बल फीचर सिलेक्शन, हैरिस हॉक्स ऑप्टिमाइज़ेशन-ट्यून्ड लॉजिस्टिक रिग्रेशन और एक्सप्लेनेबल एआई को संयोजित करता है ताकि महिला यौन कर्मियों में अवसाद की सटीक भविष्यवाणी की जा सके, जिसने लक्षित मनोसामाजिक हस्तक्षेपों को सक्षम करने के लिए प्रमुख आघात-संबंधी जोखिम कारकों की पहचान करते हुए 95.78% सटीकता प्राप्त की है।

Ahnaf Atef Choudhury, Md. Parvej Hoque Palash, Shahriar Siddique Ayon, Ramkrishna Saha, Abdullah Al Mamun2026-06-24
🤖 AI

Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning

यह शोधपत्र स्ट्रैटेजी-गाइडेड पॉलिसी ऑप्टिमाइज़ेशन (SGPO) प्रस्तुत करता है, जो एक नवीन ढांचा है जो टोकन-लेवल फॉरवर्ड-KL उद्देश्यों और एडेप्टिव वेटिंग के माध्यम से सशक्त मॉडलों से पुन: प्रयोज्य समस्या-समाधान रणनीतियों को डिस्टिल करके LLM तर्क क्षमता को बढ़ाता है, जिससे यह गणितीय बेंचमार्क पर पारंपरिक ट्राजेक्टरी इमिटेशन और अन्य बेसलाइनों से बेहतर प्रदर्शन करता है।

Tianyuan Shi, Canbin Huang, Bei Li, Xin Chen, Xiaojun Quan, Jingang Wang, Qifan Wang2026-06-24
🤖 AI

PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

PixJail एक स्व-विकसित (self-evolving) एजेंट फ्रेमवर्क है जो टेक्स्ट-टू-इमेज जेलब्रेक पेपर्स के निष्पादन योग्य मूल्यांकन पाइपलाइनों (executable evaluation pipelines) में पुनरुत्पादन को स्वचालित करता है, जिससे मूल परिणामों को निष्ठापूर्वक पुनर्प्राप्त करने और पुन: प्रयोज्य आर्टिफैक्ट्स के मेमोरी बैंक को बनाए रखने के माध्यम से विश्वसनीय, निष्पक्ष और कुशल बेंचमार्किंग सक्षम होती है।

Leyi Sheng, Han Sun, Zhen Sun, Yuntao Yue, Jinlin Wu, Xinlei He, Jiaheng Wei2026-06-24
💬 NLP

CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

"केववुमन" (Cavewoman) अध्ययन यह प्रकट करता है कि जबकि मॉडल के आउटपुट को कंप्रेस करना इन्फरेंस लागत को काफी कम कर सकता है, उपयोगकर्ता के इनपुट को कंप्रेस करना प्रतिगामी है, क्योंकि यह मॉडल को लंबे उत्तर उत्पन्न करने के लिए मजबूर करता है जो शुद्ध लागत को बढ़ाते हैं और सटीकता को कम करते हैं।

Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt2026-06-24
🤖 AI

DynaWM: Dynamics-Aware Distillation with World Model and Momentum Targets for Smooth Locomotion over Continuous Stairs

यह शोध पत्र DynaWM प्रस्तुत करता है, जो एक डायनेमिक्स-अवेयर डिस्टिलेशन फ्रेमवर्क है जो टेरेन रिप्रजेंटेशन को बढ़ाने और नॉलेज ट्रांसफर को स्थिर करने के लिए एक वर्ल्ड मॉडल रेगुलराइज़र और मोमेंटम टारगेट एनकोडिंग को जोड़ता है, जिससे द्विपाद-पहिए वाले (bipedal-wheeled) रोबोट निरंतर सीढ़ियों पर सुचारू और अनुकूलन योग्य लोकोमोशन प्राप्त कर सकते हैं।

Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang2026-06-24