🤖 AI

Partner-Aware Hierarchical Skill Discovery for Robust Human-AI Collaboration

यह शोध पत्र पार्टनर-अवेयर स्किल डिस्कवरी (PASD) को प्रस्तुत करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो पार्टनर के व्यवहार पर आधारित कौशल सीखने के लिए कंट्रास्टिव इंट्रिंसिक रिवार्ड्स का उपयोग करता है, जिससे शॉर्टकट लर्निंग की समस्या दूर होती है और विविध एवं नवीन पार्टनर्स के बीच सुदृढ़, अनुकूलन योग्य मानव-एआई सहयोग सक्षम होता है।

Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo2026-05-26
🤖 machine learning

Treatment Effect Estimation with Differentiated Networked Effect on Graph Data

यह शोध पत्र व्यक्तिगत उपचार प्रभावों (individual treatment effects) के अनुमान के लिए एक नवीन ग्राफ-आधारित पद्धति प्रस्तावित करता है जो आंशिक अटेंशन तंत्र (partial attention mechanisms) और एक संदेश एम्पलीफायर (message amplifier) का उपयोग करके विभेदित नेटवर्क प्रभावों (differentiated networked effects) की उपेक्षित चुनौती को स्पष्ट रूप से संबोधित करता है ताकि विभिन्न पड़ोसी महत्व और पैमानों को सटीक रूप से मॉडल किया जा सके, जिससे यह वास्तविक दुनिया के डेटासेट पर मौजूदा दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Xiaofeng Lin, Han Bao, Hisashi Kashima2026-05-26
🤖 AI

Distilling Game Code World Model Generation into Lightweight Large Language Models

यह शोध पत्र एक स्केलेबल पोस्ट-ट्रेनिंग पाइपलाइन का प्रस्ताव करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग और वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग को जोड़ता है ताकि फ्रंटियर मॉडल्स से गेम कोड वर्ल्ड मॉडल जनरेशन क्षमताओं को एक हल्के 3B-पैरामीटर वाले LLM में डिस्टिल किया जा सके, जिससे यह प्राकृतिक भाषा के नियमों से सटीक रूप से निष्पादन योग्य (executable) गेम वातावरण उत्पन्न करने में सक्षम हो सके।

Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald2026-05-26
💬 NLP

Side-by-side Comparison Amplifies Dialect Bias in Language Models

यह शोध पत्र यह प्रकट करता है कि भाषा मॉडलों में गुप्त बोली पूर्वाग्रह (dialect bias), जो अफ्रीकी-अमेरिकी वर्नाकुलर इंग्लिश (AAVE) के साथ नकारात्मक रूढ़ियों को जोड़ता है, तब काफी बढ़ जाता है जब स्टैंडर्ड अमेरिकन इंग्लिश (SAE) और AAVE ट्वीट्स की आमने-सामने तुलना की जाती है, एक ऐसा निष्कर्ष जो वर्तमान मूल्यांकन विधियों और शमन प्रयासों को चुनौती देता है।

Kritee Kondapally, Claire J. Smerdon, Pooja C. Patel, Ogheneyoma Akoni, Jevon Torres, Jaspreet Ranjit, Matthew Finlayson (…)2026-05-26
🤖 AI

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

यह शोध पत्र "प्रोग्रेसिव कॉन्फिडेंस शेपिंग" (progressive confidence shaping) प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो समयपूर्व आत्मविश्वास को दंडित करके और क्रमिक आत्मविश्वास वृद्धि को पुरस्कृत करके बड़े भाषा मॉडलों में त्रुटिपूर्ण तर्क को कम करती है, जिससे बिना किसी बाहरी लेबल या रिवॉर्ड मॉडल के विभिन्न कार्यों में सटीकता और निष्ठा में उल्लेखनीय सुधार होता है।

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan2026-05-26
🤖 machine learning

Generative OOD-regularized Model-based Policy Optimization

यह शोध पत्र जेनेरेटिव ओओडी-रेगुलराइज्ड मॉडल-बेस्ड पॉलिसी ऑप्टिमाइजेशन (GORMPO) प्रस्तुत करता है, जो एक नवीन ऑफलाइन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एल्गोरिदम है जो नीति अपडेट को उच्च-घनत्व वाले क्षेत्रों तक सीमित करने के लिए जेनेरेटिव डेंसिटी मॉडल को एकीकृत करता है, जिससे यह वास्तविक दुनिया के चिकित्सा और विरल (स्पार्स) डेटासेट पर अत्याधुनिक बेसलाइनों से बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि ओओडी (OOD) डिटेक्शन की प्रभावशीलता पर्यावरणीय गतिकी (डायनामिक्स) पर निर्भर करती है।

Aysin Tumay, Jiahe Huang, Elise Jortberg, Rose Yu2026-05-26
🤖 machine learning

Batch Normalization Amplifies Memorization and Privacy Risks

यह शोध पत्र प्रकट करता है कि बैच नॉर्मलाइजेशन (Batch Normalization), प्रशिक्षण स्थिरता के लिए लाभकारी होने के बावजूद, आउटलायर नमूनों के रटने (memorization) को महत्वपूर्ण रूप से बढ़ाता है और मेंबरशिप इन्फरेंस हमलों (membership inference attacks) के प्रति संवेदनशीलता को बढ़ाता है, जिससे डीप न्यूरल नेटवर्क में एक गंभीर, कम आंका गया गोपनीयता जोखिम उत्पन्न होता है।

Ngoc Phu Doan, Chongyan Gu, Ihsen Alouani2026-05-26
🤖 AI

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

यह शोध पत्र एड-हॉक टीमवर्क में इन-कॉन्टेक्स्ट रीइन्फोर्समेंट लर्निंग का मूल्यांकन करने के लिए ICRL4AHT बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान हिस्ट्री-कंडीशन्ड एल्गोरिदम अज्ञात भागीदारों के साथ मजबूत टेस्ट-टाइम अनुकूलन प्राप्त करने में विफल रहते हैं और अक्सर मल्टी-एजेंट सेटिंग्स में रैंडम बेसलाइन से भी खराब प्रदर्शन करते हैं।

Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian (…)2026-05-26
💬 NLP

Temporal Concept Drift in Legal Judgment Prediction: Neural Baselines Across Three Epochs of Ukrainian Court Decisions

यह अध्ययन प्रकट करता है कि यूक्रेनी अदालती निर्णयों में कानूनी भाषा भू-राजनीतिक युगों के दौरान महत्वपूर्ण टेम्पोरल कॉन्सेप्ट ड्रिफ्ट (सामयिक अवधारणा विचलन) से गुजरती है, जिससे समय में आगे बढ़ने पर मानक मॉडलों के प्रदर्शन में भारी गिरावट आती है, जबकि यह भी दर्शाता है कि क्रोनोलॉजिकल कंटीन्यूअस लर्निंग (कालानुक्रमिक निरंतर शिक्षण) और लीगल-डोमेन प्रीट्रेनिंग इस ड्रिफ्ट को प्रभावी ढंग से कम कर सकते हैं और कैटास्ट्रोफिक फॉरगेटिंग (विनाशकारी विस्मृति) को रोक सकते हैं।

Volodymyr Ovcharov2026-05-26
💻 computer science

Code2UML: Agentic LLMs with context engineering for scalable software visualization

यह शोध पत्र Code2UML प्रस्तुत करता है, जो एक एजेंटिक LLM सिस्टम है जिसमें एक नियतात्मक (deterministic) कॉन्टेक्स्ट इंजीनियरिंग लेयर है जो विभिन्न प्रोजेक्ट आकारों और प्रोग्रामिंग भाषाओं में स्थिर प्रदर्शन बनाए रखते हुए, बड़े पैमाने के सोर्स कोड रिपॉजिटरी से स्केलेबल, उच्च-गुणवत्ता वाले स्वचालित UML आरेख निर्माण को सक्षम बनाता है।

Alin-Gabriel Văduva, Anca-Ioana Andreescu, Simona-Vasilica Oprea, Adela Bâra2026-05-26