🤖 AI

Distilling Game Code World Model Generation into Lightweight Large Language Models

यह शोध पत्र एक स्केलेबल पोस्ट-ट्रेनिंग पाइपलाइन का प्रस्ताव करता है जो सुपरवाइज्ड फाइन-ट्यूनिंग और वेरिफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग को जोड़ता है ताकि फ्रंटियर मॉडल्स से गेम कोड वर्ल्ड मॉडल जनरेशन क्षमताओं को एक हल्के 3B-पैरामीटर वाले LLM में डिस्टिल किया जा सके, जिससे यह प्राकृतिक भाषा के नियमों से सटीक रूप से निष्पादन योग्य (executable) गेम वातावरण उत्पन्न करने में सक्षम हो सके।

Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald2026-05-26
💬 NLP

Side-by-side Comparison Amplifies Dialect Bias in Language Models

यह शोध पत्र यह प्रकट करता है कि भाषा मॉडलों में गुप्त बोली पूर्वाग्रह (dialect bias), जो अफ्रीकी-अमेरिकी वर्नाकुलर इंग्लिश (AAVE) के साथ नकारात्मक रूढ़ियों को जोड़ता है, तब काफी बढ़ जाता है जब स्टैंडर्ड अमेरिकन इंग्लिश (SAE) और AAVE ट्वीट्स की आमने-सामने तुलना की जाती है, एक ऐसा निष्कर्ष जो वर्तमान मूल्यांकन विधियों और शमन प्रयासों को चुनौती देता है।

Kritee Kondapally, Claire J. Smerdon, Pooja C. Patel, Ogheneyoma Akoni, Jevon Torres, Jaspreet Ranjit, Matthew Finlayson (…)2026-05-26
🤖 AI

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

यह शोध पत्र "प्रोग्रेसिव कॉन्फिडेंस शेपिंग" (progressive confidence shaping) प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो समयपूर्व आत्मविश्वास को दंडित करके और क्रमिक आत्मविश्वास वृद्धि को पुरस्कृत करके बड़े भाषा मॉडलों में त्रुटिपूर्ण तर्क को कम करती है, जिससे बिना किसी बाहरी लेबल या रिवॉर्ड मॉडल के विभिन्न कार्यों में सटीकता और निष्ठा में उल्लेखनीय सुधार होता है।

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan2026-05-26
🤖 machine learning

Generative OOD-regularized Model-based Policy Optimization

यह शोध पत्र जेनेरेटिव ओओडी-रेगुलराइज्ड मॉडल-बेस्ड पॉलिसी ऑप्टिमाइजेशन (GORMPO) प्रस्तुत करता है, जो एक नवीन ऑफलाइन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) एल्गोरिदम है जो नीति अपडेट को उच्च-घनत्व वाले क्षेत्रों तक सीमित करने के लिए जेनेरेटिव डेंसिटी मॉडल को एकीकृत करता है, जिससे यह वास्तविक दुनिया के चिकित्सा और विरल (स्पार्स) डेटासेट पर अत्याधुनिक बेसलाइनों से बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि ओओडी (OOD) डिटेक्शन की प्रभावशीलता पर्यावरणीय गतिकी (डायनामिक्स) पर निर्भर करती है।

Aysin Tumay, Jiahe Huang, Elise Jortberg, Rose Yu2026-05-26
🤖 machine learning

Batch Normalization Amplifies Memorization and Privacy Risks

यह शोध पत्र प्रकट करता है कि बैच नॉर्मलाइजेशन (Batch Normalization), प्रशिक्षण स्थिरता के लिए लाभकारी होने के बावजूद, आउटलायर नमूनों के रटने (memorization) को महत्वपूर्ण रूप से बढ़ाता है और मेंबरशिप इन्फरेंस हमलों (membership inference attacks) के प्रति संवेदनशीलता को बढ़ाता है, जिससे डीप न्यूरल नेटवर्क में एक गंभीर, कम आंका गया गोपनीयता जोखिम उत्पन्न होता है।

Ngoc Phu Doan, Chongyan Gu, Ihsen Alouani2026-05-26
🤖 AI

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

यह शोध पत्र एड-हॉक टीमवर्क में इन-कॉन्टेक्स्ट रीइन्फोर्समेंट लर्निंग का मूल्यांकन करने के लिए ICRL4AHT बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान हिस्ट्री-कंडीशन्ड एल्गोरिदम अज्ञात भागीदारों के साथ मजबूत टेस्ट-टाइम अनुकूलन प्राप्त करने में विफल रहते हैं और अक्सर मल्टी-एजेंट सेटिंग्स में रैंडम बेसलाइन से भी खराब प्रदर्शन करते हैं।

Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian (…)2026-05-26
💬 NLP

Temporal Concept Drift in Legal Judgment Prediction: Neural Baselines Across Three Epochs of Ukrainian Court Decisions

यह अध्ययन प्रकट करता है कि यूक्रेनी अदालती निर्णयों में कानूनी भाषा भू-राजनीतिक युगों के दौरान महत्वपूर्ण टेम्पोरल कॉन्सेप्ट ड्रिफ्ट (सामयिक अवधारणा विचलन) से गुजरती है, जिससे समय में आगे बढ़ने पर मानक मॉडलों के प्रदर्शन में भारी गिरावट आती है, जबकि यह भी दर्शाता है कि क्रोनोलॉजिकल कंटीन्यूअस लर्निंग (कालानुक्रमिक निरंतर शिक्षण) और लीगल-डोमेन प्रीट्रेनिंग इस ड्रिफ्ट को प्रभावी ढंग से कम कर सकते हैं और कैटास्ट्रोफिक फॉरगेटिंग (विनाशकारी विस्मृति) को रोक सकते हैं।

Volodymyr Ovcharov2026-05-26
💻 computer science

Code2UML: Agentic LLMs with context engineering for scalable software visualization

यह शोध पत्र Code2UML प्रस्तुत करता है, जो एक एजेंटिक LLM सिस्टम है जिसमें एक नियतात्मक (deterministic) कॉन्टेक्स्ट इंजीनियरिंग लेयर है जो विभिन्न प्रोजेक्ट आकारों और प्रोग्रामिंग भाषाओं में स्थिर प्रदर्शन बनाए रखते हुए, बड़े पैमाने के सोर्स कोड रिपॉजिटरी से स्केलेबल, उच्च-गुणवत्ता वाले स्वचालित UML आरेख निर्माण को सक्षम बनाता है।

Alin-Gabriel Văduva, Anca-Ioana Andreescu, Simona-Vasilica Oprea, Adela Bâra2026-05-26
🤖 machine learning

Balancing Fairness, Privacy, and Accuracy: A Multitask Adversarial Framework for Centralized Data-Driven Systems

यह शोध पत्र एक नवीन मल्टीटास्क एडवर्सरियल फ्रेमवर्क प्रस्तावित करता है जो केंद्रित डेटा-संचालित प्रणालियों में निष्पक्षता, गोपनीयता और सटीकता को एक साथ अनुकूलित करता है, जो संवेदनशील विशेषताओं को छिपाते हुए कार्य-प्रासंगिक जानकारी को संरक्षित करने वाले लेटेंट रिप्रजेंटेशन (latent representations) को सीखकर, महत्वपूर्ण प्रदर्शन हानि के बिना उच्च नैतिक और गोपनीयता मानकों को प्राप्त करता है।

Imesh Ekanayake, Elham Naghizade, Jeffrey Chan2026-05-26
🤖 AI

SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent

यह शोध पत्र स्टेट-अडेप्टिव मेमोरी (SAM) का प्रस्ताव करता है, जो एक स्टैंडअलोन फ्रेमवर्क है जो इंटरैक्शन इतिहास को संक्षिप्त, इरादा-संचालित मेमोरी क्यूज़ में समेकित करके दीर्घकालिक एजेंटिक तर्क (long-horizon agentic reasoning) को बढ़ाता है, जिससे एजेंटों को अंतर्निहित मॉडल को पुन: प्रशिक्षित किए बिना दूरस्थ जानकारी को गतिशील रूप से पुनर्गठित करने की अनुमति मिलती है, और विविध बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Ziliang Zhao, Jiejun Tan, Zheng Liu, Zhicheng Dou2026-05-26