🤖 AI

MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering

यह शोध पत्र MEnvAgent को प्रस्तुत करता है, जो एक स्केलेबल बहु-भाषी फ्रेमवर्क है जो एक मल्टी-एजेंट आर्किटेक्चर और एनवायरनमेंट पुन: उपयोग तंत्र के माध्यम से सत्यापन योग्य सॉफ्टवेयर इंजीनियरिंग वातावरण के निर्माण को स्वचालित करता है, जिससे डेटासेट की कमी को दूर किया जा सकता है और LLM एजेंटों के लिए सबसे बड़े ओपन-सोर्स पॉलीग्लॉट डेटासेट का निर्माण संभव हो पाता है।

Chuanzhe Guo, Jingjing Wu, Sijun He, Yang Chen, Zhaoqi Kuang, Shilong Fan, Bingjin Chen, Siqi Bao, Jing Liu, Hua Wu, Qin (…)2026-06-09
🤖 AI

How Hyper-Datafication Impacts the Sustainability Costs in Frontier AI

यह शोध पत्र तर्क देता है कि फ्रंटियर एआई (frontier AI) में "हाइपर-डेटाफिकेशन" (hyper-datafication) की ओर बदलाव महत्वपूर्ण पर्यावरणीय लागतों को बढ़ाता है और व्यवस्थित रूप से श्रम जोखिमों और प्रतिनिधित्व संबंधी हानियों को ग्लोबल साउथ (Global South) की ओर पुनर्वितरित करता है, जो इन स्थिरता चुनौतियों को कम करने के लिए 'डेटा प्रूफ्स' (Data PROOFS) के एक नए ढांचे का आह्वान करता है।

Sophia N. Wilson, Sebastian Mair, Mophat Okinyi, Erik B. Dam, Janin Koch, Raghavendra Selvan2026-06-09
🤖 AI

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

यह शोध पत्र KL रेगुलराइजेशन के तहत रिवॉर्ड मॉडल ऑप्टिमाइज़ेशन को एक स्टैकेलबर्ग गेम के रूप में औपचारिक रूप देता है और एक सरल रिवॉर्ड शेपिंग योजना प्रस्तावित करता है जो बेस पॉलिसी बायस को प्रभावी ढंग से कम करते हुए रिवॉर्ड हैकिंग को रोकता है, जिससे इन्फरेंस-टाइम अलाइनमेंट प्रदर्शन में महत्वपूर्ण सुधार होता है।

Haichuan Wang, Tao Lin, Lingkai Kong, Ce Li, Hezi Jiang, Milind Tambe2026-06-09
📊 statistics

Performative Learning Theory

यह शोध पत्र परफॉर्मेटिव प्रेडिक्शन्स (performative predictions) के लिए एक सांख्यिकीय शिक्षण ढांचा स्थापित करता है, जो यह सिद्ध करता है कि परिणामों को प्रभावित करने की एक मॉडल की क्षमता और उसकी सामान्यीकरण (generalize) करने की क्षमता के बीच एक मौलिक समझौता मौजूद है, जबकि यह भी प्रदर्शित करता है कि विकृत नमूनों पर पुन: प्रशिक्षण लेना विरोधाभासी रूप से सामान्यीकरण की गारंटी में सुधार कर सकता है।

Julian Rodemann, Unai Fischer-Abaigar, James Bailie, Krikamol Muandet2026-06-09
🤖 AI

Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design

यह शोध पत्र कुनलुन (Kunlun) को पेश करता है, जो बड़े पैमाने के अनुशंसा तंत्रों (recommendation systems) के लिए एक एकीकृत आर्किटेक्चर है, जो जेनरालाइज्ड डॉट-प्रोडक्ट अटेंशन (Generalized Dot-Product Attention) और हायरार्किकल सीड पूलिंग (Hierarchical Seed Pooling) जैसे निम्न-स्तरीय अनुकूलन और कम्प्यूटेशन स्किप (Computation Skip) जैसे उच्च-स्तरीय नवाचारों के माध्यम से खराब स्केलिंग दक्षता को संबोधित करके पूर्वानुमानित स्केलिंग लॉ (scaling laws) स्थापित करता है, जिससे स्केलिंग दक्षता दोगुनी हो जाती है और मेटा एड्स (Meta Ads) में महत्वपूर्ण उत्पादन प्रभाव प्राप्त होता है।

Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Y (…)2026-06-09
🤖 AI

Transforming Police-Car Swerving for Mitigating Isolated Stop-and-Go Traffic Waves: A Practice-Oriented Jam-Absorption Driving Strategy

पुलिस कार के अचानक मुड़ने (swerving) से प्रेरित होकर, यह शोध पत्र एक व्यावहारिक सिंगल-व्हीकल डबल-डिटेक्टर जैम-एब्जॉर्प्शन ड्राइविंग (SD-JAD) रणनीति प्रस्तावित करता है जो केवल दो रोडसाइड डिटेक्टरों का उपयोग करके एक परिभाषित JAD त्रिकोण का लाभ उठाकर अलग-थलग स्टॉप-एंड-गो ट्रैफिक तरंगों को प्रभावी ढंग से दबाता है, जिससे इस अवधारणा को सिद्धांत से एक व्यवहार्य यातायात प्रबंधन समाधान की ओर आगे बढ़ाया जा सके।

Zhengbing He2026-06-09
📊 statistics

On the Complexity of Offline Reinforcement Learning with QQ^\star-Approximation and Partial Coverage

यह शोध पत्र एक सूचनात्मक निचली सीमा (information-theoretic lower bound) स्थापित करके आंशिक कवरेज के तहत सैंपल-कुशल ऑफलाइन आरएल (RL) के लिए QQ^\star-रियलाइज़ेबिलिटी और बेलमैन पूर्णता (Bell-man completeness) की पर्याप्तता का नकारात्मक उत्तर प्रदान करता है, और एक सामान्य निर्णय-अनुमान ढांचे (decision-estimation framework) को प्रस्तुत करता है जो जटिलता को निर्णय और मूल्य अनुमान घटकों में विभाजित करके मौजूदा परिणामों को एकीकृत और बेहतर बनाता है।

Haolin Liu, Braham Snyder, Chen-Yu Wei2026-06-09
🤖 AI

Web Agents Should Use Typed Actions Instead of Click-Based Browsing

यह स्थिति पत्र अधिक विश्वसनीय, ऑडिट योग्य और पुनरुत्पादक एजेंटिक वेब सिस्टम बनाने के लिए भंगुर, निम्न-स्तरीय क्लिक-आधारित वेब इंटरैक्शन को टाइप किए गए "वेब क्रियाओं" (web verbs) की एक सिमेंटिक लेयर से बदलने का वकालत करता है।

Linxi Jiang, Rui Xi, Zhijie Liu, Shuo Chen, Zhiqiang Lin, Suman Nath2026-06-09
🤖 AI

2-Step Agent: A Framework for the Interaction of a Decision Maker with AI Decision Support

यह शोध पत्र "2-स्टेप एजेंट" फ्रेमवर्क पेश करता है जो यह मॉडल करता है कि कैसे तर्कसंगत निर्णय लेने वाले एमएल (ML) भविष्यवाणियों से सूचना का अनुमान लगाते हैं, और यह प्रदर्शित करता है कि आदर्श परिस्थितियों में भी, मिसअलाइन्ड (misaligned) पूर्व धारणाएं एमएल-आधारित निर्णय सहायता को डाउनस्ट्रीम परिणामों को खराब कर सकती हैं।

Otto Nyberg, Fausto Carcassi, Davide Tugnoli, Giovanni CinÃ2026-06-09
🤖 AI

When Tabular Foundation Models Meet Strategic Tabular Data: A Prior Alignment Approach

यह शोध पत्र स्ट्रैटेजिक प्रायर-डेटा फिटेड नेटवर्क (SPN) को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम फ्रेमवर्क है जो रणनीतिक इन-कॉन्टेक्स्ट उदाहरणों का निर्माण करके टैबुलर फाउंडेशन मॉडल्स को रणनीतिक डेटा वितरणों के साथ संरेखित करता है, जिससे बिना मॉडल पुन: प्रशिक्षण के पोस्ट-डिप्लॉयमेंट फीचर हेरफेर के कारण होने वाले प्रेडिक्शन बायस (पूर्वाग्रह) को दूर किया जा सके।

Xinpeng Lv, Yunxin Mao, Renzhe Xu, Chunyuan Zheng, Yikai Chen, Haoxuan Li, Jinxuan Yang, Kun Kuang, Yuanlong Chen, Mingy (…)2026-06-09