🤖 machine learning

Probabilistic Object Detection with Conformal Prediction

यह शोध पत्र क्लास-वाइज कैलिब्रेशन और एक टू-स्टेप पाइपलाइन के साथ एक स्केल्ड, कोऑर्डिनेट-वाइज दृष्टिकोण पेश करके मल्टी-आउटपुट ऑब्जेक्ट डिटेक्शन पर कॉन्फॉर्मल प्रेडिक्शन लागू करने की चुनौतियों का समाधान करता है, जो कठोर कवरेज गारंटी बनाए रखते हुए स्वायत्त ड्राइविंग डेटासेट्स में प्रेडिक्शन इंटरवल शार्पनेस और IoU में महत्वपूर्ण सुधार करता है।

Christopher Ries, Moussa Kassem Sbeyti, Nicolas Bianco, Nadja Klein2026-05-11
🤖 machine learning

Disagreement-Regularized Importance Sampling for Adversarial Label Corruption

यह शोध पत्र डिसएग्रीमेंट-रेगुलराइज्ड इम्पोर्टेंस सैंपलिंग (DR-IS) को प्रस्तुत करता है, जो एक सुदृढ़ सब-सैंपलिंग विधि है जो प्रतिकूल लेबल भ्रष्टाचार (adversarial label corruption) को प्रभावी ढंग से कम करने के लिए एक एनसेंबल में लॉस रैंक-डिसएग्रीमेंट का लाभ उठाती है और EL2N जैसे मैग्नीट्यूड-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करती है, जिसे कठोर परिमित-नमूना एकाग्रता सीमाओं (finite-sample concentration bounds) द्वारा समर्थित किया गया है जो स्वच्छ और भ्रष्ट उदाहरणों के बीच सख्त पृथक्करण की गारंटी देते हैं।

Csongor Horváth, Ida-Maria Sintorn, Prashant Singh2026-05-11
📊 statistics

Ensemble Distributionally Robust Bayesian Optimisation

यह शोध पत्र 'एन्सेम्बल डिस्ट्रीब्यूशनली रोबस्ट बेयसियन ऑप्टिमाइज़ेशन' के लिए एक गणनात्मक रूप से सुलभ एल्गोरिदम प्रस्तावित करता है जो वितरण संबंधी अनिश्चितता के तहत निरंतर संदर्भ (कंटीन्यूअस कॉन्टेक्स्ट) को संभालता है, जिससे बेहतर सैद्धांतिक उप-रैखिक रिग्रेट बाउंड्स प्राप्त होते हैं और मजबूत अनुभवजन्य प्रदर्शन प्रदर्शित होता है।

Tigran Ramazyan, Denis Derkach2026-05-11
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

यह शोध पत्र POISE प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक पॉलिसी मॉडल की आंतरिक अवस्थाओं पर प्रशिक्षित एक हल्के प्रोब (lightweight probe) का लाभ उठाकर नगण्य लागत पर वैल्यू बेसलाइन का अनुमान लगाता है, जिससे अलग क्रिटिक्स या कई रोलआउट्स के कम्प्यूटेशनल ओवरहेड के बिना स्थिर और कुशल पॉलिसी अनुकूलन प्राप्त होता है।

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo2026-05-11
📊 statistics

Revisiting Transformer Layer Parameterization Through Causal Energy Minimization

यह शोध पत्र कॉज़ल एनर्जी मिनिमाइजेशन (CEM) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ट्रांसफॉर्मर परतों को सशर्त ऊर्जा फलनों (conditional energy functions) पर अनुकूलन चरणों के रूप में पुनर्व्याख्या करता है ताकि भाषा मॉडलिंग कार्यों में मानक बेसलाइन के अनुरूप बाधित, पैरामीटर-कुशल आर्किटेक्चर प्राप्त किए जा सकें।

Jin Xu, Camille Couturier, Victor Rühle, Saravan Rajmohan, James Hensman2026-05-11
🤖 machine learning

Optimal Recourse Summaries via Bi-Objective Decision Tree Learning

यह शोधपत्र SOGAR का परिचय देता है, जो एक नवीन ढांचा है जो स्थिर, कम लागत वाले और प्रभावी वैश्विक रिसोर्स सारांशों (global recourse summaries) का एक पूर्ण पारेटो फ्रंट (Pareto front) उत्पन्न करने के लिए रिसोर्स सारांश लर्निंग को एक द्वि-उद्देश्यीय निर्णय वृक्ष (bi-objective decision tree) समस्या के रूप में सूत्रबद्ध करता है, जिससे पुन: प्रशिक्षण के बिना प्रभावशीलता और लागत के बीच लचीले ट्रेड-ऑफ चयन को सक्षम बनाया जा सके।

Ioannis Chatzis, Jason Liartis, Athanasios Voulodimos, Giorgos Stamou2026-05-11
💬 NLP

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

यह शोध पत्र PhoneSafety प्रस्तुत करता है, जो 700 वास्तविक दुनिया के सुरक्षा-महत्वपूर्ण क्षणों का एक बेंचमार्क है जो फोन-उपयोग एजेंटों में वास्तविक सुरक्षा और मात्र अक्षमता के बीच अंतर करता है, यह प्रकट करते हुए कि मजबूत सामान्य क्षमताएं सुरक्षित निर्णय लेने की गारंटी नहीं देती हैं और हानिरहित परिणाम अक्सर वास्तविक सुरक्षा के बजाय कार्य करने में असमर्थता को छिपाते हैं।

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen (…)2026-05-11
💬 NLP

Post-training makes large language models less human-like

यह शोध पत्र Psych-201 डेटासेट प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि पोस्ट-ट्रेनिंग प्रक्रियाएं, जो बड़े भाषा मॉडलों को उपयोगिता के लिए अनुकूलित करती हैं, निरंतर मानव व्यवहार का सटीक रूप से अनुकरण करने की उनकी क्षमता को कम करती हैं, एक ऐसी समस्या जो नई मॉडल पीढ़ियों में बनी रहती है और बदतर होती जाती है और जिसे पर्सोना-इंडक्शन तकनीकों द्वारा हल नहीं किया जा सकता है।

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W (…)2026-05-11
🤖 AI

Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding

यह शोध पत्र LC-MAPF प्रस्तुत करता है, जो एक सामान्यीकरण योग्य प्री-ट्रेंड मॉडल है जो कुशल फीचर शेयरिंग के लिए एक स्केलेबल, सीखने योग्य मल्टी-राउंड कम्युनिकेशन मॉड्यूल को शामिल करके विकेंद्रीकृत मल्टी-एजेंट पाथफाइंडिंग को बढ़ाता है, जो स्केलेबिलिटी से समझौता किए बिना विविध परिदृश्यों में मौजूदा लर्निंग-आधारित सॉल्वर्स से बेहतर प्रदर्शन करता है।

Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik2026-05-11
💬 NLP

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN एक ब्लैकबोर्ड-प्रेरित, मल्टी-एजेंट फ्रेमवर्क है जो इन-स्टेप ऑडिटिंग के साथ एक एडवर्सरियल स्केप्टिक-रिसर्चर-जज लूप में भूमिकाओं को अलग करके LLM रीजनिंग की गुणवत्ता और एपिस्टेमिक ट्रस्ट को बढ़ाता है, जो विविध बेंचमार्क और बैकबोन मॉडल्स पर मोनोलिथिक और कंसेंसस-आधारित बेसलाइन्स से बेहतर प्रदर्शन करता है।

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng2026-05-11