💻 computer science

\ECUAS{n}: A family of metrics for principled evaluation of uncertainty-augmented systems

यह शोध पत्र तर्क देता है कि अनिश्चितता-संवर्धित प्रणालियों (uncertainty-augmented systems) के लिए वर्तमान मूल्यांकन विधियाँ अनिश्चितता के तहत निर्णय लेने के लिए अपर्याप्त हैं और एक नए प्रॉपर स्कोरिंग रूल्स (proper scoring rules), \ECUAS{n}, के परिवार का प्रस्ताव करता है, जो उपयोगकर्ताओं को विशिष्ट अनुप्रयोग आवश्यकताओं के आधार पर पूर्वानुमान त्रुटियों और अनिश्चितता की गुणवत्ता के बीच के संतुलन को ट्यून करने की अनुमति देता है।

Lautaro Estienne, Erik Ernst, Matías Vera, Pablo Piantanida, Luciana Ferrer2026-05-21
📊 statistics

Tippett-minimum Fusion of Representation-space Diffusion Models for Multi-Encoder Out-of-Distribution Detection

यह शोध पत्र EncMin2L को प्रस्तुत करता है, जो एक पैरामीटर-कुशल (parameter-efficient), एनकोडर-अज्ञेयवादी (encoder-agnostic) ढांचा है जो विविध शिफ्ट प्रकारों के माध्यम से बिना किसी OOD लेबल की आवश्यकता के सुदृढ़ आउट-ऑफ-डिस्ट्रीब्यूशन (out-of-distribution) डिटेक्शन प्राप्त करने के लिए एक सांख्यिकीय टू-लेवल मिनिमम-गेट के माध्यम से रिप्रेजेंटेशन-स्पेस डिफ्यूजन मॉडल्स को फ्यूज करता है।

Neelkamal Bhuyan2026-05-21
💻 computer science

ShadeBench: A Benchmark Dataset for Building Shade Simulation in Sustainable Society

यह शोध पत्र ShadeBench प्रस्तुत करता है, जो एक व्यापक मल्टीमॉडल डेटासेट और बेंचमार्क है जिसमें भौगोलिक रूप से विविध शहरी दृश्य शामिल हैं, जिसमें सिम्युलेटेड शेड मैप्स, सैटेलाइट इमेजरी और 3D बिल्डिंग डेटा का उपयोग किया गया है ताकि स्केलेबल शहरी छाया विश्लेषण को सुगम बनाया जा सके, शेड जनरेशन और सेगमेंटेशन जैसे डाउनस्ट्रीम कार्यों को समर्थन दिया जा सके, और हीट-रेज़िलिएंट शहरी नियोजन के लिए डेटा-संचालित अनुसंधान को आगे बढ़ाया जा सके।

Longchao Da, Mithun Shivakoti, Xiangrui Liu, T Pranav Kutralingam, Yezhou Yang, Hua Wei2026-05-21
💻 computer science

Open-World Evaluations for Measuring Frontier AI Capabilities

यह शोध पत्र फ्रंटियर एआई (frontier AI) के मूल्यांकन के लिए पारंपरिक बेंचमार्क के एक आवश्यक पूरक के रूप में "ओपन-वर्ल्ड इवैल्यूएशंस" (open-world evaluations) का समर्थन करता है, जिसमें CRUX प्रोजेक्ट को पेश किया गया है और एक केस स्टडी के माध्यम से इसकी प्रभावकारिता को प्रदर्शित किया गया है जहाँ एक एआई एजेंट ने न्यूनतम मानवीय हस्तक्षेप के साथ सफलतापूर्वक एक iOS ऐप विकसित किया और प्रकाशित किया।

Sayash Kapoor, Peter Kirgis, Andrew Schwartz, Stephan Rabanser, J. J. Allaire, Rishi Bommasani, Harry Coppock, Magda Dub (…)2026-05-21
⚡ electrical engineering

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA एक बड़े पैमाने का, इमेज-ग्राउंडेड बेंचमार्क है जिसमें 12 डेटासेट और पांच क्लिनिकल डोमेन के 3D ब्रेन MRI वॉल्यूम से व्युत्पन्न लगभग 57,000 प्रश्न-उत्तर जोड़े शामिल हैं, जिसे सख्त इमेज-ग्राउंडिंग प्रोटोकॉल और विशेषज्ञ सत्यापन के माध्यम से टेक्स्ट-ओनली शॉर्टकट को समाप्त करते हुए 3D मेडिकल विजुअल रीजनिंग का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Mohammad H. Abbasi (Stanford University), Favour Nerrise (Stanford University), Shaurnav Ghosh (Stanford University), Ri (…)2026-05-21
📊 statistics

Latent Process Generator Matching

यह शोध पत्र लेटेंट प्रोसेस जनरेटर मैचिंग (Latent Process Generator Matching) प्रस्तुत करता है, जो एक सामान्य ढांचा है जो प्रेक्षित जनरेटिव अवस्थाओं को सुलभ मार्कोव प्रक्रियाओं के नियतात्मक प्रक्षेपों (deterministic projections) के रूप में मॉडल करता है, जिससे जनरेटर मैचिंग को स्थिर लेटेंट वेरिएबल्स से समय-निर्भर लेटेंट कंडिशनल प्रक्रियाओं तक विस्तारित किया जाता है और यह सुनिश्चित किया जाता है कि सीखा गया जनरेटर लक्षित मार्जिनल वितरणों से मेल खाता है।

Lukas Billera, Hedwig Nora Nordlinder, Ben Murrell2026-05-21
💻 computer science

Personality Engineering with AI Agents: A New Methodology for Negotiation Research

यह शोध पत्र "पर्सनैलिटी इंजीनियरिंग" (व्यक्तित्व इंजीनियरिंग) को प्रस्तुत करता है, जो एक नवीन कार्यप्रणाली है जो वार्ताकार के व्यक्तित्व को 'वॉर्मथ' (आत्मीयता) और 'डोमिनेंस' (प्रभुत्व) के आयामों पर सटीक रूप से हेरफेर करने और मूल्यांकन करने के लिए एआई एजेंटों का लाभ उठाती है, जिससे वार्ता संबंधी सिद्धांतों के कठोर, नियंत्रित परीक्षण को सक्षम बनाया जा सके और एआई वार्ता एजेंटों के डिज़ाइन को निर्देशित किया जा सके।

Michelle A. Vaccaro, Jared R. Curhan2026-05-21
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

यह शोध पत्र बड़े भाषा मॉडलों के लिए एक नवीन पोस्ट-ट्रेनिंग पद्धति प्रस्तुत करता है जो एक फ्रोजन SFT संदर्भ नीति और एक प्रशिक्षण योग्य नीति के लॉजिट्स (logits) का औसत निकालकर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) को बेहतर बनाती है, जिससे KL रेगुलराइजेशन या क्रिटिक की आवश्यकता समाप्त हो जाती है और प्रभावी रूप से RL की तर्क क्षमताओं को SFT की फॉर्मेटिंग स्थिरता के साथ जोड़ा जाता है।

Xingwei Gan, Ying Zhu2026-05-21
💬 NLP

Multi-agent Collaboration with State Management

यह शोधपत्र STORM को प्रस्तुत करता है, जो एक स्टेट-ओरिएंटेड (state-oriented) प्रबंधन ढांचा है जो कोडिंग बेंचमार्क पर पारंपरिक वर्कस्पेस आइसोलेशन बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करते हुए और साझा कोडबेस के सुसंगत दृश्यों को सुनिश्चित करते हुए, राइट टाइम (write time) पर कोड संघर्षों का पता लगाने और उन्हें हल करने के लिए मल्टी-एजेंट इंटरैक्शन को मध्यस्थता प्रदान करता है।

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong2026-05-21
💻 computer science

Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX

यह शोध पत्र Mahjax को प्रस्तुत करता है, जो JAX में निर्मित एक पूर्णतः वेक्टरकृत (fully vectorized), GPU-त्वरितित (GPU-accelerated) रीची माजों (Riichi Mahjong) वातावरण है जो प्रति सेकंड 2 मिलियन स्टेप्स तक के थ्रूपुट के साथ बड़े पैमाने पर सुदृढीकरण शिक्षण (reinforcement learning) को सक्षम बनाता है, जिससे मानव खेल लॉग्स पर निर्भरता के बिना एजेंटों को शून्य से प्रशिक्षित करना सुलभ होता है।

Soichiro Nishimori, Shinri Okano, Keigo Habara, Sotetsu Koyamada, Eason Yu, Masashi Sugiyama2026-05-21