💻 computer science

Improving Diffusion Posterior Samplers with Lagged Temporal Corrections for Image Restoration

यह शोध पत्र LAMP को प्रस्तुत करता है, जो डिफ्यूजन-आधारित इमेज रेस्टोरेशन के लिए एक मॉड्यूलर प्लग-इन है, जो बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के पोस्टीरियर सैंपलिंग की सटीकता और स्थिरता में सुधार करने के लिए सेकंड-ऑर्डर डिसक्रेटाइजेशन और लैग्ड टेम्पोरल करेक्शन्स का लाभ उठाता है।

Davide Evangelista, Elena Morotti, Francesco Pivi, Maurizio Gabbrielli2026-05-14
🤖 machine learning

Towards Robust Federated Multimodal Graph Learning under Modality Heterogeneity

यह शोध पत्र FedMPO का प्रस्ताव करता है, जो एक सुदृढ़ फेडरेटेड मल्टीमॉडल ग्राफ लर्निंग फ्रेमवर्क है जो टोपोलॉजी-अवेयर क्रॉस-मोडल जनरेशन, मिसिंग-अवेयर एक्सपर्ट रूटिंग और रिलायबिलिटी-अवेयर एग्रीगेशन के माध्यम से मोडैलिटी विषमता (modality heterogeneity) और डेटा अलगाव को संबोधित करता है ताकि हाई-मिसिंग और नॉन-IID सेटिंग्स में मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।

Sirui Zhang, Haonan Wang, Xunkai Li, Zekai Chen, Shumeng Li, Hongchao Qin, Rong-Hua Li, Guoren Wang2026-05-14
💻 computer science

3D Primitives are a Spatial Language for VLMs

यह शोध पत्र विज़न-लैंग्वेज मॉडल्स के लिए कोड के रूप में व्यक्त 3D ज्यामितीय प्रिमिटिव्स को एक शक्तिशाली स्थानिक भाषा के रूप में प्रस्तुत करता है, जो SpatialBabel बेंचमार्क, प्रशिक्षण-मुक्त Code-CoT इन्फरेंस रणनीति और स्व-पर्यवेक्षित S3^{3}-FT फाइन-ट्यूनिंग पद्धति के माध्यम से यह प्रदर्शित करता है कि यह मध्यवर्ती प्रतिनिधित्व मानव लेबल की आवश्यकता के बिना स्थानिक तर्क क्षमता को महत्वपूर्ण रूप से बढ़ाता है और विविध VLM आर्किटेक्चर में सामान्यीकरण करता है।

Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini (…)2026-05-14
🤖 AI

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

यह शोध पत्र वेरीफायर-गाइडेड एक्शन सिलेक्शन (VeGAS) का प्रस्ताव करता है, जो एक टेस्ट-टाइम फ्रेमवर्क है जो उम्मीदवार कार्यों (कैंडिडेट एक्शन्स) को सैंपल करके और एक विशेष रूप से प्रशिक्षित जनरेटिव वेरीफायर—जिसे LLM-संचालित डेटा सिंथेसिस रणनीति के माध्यम से बनाया गया है—का उपयोग करके सबसे विश्वसनीय कार्य का चयन करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल-आधारित एम्बोडीड एजेंट्स की मजबूती को बढ़ाता है, जिससे अंतर्निहित पॉलिसी को संशोधित किए बिना जटिल, लॉन्ग-होरिज़न कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach2026-05-14
💬 NLP

Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

यह शोध पत्र IAP प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) ढांचा है जो भाषा मॉडलों को उनके तर्क प्रक्रिया में निहित उपयोगकर्ता के अंतर्निहित इरादे (implicit intent) का अनुमान लगाने और उसे स्पष्ट रूप से एकीकृत करने के लिए प्रशिक्षित करके एकल-टर्न व्यक्तिगत प्रश्न उत्तर (single-turn personalized question answering) को बेहतर बनाता है, जिससे यह LaMP-QA बेंचमार्क पर मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West, Nicholas Weber2026-05-14
🤖 machine learning

Learning to Decide with AI Assistance under Human-Alignment

यह शोध पत्र यह स्थापित करता है कि एआई (AI) और मानवीय विश्वास के बीच संरेखण, एआई सहायता के साथ इष्टतम निर्णय लेने सीखने की जटिलता को महत्वपूर्ण रूप से कम करता है, जो पूर्ण संरेखण के तहत बेहतर रिग्रेट बाउंड्स (regret bounds) को सैद्धांतिक रूप से प्रदर्शित करता है और वास्तविक मानव-विषय डेटा पर इन निष्कर्षों को मान्य करता है।

Nina Corvelo Benz, Eleni Straitouri, Manuel Gomez-Rodriguez2026-05-14
🤖 machine learning

Multi-Rollout On-Policy Distillation via Peer Successes and Failures

यह शोध पत्र मल्टी-रोलआउट ऑन-पॉलिसी डिस्टिलेशन (MOPD) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो समृद्ध, इंस्टेंस-अनुकूल शिक्षक संकेतों के निर्माण के लिए सफल और विफल दोनों प्रकार के पीयर रोलआउट का लाभ उठाकर लार्ज लैंग्वेज मॉडल प्रशिक्षण को बेहतर बनाता है, जिससे यह मानक विधियों से बेहतर प्रदर्शन करता है जो प्रत्येक रोलआउट को स्वतंत्र रूप से मानते हैं।

Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang, Haixin Wang, Yinyi Luo, Chen Henry Wu, Gaurav Mittal, Ma (…)2026-05-14
🤖 machine learning

Plan Before You Trade: Inference-Time Optimization for RL Trading Agents

यह शोध पत्र FPILOT को प्रस्तुत करता है, जो एक प्लगइन इन्फ्रेंस-टाइम ऑप्टिमाइज़ेशन फ्रेमवर्क है जो पूर्व-प्रशिक्षित सुदृढीकरण अधिगम (रिनफोर्समेंट लर्निंग) ट्रेडिंग एजेंटों को प्रत्येक निर्णय चरण पर अनुमानित मूल्य प्रक्षेप पथों (प्राइस ट्राजेक्टरीज) का उपयोग करके पोर्टफोलियो आवंटन को गतिशील रूप से अनुकूलित करके बेहतर बनाता है, जिससे बिना मॉडल पुनप्रशिक्षण के निरंतर रिटर्न और जोखिम-समायोजित मेट्रिक्स में सुधार होता है।

Eun Go, Rohan Deb, Arindam Banerjee2026-05-14
🤖 AI

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

यह शोधपत्र BenchJack को प्रस्तुत करता है, जो एक स्वचालित रेड-टीमिंग प्रणाली है जो रिवॉर्ड-हैकिंग (reward-hacking) कमजोरियों की पहचान करने और उन्हें पैच करने के लिए AI एजेंट बेंचमार्क का व्यवस्थित रूप से ऑडिट करती है, यह प्रदर्शित करते हुए कि कई लोकप्रिय बेंचमार्क आसानी से शोषण योग्य हैं और एक पुनरावृत्ति प्रतिकूल प्रक्रिया (iterative adversarial process) के माध्यम से उन्हें महत्वपूर्ण रूप से सुदृढ़ किया जा सकता है।

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song2026-05-14
🤖 machine learning

Parallel-in-Time Training of Recurrent Neural Networks for Dynamical Systems Reconstruction

यह शोध पत्र GTF-DEER को प्रस्तुत करता है, जो एक नवीन 'पैरेलल-इन-टाइम' प्रशिक्षण ढांचा है जो स्टेट स्पेस मॉडल्स में लीनियर रिकरेंस की सीमाओं को दूर करने के लिए अत्यंत लंबी अनुक्रमों से नॉनलीनियर डायनेमिकल सिस्टम्स के स्थिर और प्रभावी पुनर्निर्माण को सक्षम बनाता है, यह प्रदर्शित करते हुए कि लंबी समय अवधि वाले सिस्टम्स के लिए लंबी प्रक्षेप पथों (ट्रैजेक्टरीज) तक पहुंच मॉडलिंग सटीकता में महत्वपूर्ण सुधार करती है।

Florian Hess, Florian Götz, Daniel Durstewitz2026-05-14