🤖 machine learning

GeoDetect: Geometric Adversarial Detection for VLPs

यह शोध पत्र GeoDetect को प्रस्तुत करता है, जो विजन-लैंग्वेज प्री-ट्रेन्ड मॉडल्स (VLPs) के लिए एक ज्यामितीय प्रतिकूल डिटेक्शन (geometric adversarial detection) विधि है, जो विविध आर्किटेक्चर और खतरे के परिदृश्यों में हमलों की विश्वसनीय पहचान करने के लिए एनिसोट्रोपिक एम्बेडिंग स्पेस (anisotropic embedding spaces) में एडवर्सरियल उदाहरणों की बढ़ी हुई ऑफ-मैनिफोल्ड दूरी का लाभ उठाता है।

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani2026-07-17
🤖 AI

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

FoMoVLA एक नवीन फ्रेमवर्क है जो विज़न-लैंग्वेज-एक्शन मॉडल्स को भविष्य के फीचर फोरसाइट (future feature foresight) और स्पार्स 2D पॉइंट ट्रैकिंग को संयुक्त रूप से सीखकर उन्नत करता है ताकि लक्ष्य भविष्यवाणी और निरंतर गति मार्गदर्शन के बीच के अंतर को पाटा जा सके, जिससे कई रोबोटिक बेंचमार्क पर अत्याधुनिक प्रदर्शन और मजबूत ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त होता है।

Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin L (…)2026-07-17
💻 computer science

On the Disagreement in Perturbation-based xAI -- Benchmarking Perturbation Choices for Flood Detection from SAR Images

यह शोध पत्र इस बात की जांच करता है कि कैसे व्यवधान-आधारित (perturbation-based) व्याख्या योग्य एआई (XAI) में महत्वपूर्ण पैरामीटर विकल्प, विशेष रूप से पैच ज्यामिति (patch geometry) और व्यवधान प्रकार (perturbation type), एसएआर (SAR) इमेजरी में बाढ़ का पता लगाने के लिए प्रासंगिकता मानचित्रों (relevance maps) को महत्वपूर्ण रूप से बदलते हैं, जो मजबूत और निष्ठावान मॉडल व्याख्याओं को सुनिश्चित करने के लिए इन सेटिंग्स का कड़ाई से मूल्यांकन करने की आवश्यकता पर प्रकाश डालता है।

Anastasia Schlegel, Ronny Hänsch2026-07-17
💻 computer science

Clean-Reference Streaming Detection of Lens Occlusion and Photometric Transitions for Camera Tamper Monitoring

यह शोध पत्र एक कम-कम्प्यूटेशन वाले, ऑडिट करने योग्य स्ट्रीमिंग मॉनिटर को प्रस्तुत करता है जो एक स्वच्छ संदर्भ के विरुद्ध सेंसर सांख्यिकी की तुलना करके लेंस अवरोध (lens occlusion) और अचानक फोटोमेट्रिक परिवर्तनों का पता लगाता है, जिससे कई सार्वजनिक डेटासेट में सख्त फॉल्स-अलार्म नियंत्रण के साथ उच्च रिकॉल प्राप्त होता है।

Bo Ma, WeiQi Yan, Jinsong Wu2026-07-17
💻 computer science

An LLM-Based Automatic Sportscast Solution for Robot Soccer Matches

यह शोध पत्र एक पूर्णतः स्वायत्त, वास्तविक समय की न्यूरो-सिम्बोलिक प्रणाली प्रस्तुत करता है जो रोबोकप रोबोट सॉकर मैचों के कच्चे काइनेमैटिक डेटा को लाइव स्ट्रीमिंग और खेल के बाद के विश्लेषण, दोनों के लिए प्रवाहपूर्ण, भ्रम-मुक्त प्राकृतिक भाषा कमेंट्री और सांख्यिकी में परिवर्तित करती है।

Francesco Petri, Michele Brienza, Daniele Nardi, Domenico Daniele Bloisi, Aldo Gangemi, Vincenzo Suriani2026-07-17
🤖 AI

Benchmarking Face Recognition without Real Faces

यह शोध पत्र प्रदर्शित करता है कि सुव्यवस्थित सिंथेटिक डेटासेट, विशेष रूप से MorphFace और Vec2Face, चेहरे की पहचान करने वाले मॉडलों के मूल्यांकन के लिए वास्तविक-चेहरे के बेंचमार्क को प्रभावी ढंग से प्रतिस्थापित कर सकते हैं, जिससे प्रशिक्षण और मूल्यांकन दोनों के लिए एक पूर्णतः गोपनीयता-संरक्षित पाइपलाइन सक्षम होती है।

Paweł Borsukiewicz, Daniele Lunghi, Wendkûuni C. Ouédraogo, Jacques Klein, Tegawendé F. Bissyandé2026-07-17
💻 computer science

Frequency-Structured Field Learning for Light-Field Disparity Estimation

यह शोध पत्र FreqLF को प्रस्तुत करता है, जो लाइट-फील्ड डिस्पैरिटी अनुमान (disparity estimation) के लिए एक नवीन फ्रेमवर्क है जो बिना किसी मेमोरी-गहन कॉस्ट वॉल्यूम (cost volume) का स्पष्ट रूप से निर्माण किए, लेटेंट फीचर्स (latent features) से डिस्पैरिटी की भविष्यवाणी करने के लिए EPI-गाइडेड फूरियर-लोकल लर्निंग (EPI-guided Fourier-local learning) का लाभ उठाता है, जिससे वैश्विक निरंतरता (global consistency) और स्थानीय सटीकता (local precision) के बीच संतुलन बनाते हुए प्रतिस्पर्धी सटीकता प्राप्त होती है।

Sara Monji-Azad, Yulin Liu, Jürgen Hesser2026-07-17
💻 computer science

Introspective Attention Modulation for Safe Text-to-Image Generation

यह शोध पत्र 'इंट्रोस्पेक्टिव अटेंशन मॉड्यूलेशन' (Introspective Attention Modulation) को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम विधि है जो टेक्स्ट-टू-इमेज मॉडल्स की सुरक्षा को बढ़ाने के लिए अटेंशन एक्टिवेशन्स को गतिशील रूप से नियंत्रित करती है ताकि असुरक्षित अवधारणाओं को दबाया जा सके और साथ ही सिमेंटिक एलाइनमेंट एवं इमेज क्वालिटी को बनाए रखा जा सके, जो मौजूदा कॉन्सेप्ट इरेज़र तकनीकों का एक अधिक सुदृढ़ विकल्प प्रदान करता है।

Basim Azam, Hossein Rahmani, Naveed Akhtar2026-07-17
💻 computer science

DINE: Distance Is Not Enough -- Learning Global Deformation Priors for Robust Soft-Tissue Point Cloud Registration

यह शोध पत्र DINE को प्रस्तुत करता है, जो एक मैक्सिमम ए पोस्टीरियर (maximum a posteriori) फ्रेमवर्क है जो मानक दूरी-आधारित उद्देश्यों को सीखे गए वैश्विक विरूपण पूर्ववृत्तों (global deformation priors) के साथ संवर्धित करके सुदृढ़ सॉफ्ट-टिश्यू पॉइंट क्लाउड पंजीकरण को बढ़ाता है, जो मौजूदा विधियों की तुलना में सटीकता और शोर एवं आउटलेर्स के प्रति लचीलेपन में महत्वपूर्ण सुधार करता है।

Sara Monji-Azad, Rohit Beer, Marvin Kinz, Claudia Scherl, Jürgen Hesser2026-07-17
🤖 machine learning

Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation

यह शोध पत्र मल्टी-एक्सिस मैक्स@के (multi-axis max@K) का परिचय देता है, जो एक समूह-आधारित सुदृढीकरण शिक्षण (reinforcement learning) उद्देश्य है जो टेक्स्ट-टू-इमेज जनरेशन की विविधता और जनसांख्यिकीय निष्पक्षता को बढ़ाता है, क्योंकि यह क्रेडिट केवल तभी नमूनों को प्रदान करता है जब वे एक बैच के भीतर विशिष्ट सिमेंटिक मोड्स (semantic modes) के कवरेज में अद्वितीय सुधार करते हैं, जिससे छवि गुणवत्ता या प्रॉम्प्ट संरेखण से समझौता किए बिना उच्च निष्पक्षता स्कोर प्राप्त होता है।

Ku Onoda, Paavo Parmas, Hiroki Furuta, Soichiro Nishimori, Yuta Oshima, Shohei Taniguchi, Yutaka Matsuo2026-07-17