💻 computer science

SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

यह शोध पत्र SADL को प्रस्तुत करता है, जो विषय-जागरूक विचलित करने वाले तत्वों के स्थानीयकरण (subject-aware distractor localization) के लिए पहला वास्तविक-विश्व बेंचमार्क है, जो रचनात्मक रूप से आवश्यक वस्तुओं को संरक्षित करते हुए दृश्य विकर्षणों की पहचान करने और उन्हें फ़िल्टर करने पर विज़न-लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि ये मॉडल विचलित करने वाले तत्वों का पता लगा सकते हैं, वे व्यवस्थित रूप से अपवर्जन नियमों (exclusion rules) को अत्यधिक लागू करते हैं।

Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen, Minh-Triet Tran2026-06-30
💻 computer science

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform

यह शोध पत्र एक वास्तविक दुनिया के UR5e रोबोट पर विजन-लैंग्वेज-एक्शन मॉडल्स के हस्तांतरण की जांच करता है, जो यह प्रकट करता है कि सफल तैनाती मॉडल क्षमता पर कम और ऑफलाइन संकेतकों तथा भौतिक स्थिरता के बीच के अंतर को दूर करने के लिए संपूर्ण डेटा-मॉडल-कंट्रोल पाइपलाइन के सटीक एकीकरण पर अधिक निर्भर करती है।

Mathilde Hochedel, Marc Lalonde2026-06-30
💻 computer science

Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance

यह शोधपत्र क्रॉस-रेज़ोल्यूशन सिमेंटिक ट्रांसफर (CRST) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो रेज़ोल्यूशन-कंडीशन्ड रीजनिंग, टेक्स्ट-गाइडेड रिफाइनमेंट और क्रॉस-रेज़ोल्यूशन रैंकिंग डिस्ट्रीब्यूशन अलाइनमेंट को एकीकृत करके लो-रेज़ोल्यूशन टेक्स्ट-टू-इमेज पर्सन री-आइडेंटिफिकेशन में एविडेंस रिलायबिलिटी कोलैप्स और रैंकिंग डिस्ट्रीब्यूशन ड्रिफ्ट की समस्याओं को संबोधित करता है ताकि निगरानी परिदृश्यों में रिट्रीवल प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

Wenjie Qian, Bin Yang, Xiao Wang, Wenke Huang, Ling Mei, Xin Xu, Mang Ye2026-06-30
💻 computer science

On the Faithfulness of Post-Hoc Concept Bottleneck Models

यह शोध पत्र प्रकट करता है कि पोस्ट-हॉक कॉन्सेप्ट बॉटलनेक मॉडल कोवैरिएट शिफ्ट और लेबल नॉइज़ के कारण अर्थहीन कॉन्सेप्ट प्रोजेक्शन सीखते हुए भी उच्च भविष्य कहनेवाला सटीकता प्राप्त कर सकते हैं, और टास्क परफॉर्मेंस से स्वतंत्र रूप से कॉन्सेप्ट फेथफुलनेस को डिकपल और मूल्यांकन करने के लिए नवीन मेट्रिक्स का प्रस्ताव करता है।

Laines Schmalwasser, Jan Blunk, Niklas Penzel, Julia Niebling, Joachim Denzler2026-06-30
💻 computer science

High-Resolution Flood Mapping With Sentinel-1 and Sentinel-2 via Misalignment-Robust Cross-Sensor Learning and Generative Despeckling

यह शोध पत्र एक एकीकृत बाढ़ मानचित्रण ढांचे को प्रस्तुत करता है जो एक नए उच्च-रिज़ॉल्यूशन सेंटिनल-1 और सेंटिनल-2 डेटासेट, सेंसर मिसअलाइनमेंट को संभालने के लिए एक शिफ्ट-इनवेरिएंट लॉस फंक्शन, और ऑप्टिकल एवं SAR इमेजिंग आर्टिफैक्ट्स के बावजूद मजबूत, उच्च-सटीक बाढ़ विस्तार का पता लगाने के लिए जनरेटिव डेस्पेकलिंग हेतु एक कंडीशनल वेरिएशनल ऑटोएन्कोडर का लाभ उठाता है।

David Ma, Jeremy Feinstein, Shreya Pandit, Arkaprabha Ganguli, Eugene Yan2026-06-30
💻 computer science

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors

StereoGS, एब्सोल्यूट स्केल और बाइनोकुलर कंसिस्टेंसी के लिए स्टीरियो प्रायर्स के साथ-साथ एक ग्रेडिएंट-अवेयर ओपैसिटी डिके स्ट्रैटेजी और कंसिस्टेंसी-अवेयर डेंस इनिशियलाइजेशन को एकीकृत करके, स्पार्स-व्यू सेटिंग्स में 3D गॉसियन स्प्लेटिंग की ओवरफिटिंग और ज्यामितिक विसंगतियों को संबोधित करता है, ताकि बिना किसी अतिरिक्त इन्फरेंस ओवरहेड के स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

Wenhao Yuan, Yiyuan Ge, Deli Cai2026-06-30
💻 computer science

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics

इकोवीडियो (EcoVideo) एक एंट्रॉपी-संचालित क्लाउड-एज फ्रेमवर्क है जो क्लाउड-आधारित डिनोइजिंग के लिए उच्च-एंट्रॉपी वाले कीफ्रेम्स को गतिशील रूप से चुनता है और शेष फ्रेमों को मोशन-अवेयर इंटरपोलेशन का उपयोग करके एज पर पुनर्गठित करता है, जिससे गुणवत्ता-दक्षता ट्रेड-ऑफ को अनुकूलित किया जाता है और संसाधन-सीमित स्थितियों में वीडियो जनरेशन में 2.9x तक की गति वृद्धि प्राप्त की जाती है।

Jiayu Chen, Hengyi Zhang, Maoliang Li, Minyu Li, Zihao Zheng, Xuanzhe Liu, Guojie Luo, Xiang Chen2026-06-30
💻 computer science

The Human Creativity Benchmark

यह शोध पत्र ह्यूमन क्रिएटिविटी बेंचमार्क (HCB) को प्रस्तुत करता है, जो तकनीकी शुद्धता पर पेशेवर अभिसरण (convergence) और सौंदर्यपरक रुचि में विचलन (divergence) के बीच अंतर करता है ताकि यह तर्क दिया जा सके कि रचनात्मक AI का मूल्यांकन करने के लिए इन विशिष्ट संकेतों को एक एकल गुणवत्ता मीट्रिक में समाहित करने के बजाय उन्हें संरक्षित करना आवश्यक है।

Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh2026-06-30
💻 computer science

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization

यह शोध पत्र \dataset का परिचय देता है, जो कैमरा पोज़ (camera poses) के साथ एक बड़े पैमाने का मल्टी-मोडल बिल्डिंग डेटासेट है, और GAGeo का, जो ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) क्षमताओं के साथ श्रेष्ठ क्रॉस-व्यू ऑब्जेक्ट जियो-लोकलाइजेशन प्राप्त करने के लिए एक 3D फाउंडेशन मॉडल का लाभ उठाने वाला एक एकीकृत सिंगल-स्टेज फ्रेमवर्क है।

Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu2026-06-30
💻 computer science

Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

यह शोधपत्र "लर्निंग फ्रॉम रिलायबल लेटेंट प्रॉम्प्ट्स" नामक एक नवीन प्रतिमान प्रस्तावित करता है, जो इंस्टेंस-लेवल फीचर्स की अस्थिरता को दूर करने के लिए इनपुट-अग्नोस्टिक, लर्नबल लेटेंट एंकर्स को स्थिर प्रायर्स (priors) के रूप में उपयोग करता है और अत्यधिक मिसिंग-मोडैलिटी परिदृश्यों में भी अत्याधुनिक विजुअल रिकग्निशन प्रदर्शन प्राप्त करता है।

Taixi Chen, Nancy Guo2026-06-30