💻 computer science

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors

StereoGS, एब्सोल्यूट स्केल और बाइनोकुलर कंसिस्टेंसी के लिए स्टीरियो प्रायर्स के साथ-साथ एक ग्रेडिएंट-अवेयर ओपैसिटी डिके स्ट्रैटेजी और कंसिस्टेंसी-अवेयर डेंस इनिशियलाइजेशन को एकीकृत करके, स्पार्स-व्यू सेटिंग्स में 3D गॉसियन स्प्लेटिंग की ओवरफिटिंग और ज्यामितिक विसंगतियों को संबोधित करता है, ताकि बिना किसी अतिरिक्त इन्फरेंस ओवरहेड के स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

Wenhao Yuan, Yiyuan Ge, Deli Cai2026-06-30
💻 computer science

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics

इकोवीडियो (EcoVideo) एक एंट्रॉपी-संचालित क्लाउड-एज फ्रेमवर्क है जो क्लाउड-आधारित डिनोइजिंग के लिए उच्च-एंट्रॉपी वाले कीफ्रेम्स को गतिशील रूप से चुनता है और शेष फ्रेमों को मोशन-अवेयर इंटरपोलेशन का उपयोग करके एज पर पुनर्गठित करता है, जिससे गुणवत्ता-दक्षता ट्रेड-ऑफ को अनुकूलित किया जाता है और संसाधन-सीमित स्थितियों में वीडियो जनरेशन में 2.9x तक की गति वृद्धि प्राप्त की जाती है।

Jiayu Chen, Hengyi Zhang, Maoliang Li, Minyu Li, Zihao Zheng, Xuanzhe Liu, Guojie Luo, Xiang Chen2026-06-30
💻 computer science

The Human Creativity Benchmark

यह शोध पत्र ह्यूमन क्रिएटिविटी बेंचमार्क (HCB) को प्रस्तुत करता है, जो तकनीकी शुद्धता पर पेशेवर अभिसरण (convergence) और सौंदर्यपरक रुचि में विचलन (divergence) के बीच अंतर करता है ताकि यह तर्क दिया जा सके कि रचनात्मक AI का मूल्यांकन करने के लिए इन विशिष्ट संकेतों को एक एकल गुणवत्ता मीट्रिक में समाहित करने के बजाय उन्हें संरक्षित करना आवश्यक है।

Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh2026-06-30
💻 computer science

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization

यह शोध पत्र \dataset का परिचय देता है, जो कैमरा पोज़ (camera poses) के साथ एक बड़े पैमाने का मल्टी-मोडल बिल्डिंग डेटासेट है, और GAGeo का, जो ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) क्षमताओं के साथ श्रेष्ठ क्रॉस-व्यू ऑब्जेक्ट जियो-लोकलाइजेशन प्राप्त करने के लिए एक 3D फाउंडेशन मॉडल का लाभ उठाने वाला एक एकीकृत सिंगल-स्टेज फ्रेमवर्क है।

Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu2026-06-30
💻 computer science

Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

यह शोधपत्र "लर्निंग फ्रॉम रिलायबल लेटेंट प्रॉम्प्ट्स" नामक एक नवीन प्रतिमान प्रस्तावित करता है, जो इंस्टेंस-लेवल फीचर्स की अस्थिरता को दूर करने के लिए इनपुट-अग्नोस्टिक, लर्नबल लेटेंट एंकर्स को स्थिर प्रायर्स (priors) के रूप में उपयोग करता है और अत्यधिक मिसिंग-मोडैलिटी परिदृश्यों में भी अत्याधुनिक विजुअल रिकग्निशन प्रदर्शन प्राप्त करता है।

Taixi Chen, Nancy Guo2026-06-30
💻 computer science

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation

यह शोध पत्र EPIC-Contact प्रस्तुत करता है, जो सघन 3D हैंड-ऑब्जेक्ट कॉन्टैक्ट एनोटेशन वाला एक बड़े पैमाने का इन-द-वाइल्ड एगोसेंट्रिक डेटासेट है, और HOPformer, जो एक ट्रांसफार्मर-आधारित मॉडल है जो क्रॉस-अटेंशन का लाभ उठाकर ऑक्लूजन और जनरलाइजेशन चुनौतियों को प्रभावी ढंग से संबोधित करते हुए स्टेट-ऑफ-द-आर्ट 3D हैंड-ऑब्जेक्ट पोज़ एस्टीमेशन प्राप्त करता है।

Siddhant Bansal, Zhifan Zhu, Shashank Tripathi, Jiahe Zhao, Michael J. Black, Dima Damen2026-06-30
💻 computer science

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

यह शोध पत्र Goku को प्रस्तुत करता है, जो जटिल मल्टी-टास्क और संरचनात्मक हेरफेर को कवर करने वाले 2 मिलियन इंस्ट्रक्शन-अलाइन्ड वीडियो एडिटिंग पेयर्स का एक बड़े पैमाने का डेटासेट है, साथ ही इसमें Goku-Edit मॉडल और Goku-Bench बेंचमार्क भी शामिल है, ताकि सरल अपीयरेंस परिवर्तनों से परे इंस्ट्रक्शन-आधारित वीडियो एडिटिंग क्षमताओं को उन्नत किया जा सके।

Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu (…)2026-06-30
💻 computer science

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

यह शोध पत्र MiRA का प्रस्ताव करता है, जो एक पैरामीटर-मुक्त प्लग-इन फ्रेमवर्क है जो सूक्ष्म चेहरे की गतिशीलता (facial dynamics) के प्रति संवेदनशीलता बढ़ाने के लिए विजन ट्रांसफॉर्मर में फ्रेम-वार अटेंशन को पुनर्वितरित करता है, जो एक सटीक पोस्ट-सॉफ्टमैक्स और एक कुशल फ्लैशअटेंशन-एकीकृत सन्निकटन (approximation) दोनों प्रदान करता है जो चेहरे के भाव पहचान (facial expression recognition) बेंचमार्क पर प्रदर्शन में सुधार करता है।

Seongro Yoon, Donghyeon Cho, Jinsun Park, François Brémond2026-06-30
💻 computer science

Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors

GaussDet, डिस्क्रीट 2D ऑब्जेक्ट डिटेक्टर्स और एक व्यू-एग्रीगेटेड सिमेंटिक वोटिंग मैकेनिज्म का लाभ उठाकर 3D गॉसियन स्प्लेटिंग में ओपन-वोकैबुलरी और रेफरिंग सेगमेंटेशन के लिए एक नवीन दृष्टिकोण पेश करता है, ताकि घने CLIP फीचर्स पर निर्भर रहे बिना मजबूत, ज़ीरो-शॉट 3D इंस्टेंस ग्रुपिंग और जटिल रेफरेंशियल ग्राउंडिंग प्राप्त की जा सके।

Jameel Hassan, Yasiru Ranasinghe, Vishal Patel2026-06-30
💻 computer science

An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations

यह शोध पत्र EMDiffusion को प्रस्तुत करता है, जो एक एक्सपेक्टेशन-मैक्सिमाइजेशन फ्रेमवर्क है जो स्वच्छ छवियों के पुनर्गठन और मॉडल भार के परिशोधन को पुनरावृत्ति के माध्यम से सक्षम करके, बिना किसी स्वच्छ प्रशिक्षण डेटा की आवश्यकता के, विभिन्न कम्प्यूटेशनल इमेजिंग कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए दूषित अवलोकनों से सीधे उच्च-गुणवत्ता वाले डिफ्यूजन मॉडल को प्रशिक्षित करने में सक्षम बनाता है।

Weimin Bai, Yifei Wang, Wenzheng Chen, He Sun2026-06-29