💻 computer science

Instant Expressive Gaussian Head Avatars at Over 100 FPS

यह शोध पत्र एक कुशल स्थानीय संलयन रणनीति (local fusion strategy) और विच्छेदित गति शिक्षण (decoupled motion learning) को नियोजित करके, एक एकल छवि को तुरंत एक 3D-सुसंगत, अत्यधिक अभिव्यंजक और वास्तविक समय में एनिमेट करने योग्य गॉसियन हेड अवतार में बदलने के लिए एक फीड-फॉरवर्ड पाइपलाइन प्रस्तावित करता है, जिससे मौजूदा विधियों को प्रभावित करने वाले गति, सुसंगतता और विवरण के बीच के समझौते को हल किया जा सके।

Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano2026-06-29
🤖 machine learning

RANSAC Scoring Done Right

यह शोध पत्र एक नवीन RANSAC स्कोरिंग पद्धति प्रस्तुत करता है जो उपयोगकर्ता द्वारा दिए गए थ्रेशोल्ड मापदंडों की आवश्यकता को समाप्त करने के लिए एक संयुग्मी पूर्ववृत्त (conjugate prior) के तहत इनलायर स्केल को विश्लेषणात्मक रूप से मार्जिनलाइज़ करता है, जिसके परिणामस्वरूप एक क्लोज्ड-फॉर्म, O(N log N) स्कोर प्राप्त होता है जो बिना किसी मैनुअल कैलिब्रेशन के विभिन्न डेटा व्यवस्थाओं में अत्याधुनिक सटीकता और सुदृढ़ता बनाए रखता है।

James Pritts, Felix Seegräber, Kevin Köser2026-06-29
⚡ electrical engineering

Not All Relations Rotate Alike: Transformation-Aware Decoupling for Viewpoint-Robust 3D Scene Graph Generation

यह शोध पत्र ट्रांसफॉर्मेशन-अवेयर डिकपलिंग (TAD) का प्रस्ताव करता है, जो एक नवीन 3D सीन ग्राफ जनरेशन फ्रेमवर्क है जो याव रोटेशन (yaw rotations) के तहत विभिन्न प्रेडिकेट्स के विषम ट्रांसफॉर्मेशन व्यवहारों को संबोधित करने के लिए रिलेशन रीजनिंग को स्पष्ट रूप से स्थिर और दिशात्मक शाखाओं में अलग करके व्यूपॉइंट मजबूती में सुधार करता है।

Jingjun Sun, Chaowei Wang, Zhirui Liu, Jiaxu Tian, Ming Yang, Yaoxing Wang, Shan Gao2026-06-29
💻 computer science

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models

यह शोध पत्र SemCityLoc को प्रस्तुत करता है, जो एक स्केलेबल हवाई 6DoF लोकलाइजेशन सिस्टम है जो चुनौतीपूर्ण शहरी वातावरण में उच्च-परिशुद्धता वाले पोज अनुमान (pose estimation) को प्राप्त करने के लिए फाउंडेशन-मॉडल-व्युत्पन्न विजुअल प्रायर्स (visual priors) को मानकीकृत सिमेंटिक 3D सिटी मॉडल्स के साथ संरेखित करता है, जो GNSS या रेडियोमेट्रिक पुनर्निर्माणों पर निर्भर हुए बिना, एक नए वास्तविक-विश्व बेंचमार्क द्वारा मान्य किया गया है जो रिकॉल और स्थिति संबंधी सटीकता में महत्वपूर्ण सुधार प्रदर्शित करता है।

Jingfeng Mao, Xuyang Chen, Qilin Zhang, Oussema Dhaouadi, Guangming Wang, Brian Sheil, Daniel Cremers, Yan Xia, Olaf Wys (…)2026-06-29
💻 computer science

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds

AnyTree एक प्रॉमटेबल (promptable) 3D इंस्टेंस सेगमेंटेशन मॉडल है जो वन LiDAR पॉइंट क्लाउड्स के लिए है, जो न्यूनतम उपयोगकर्ता इंटरैक्शन के साथ कुशलतापूर्वक और सटीक रूप से व्यक्तिगत पेड़ों को रेखांकित करने के लिए क्लिक-टू-क्वेरी एनकोडर और CHM-गाइडेड इनिशियलाइजेशन का लाभ उठाता है, और विविध वन वातावरणों में सटीकता, दक्षता और सामान्यीकरण के मामले में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

Trung Thanh Nguyen, Daniel Lusk, Kilian Gerberding, Janusch Vajna-Jehle, Tuan-Anh Vu, Duc Viet Le, Tu Vo, Phi Le Nguyen (…)2026-06-29
💬 NLP

Aloe-Vision: Robust Vision-Language Models for Healthcare

यह शोध पत्र एलो-विज़न (Aloe-Vision) का परिचय देता है, जो एक उच्च-गुणवत्ता वाले, फ़िल्टर्ड मल्टीमॉडल डेटासेट पर प्रशिक्षित एक सुदृढ़ मेडिकल लार्ज विज़न-लैंग्वेज मॉडल (7B और 72B) का ओपन-सोर्स परिवार है, जिसके साथ विश्वसनीय मूल्यांकन के लिए केयरक्यूए-विज़न (CareQA-Vision) बेंचमार्क भी दिया गया है, ताकि स्वास्थ्य सेवा एआई में डेटा की कमी, पुनरुत्पादकता और सुरक्षा संबंधी चिंताओं को दूर किया जा सके।

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-G (…)2026-06-29
💻 computer science

Tessellating The Earth

यह शोध पत्र टेसेलेटिंग द अर्थ (TTE) को प्रस्तुत करता है, जो एक नवीन जियोलोकेशन एनकोडर है जो सीखने योग्य गोलाकार वोरोनोई विभाजनों (Spherical Voronoi partitions) और वैश्विक सिमेंटिक टोकन का उपयोग करता है ताकि विभेदक क्षेत्रों में प्रतिनिधित्व क्षमता को गतिशील रूप से आवंटित किया जा सके और दूरस्थ क्षेत्रों के बीच सिमेंटिक ज्ञान साझा किया जा सके, जिससे भू-स्थानिक कार्यों और सूक्ष्म प्रजाति वर्गीकरण में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Daniel Cher, Hamza Iqbal, Eric Xing, Brian Wei, Nathan Jacobs2026-06-29
💻 computer science

Beyond MoCap: Scaling Motion Tokenizers with Synthetic Human Motion for Generative Modeling

यह शोधपत्र एक ऐसे ढांचे का प्रस्ताव करता है जो मौजूदा मोशन कैप्चर डेटासेट की सीमाओं को दूर करने के लिए एक पुनर्गठित (redesigned) VQ-VAE टोकेनाइज़र को बड़े पैमाने पर, विविध सिंथेटिक मोशन डेटा के साथ संयुक्त रूप से स्केल करके मानव गति निर्माण में मोशन रिप्रेजेंटेशन स्पेस का विस्तार करता है और सामान्यीकरण (generalization) में सुधार करता है।

Yiwen Yan, Wanning He, Yu-Wing Tai2026-06-29
💻 computer science

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

यह शोध पत्र DeLux को प्रस्तुत करता है, जो एक नवीन क्रॉस-मोडल पाइपलाइन है जो RGB वीडियो में स्थानीय लाइटिंग आर्टिफ़ेक्ट्स (lighting artifacts) का प्रभावी ढंग से पता लगाने और उन्हें इनपेंट (inpaint) करने के लिए न्यूरोमॉर्फिक इवेंट स्ट्रीम्स को स्ट्रक्चरल प्रायर्स (structural priors) के रूप में उपयोग करता है, जो छिपे हुए विवरणों को पुनर्स्थापित करने में मौजूदा RGB-ओनली और इवेंट-गाइडेड बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है।

Bartosz Stachowiak, Dariusz Brzezinski2026-06-29
🤖 AI

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn एक नवीन फ्रेमवर्क है जो एक मल्टी-स्टेज कंसिस्टेंसी पाइपलाइन के माध्यम से 2D इनपेंटिंग मॉडल्स और 3D गॉसियन स्प्लेटिंग के बीच सेतु बनाता है, जो द्विदिश ज्यामितीय और फोटोमेट्रिक निरंतरता सुनिश्चित करके लचीले मास्क इनपुट के साथ ऑब्जेक्ट हटाने और सम्मिलित करने के लिए अत्याधुनिक 3D सीन पुनर्निर्माण को सक्षम बनाता है।

Hana Kim, Minje Kim, Tae-Kyun Kim2026-06-29