💻 computer science

Adaptive Hebbian Memory Routing in Vision Transformers for Few-Shot Learning

यह शोध पत्र विजन ट्रांसफॉर्मर्स के लिए अडैप्टिव हेब्बियन रूटिंग (Adaptive Hebbian Routing) का प्रस्ताव करता है, जो एक विधि है जो मेमोरी योगदान, अपडेट स्ट्रेंथ और रिटेंशन को गतिशील रूप से नियंत्रित करने के लिए एक लाइटवेट एमएलपी (MLP) का उपयोग करती है, जिससे यह विभिन्न बैकबोन और डेटासेट में फ्यू-शॉट लर्निंग सटीकता और इन्फरेंस दक्षता में फिक्स्ड हेब्बियन दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Mohammed Yusuf Mujawar, Noorbakhsh Amiri Golilarz2026-06-24
🤖 AI

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

UniDrive एक एकीकृत ढांचा है जो प्राकृतिक भाषा जोखिम विवरण और सटीक बाउंडिंग-बॉक्स स्थानीयकरण को एक साथ उत्पन्न करने के लिए गेटेड क्रॉस-अटेंशन मैकेनिज्म के माध्यम से टेम्पोरल रीजनिंग को उच्च-रिज़ॉल्यूशन स्थानिक धारणा के साथ एकीकृत करता है, जिससे स्वायत्त ड्राइविंग के लिए व्याख्यात्मक जोखिम समझ में बेहतर प्रदर्शन प्राप्त होता है।

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye2026-06-24
💻 computer science

Counting Trees from Satellite Imagery with Noisy Supervision

यह शोध पत्र उपग्रह चित्रों के लिए एक नवीन वृक्ष गणना ढांचे (tree counting framework) को प्रस्तुत करता है जो अनिश्चित क्राउन सीमाओं और शोर युक्त पर्यवेक्षण (noisy supervision) की चुनौतियों का समाधान करने के लिए इस कार्य को एक स्व-सुधार तंत्र के साथ अनबैलेंस्ड ऑप्टिमल ट्रांसपोर्ट का उपयोग करते हुए एक स्थानिक घनत्व मिलान समस्या के रूप में तैयार करता है, जिससे नए, बड़े पैमाने के TinyTrees बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Dimitri Gominski, Maurice Mugabowindekwe, Qiue Xu, Xiaowei Tong, Martin Brandt, Hieu Le, Rasmus Fensholt, Dimitris Samar (…)2026-06-24
🤖 AI

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis

ऑर्बिटफोर्ज (Orbit-Forge) एक नवीन एडेप्टर है जो एकल जनित वीडियो को बिना किसी कार्य-विशिष्ट फाइन-ट्यूनिंग या प्रगतिशील दृश्य पीढ़ी की आवश्यकता के, फ्रोजन टेक्स्ट-टू-वीडियो प्रायर्स (priors) और एक इटरेटिव रिकंस्ट्रक्शन-एंकोर्ड ऑप्टिमाइज़ेशन प्रक्रिया का लाभ उठाकर सुसंगत, पूर्ण-ऑर्बिट 3D गॉसियन स्प्लेटिंग दृश्यों में परिवर्तित करता है।

Chenrui Fan, Paolo Favaro2026-06-24
💻 computer science

GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction

यह शोधपत्र GeoT2V-Bench प्रस्तुत करता है, जो एक नवीन पुनर्निर्माण-आधारित बेंचमार्क है जो कैमरा-प्रॉम्प्टेड टेक्स्ट-टू-वीडियो मॉडलों की 3D निरंतरता का मूल्यांकन करने के लिए उनके स्पष्ट रिजिड 3D पुनर्निर्माण को समर्थन देने की क्षमता का विश्लेषण करता है, जिससे यह प्रकट होता है कि दृश्य गति (visible motion) और स्थिर रेंडरिंग मेट्रिक्स अक्सर पूरक विफलता मोड (complementary failure modes) को कैप्चर करते हैं।

Chenrui Fan, Paolo Favaro2026-06-24
💻 computer science

Spherical-to-ERP Epipolar Rectification for Single-Axis Disparity in 360 Stereo

यह शोध पत्र प्रदर्शित करता है कि गोलाकार स्टीरियो छवियों को इक्विरेक्टेंगुलर प्रारूप में प्रोजेक्ट करना एकल-अक्ष एपिपोलर ज्यामिति को प्रभावी ढंग से पुनर्स्थापित करता है, जिससे मौजूदा RAFT+EACS ढांचे को अनुकूलित करने में सक्षम बनाया जा सकता है ताकि 360-डिग्री इमेजिंग के लिए सटीक, वास्तविक समय का डिस्पैरिटी अनुमान प्राप्त किया जा सके।

Sahereh Obeidavi, Dieter Landes2026-06-24
🤖 AI

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

यह शोध पत्र IV-CoT का प्रस्ताव करता है, जो एक लेटेंट विजुअल रीजनिंग फ्रेमवर्क है जो केवल प्रशिक्षण-आधारित स्केच पर्यवेक्षण द्वारा निर्देशित एक स्ट्रक्चरल-टू-सेमेंटिक कैस्केड के माध्यम से संरचनात्मक योजना (structural planning) को उपस्थिति रेंडरिंग (appearance rendering) से अलग करके, एकल फॉरवर्ड पास के भीतर, स्ट्रक्चर-अवेयर टेक्स्ट-टू-इमेज जनरेशन में सुधार करता है।

Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Y (…)2026-06-24
🤖 AI

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

FLUX3D एक स्केलेबल इमेज-टू-3D गॉसियन स्प्लेटिंग फ्रेमवर्क है जो डिफ्यूजन-अलाइन्ड स्ट्रक्चर्ड लेटेंट्स (DA-SLAT) और एक स्पार्स-स्ट्रक्चर-अवेयर डिफ्यूजन ट्रांसफार्मर (SMDiT) को पेश करके उच्च-निष्ठा वाले 3D जनरेशन में संरचनात्मक बाधाओं को दूर करता है ताकि प्रतिनिधित्व शिक्षण (representation learning) को बढ़ाया जा सके और सटीक 2D-3D संरेखण प्राप्त किया जा सके।

Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo2026-06-24
💻 computer science

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

FLAT एक नवीन फीडफॉरवर्ड फ्रेमवर्क पेश करता है जो विशेष रोटेशन पैरामीट्राइजेशन और एक प्रोडक्ट विंडो फंक्शन का उपयोग करके संकुचित वीडियो डिफ्यूजन लेटेंट्स को सीधे सतह-संरेखित (surface-aligned) ट्राएंगल स्प्लैट्स में डिकोड करता है, जो मौजूदा 3D गॉसियन-आधारित विधियों की तुलना में बेहतर ज्यामितीय सटीकता और गेम-इंजन-रेडी आउटपुट प्राप्त करता है।

Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari2026-06-24
💻 computer science

Build Once, Monitor Continuously: Persistent Semantic Mapping via Autonomous Exploration and Open-Vocabulary Object Updates

यह शोध पत्र एक मॉड्यूलर दो-चरणीय प्रणाली प्रस्तुत करता है जो ज्यामितीय मैपिंग को सिमेंटिक अपडेटिंग से अलग करती है ताकि एक बार 2D ऑक्यूपेंसी ग्रिड बनाकर और तत्पश्चात कई रोबोटिक दौरों के दौरान वस्तुओं के परिवर्तनों को निरंतर ट्रैक करने के लिए लाइटवेट ओपन-वोकेबुलरी डिटेक्शन का उपयोग करके इनडोर वातावरण की कुशल और निरंतर निगरानी सक्षम की जा सके।

Sai Haneesh Allu, Itay Kadosh, Tyler Summers, Yu Xiang2026-06-23