💻 computer science

Latent-Identity Tuning in Text-to-Image Personalization Models

यह शोध पत्र एक फ्रोजन एनकोडर के लेटेंट स्पेस का लाभ उठाकर उन सिमेंटिक दिशाओं की पहचान करने की एक ट्रेनिंग-फ्री विधि प्रस्तुत करता है जो क्रॉस-इमेज आइडेंटिटी कंसिस्टेंसी को बनाए रखते हुए स्थानीयकृत चेहरे के संपादन (लोकललाइज्ड फेशियल एडिट्स) को सक्षम बनाती है, जिससे टेक्स्ट-टू-इमेज मॉडल्स में फाइन-ग्रेंड आइडेंटिटी ट्यूनिंग संभव होती है।

Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik2026-07-14
💻 computer science

Multi-Layer Gaussian Splatting for Immersive Anatomy Visualization

यह शोध पत्र मल्टी-लेयर गॉसियन स्प्लेटिंग (Multi-Layer Gaussian Splatting) का प्रस्ताव करता है, जो एक नवीन तकनीक है जो वॉल्यूमेट्रिक सीटी (CT) स्कैन को परतों वाली शारीरिक संरचनाओं और चयनात्मक सक्रियण के साथ एक कुशल, स्थिर मध्यवर्ती प्रतिनिधित्व में संकुचित करती है, जिससे कंप्यूट-सीमित उपकरणों पर पारंपरिक पाथ ट्रेसिंग के प्रमुख खोजपूर्ण गुणों को बनाए रखते हुए वास्तविक समय में, उच्च-गुणवत्ता वाला इमर्सिव विज़ुअलाइज़ेशन सक्षम होता है।

Constantin Kleinbeck, Hannah Schieber, Klaus Engel, Ralf Gutjahr, Daniel Roth2026-07-13
⚡ electrical engineering

On Motion Blur and Deblurring in Visual Place Recognition

यह शोध पत्र तीन डेटासेट के साथ एक व्यापक बेंचमार्क प्रस्तुत करके, मौजूदा डीब्लरिंग (deblurring) विधियों का मूल्यांकन करके, और गतिशील, वास्तविक दुनिया के परिदृश्यों में स्थानीयकरण प्रदर्शन को बेहतर बनाने के लिए अनुकूलन योग्य डीब्लरिंग रणनीतियों का प्रस्ताव देकर विजुअल प्लेस रिकग्निशन (Visual Place Recognition) पर मोशन ब्लर के कम खोजे गए प्रभाव को संबोधित करता है।

Timur Ismagilov, Bruno Ferrarini, Michael Milford, Tan Viet Tuyen Nguyen, SD Ramchurn, Shoaib Ehsan2026-07-13
⚡ electrical engineering

GraphSeg: Segmented 3D Representations via Graph Edge Addition and Contraction

GraphSeg एक ऐसा फ्रेमवर्क है जो गहराई के डेटा के बिना विरल (sparse) 2D छवियों से सुसंगत 3D ऑब्जेक्ट सेगमेंटेशन उत्पन्न करता है, जो सेगमेंटेशन को ग्राफ एज एडिशन और कॉन्ट्रैक्शन समस्या के रूप में स्वरूपित करके असंरचित वातावरण में मजबूत रोबोटिक हेरफेर को सक्षम बनाता है।

Haozhan Tang, Tianyi Zhang, Oliver Kroemer, Matthew Johnson-Roberson, Weiming Zhi2026-07-13
🤖 machine learning

Bi-Manual Joint Camera Calibration and Scene Representation

यह शोध पत्र Bi-JCR को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो 3D फाउंडेशन मॉडल्स का लाभ उठाकर द्वि-हस्त (bi-manual) रोबोट कैमरों के मार्कर-मुक्त, संयुक्त अंशांकन (calibration) और सीधे RGB छवियों से एक एकीकृत, स्केल-सुसंगत 3D दृश्य प्रतिनिधित्व के निर्माण को सक्षम बनाता है, जिससे द्वि-हस्त समन्वय कार्यों को सुगम बनाया जा सके।

Haozhan Tang, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi2026-07-13
🤖 AI

H3Former: Hypergraph-based Semantic-Aware Aggregation via Hyperbolic Hierarchical Contrastive Loss for Fine-Grained Visual Classification

यह शोध पत्र H3Former का प्रस्ताव करता है, जो फाइन-ग्रेन्ड विजुअल क्लासिफिकेशन के लिए एक नवीन टोकन-टू-रीजन फ्रेमवर्क है, जो उच्च-क्रम की सिमेंटिक निर्भरताओं को कैप्चर करने के लिए भारित हाइपरग्राफ बनाने हेतु एक सिमेंटिक-अवेयर एग्रीगेशन मॉड्यूल का उपयोग करता है और एक नॉन-यूक्लिडियन स्पेस में पदानुक्रमित बाधाओं को लागू करने के लिए हाइपरबोलिक हिरार्किकल कॉन्ट्रास्टिव लॉस का उपयोग करता है, जिससे मानक बेंचमार्क पर उत्कृष्ट प्रदर्शन प्राप्त होता है।

Yongji Zhang, Siqi Li, Kuiyang Huang, Yue Gao, Yu Jiang2026-07-13
💻 computer science

Hybrid Foveated Path Tracing with Peripheral Gaussians for Immersive Anatomy

यह शोध पत्र एक हाइब्रिड रेंडरिंग फ्रेमवर्क प्रस्तावित करता है जो उच्च-गुणवत्तापूर्ण, संवादात्मक और इमर्सिव वॉल्यूमेट्रिक एनाटॉमी विज़ुअलाइज़ेशन को व्यापक प्रीप्रोसेसिंग के बिना सक्षम करने के लिए स्ट्रीम किए गए फोविएटेड पाथ ट्रेसिंग को गतिशील रूप से अपडेट किए गए पेरिफेरल गॉसियन स्प्लेटिंग मॉडल के साथ जोड़ता है।

Constantin Kleinbeck, Luisa Theelke, Hannah Schieber, Ulrich Eck, Rüdiger von Eisenhart-Rothe, Daniel Roth2026-07-13
💻 computer science

CUPID: Reconstructing UV Texture Maps for Interpretable Person-of-Interest Deepfake Detection

यह शोध पत्र CUPID को प्रस्तुत करता है, जो एक सुदृढ़, कुशल और व्याख्या योग्य 'पर्सन-ऑफ-इंटरेस्ट' डीपफेक डिटेक्टर है, जो प्रशिक्षण के दौरान डीपफेक डेटा या विशिष्ट लक्षित पहचानों की आवश्यकता के बिना, हेरफेर किए गए वीडियो की पहचान करने के लिए UV टेक्सचर मैप्स और मास्क्ड ऑटोएनकोडर्स का लाभ उठाता है, साथ ही हेरफेर किए गए चेहरे के क्षेत्रों को उजागर करने के लिए विजुअल रेसिडुअल मैप्स प्रदान करता है।

Giovanni Affatato, Sara Mandelli, Edoardo Daniele Cannas, Paolo Bestagini, Stefano Tubaro2026-07-13
💬 NLP

Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models

यह शोध पत्र एक एकीकृत ढांचे का प्रस्ताव करता है जो विज़ुअल-टोकन रिप्रजेंटेशन और प्रॉम्प्ट-कंडीशन्ड हिडन स्टेट्स से प्री-जनरेशन सिग्नल्स का उपयोग करके यह अनुमान लगाने और अलग करने के लिए है कि विज़न-लैंग्वेज मॉडल की त्रुटियां धारणा/पहचान संबंधी बाधाओं (perception/recognition bottlenecks) से उत्पन्न होती हैं या ज्ञान प्राप्ति की विफलताओं (knowledge retrieval failures) से, जिससे उत्तर जनरेशन से पहले लक्षित हस्तक्षेप सक्षम हो सके।

Khang Nhat Hoang Vo, Artem Vazhentsev, Artem Shelmanov, Timothy Baldwin, Yova Kementchedjhieva2026-07-13
💻 computer science

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

यह शोध पत्र GReFEM को प्रस्तुत करता है, जो एक ज़ीरो-शॉट फ्रेमवर्क है जो भौतिकी-निर्देशित परिशोधन (physics-guided refinement) के लिए 3D मेश में तनाव-महत्वपूर्ण क्षेत्रों को सटीक रूप से स्थानीयकृत करने हेतु orthoViews मॉड्यूल के साथ मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो बिना किसी कार्य-विशिष्ट प्रशिक्षण के पारंपरिक ज्यामितीय ह्यूरिस्टिक्स की तुलना में बेहतर सटीकता प्रदर्शित करता है।

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin2026-07-13