🤖 AI

Orbis 2: A Hierarchical World Model for Driving

यह शोध पत्र Orbis 2 प्रस्तुत करता है, जो एक पदानुक्रमित (hierarchical) ड्राइविंग वर्ल्ड मॉडल है जो लंबी अवधि की दृश्य संरचना के लिए एक उच्च-स्तरीय प्रेडिक्टर को विस्तृत निष्ठा (detailed fidelity) के लिए एक निम्न-स्तरीय जनरेटर के साथ जोड़ता है, और एक नवीन दो-चरणीय प्रशिक्षण प्रतिमान का उपयोग करता है जो समृद्ध प्रस्तुतियों के लिए डिफ्यूजन फोर्सिंग के साथ प्री-ट्रेन करता है और स्थिर रोलआउट्स के लिए टीचर फोर्सिंग के साथ फाइन-ट्यून करता है ताकि ड्राइविंग सिमुलेशन में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox2026-07-20
💻 computer science

Handwritten and Printed Text Segmentation via Region-Aware Human-Writing Descriptor Engineering

यह शोध पत्र एक हल्का, क्षेत्र-जागरूक (region-aware) डिस्क्रिप्टर फ्रेमवर्क प्रस्तावित करता है जो संसाधन-सीमित उपकरणों पर हस्तलिखित और मुद्रित टेक्स्ट को कुशलतापूर्वक विभाजित करता है, जो डीप लर्निंग बेसलाइन की तुलना में 8 गुना तेज़ इन्फरेंस स्पीड के साथ अत्याधुनिक सटीकता प्राप्त करता है।

Zhixian Lu, Jianwei Zhang, Lei Zhang, Fei Yuan, Jin Wang, Chang Liu, Rui Gao, Qiyu Lei2026-07-20
💻 computer science

Rendering 3D Gaussians on a Graph Processor

यह शोध पत्र 1,472 SRAM-ओनली टाइल्स वाले इंटेलिजेंस प्रोसेसिंग यूनिट (IPU) पर एक 3D गॉसियन रेंडरर के पहले कार्यान्वयन को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि बैंडविड्थ और मेमोरी क्षमता में बाधाओं को दूर करने के लिए प्रत्यक्ष इंटर-टाइल संचार के माध्यम से स्थानिक और टेम्पोरल लोकैलिटी का लाभ कैसे उठाया जा सकता है, साथ ही भविष्य के DRAM-मुक्त सेंसर-प्रोसेसर और GPU आर्किटेक्चर के लिए अंतर्दृष्टि प्रदान करता है।

Nicholas Fry, Ignacio Alzugaray, Mark Pupilli, Paul H. J. Kelly, Andrew J. Davison2026-07-20
💻 computer science

Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection

यह शोध पत्र एक एम्बोडीड एक्टिव लर्निंग फ्रेमवर्क प्रस्तावित करता है जो स्थानिक निरंतरता (स्पेशियल कंसिस्टेंसी) का लाभ उठाकर पुन: प्रशिक्षण के लिए असंगत लेबलों की पहचान करने और उन्हें प्राथमिकता देने के माध्यम से, सख्त नेविगेशन और एनोटेशन बजट के तहत अज्ञात वातावरणों में ऑब्जेक्ट डिटेक्टरों को अनुकूलित करता है, जिससे सिम्युलेटेड और वास्तविक दुनिया दोनों सेटिंग्स में बेसलाइन की तुलना में बेहतर डिटेक्शन सटीकता प्राप्त होती है।

Hadrien Crassous, Mohamed Yassine Kabouri, Minahil Raza, Joni Pajarinen, Riad Akrour2026-07-20
🤖 machine learning

CanonicalPhys: Pose-Robust Remote Photoplethysmography via Canonical-Space Priors

कैनोनिकलफिज़ (CanonicalPhys) चेहरे के बदलते पोज़ के तहत डीप रिमोट फोटोप्लेथिस्मोग्राफी (remote photoplethysmography) में होने वाली तीव्र प्रदर्शन गिरावट को संबोधित करने के लिए एक अवकलनीय होमोग्राफी (differentiable homography) पेश करता है जो चेहरे के क्षेत्रों को एक कैनोनिकल फ्रेम में मैप करती है, जिससे डाइक्रोमैटिक रिफ्लेक्शन मॉडल (dichromatic reflection model) और पल्स-फेज इनवेरिएंस (pulse-phase invariance) जैसे शारीरिक पूर्ववृत्तों (anatomical priors) का प्रभावी अनुप्रयोग सक्षम होता है, जो विविध पोज़ स्थितियों में हृदय-दर अनुमान त्रुटियों को महत्वपूर्ण रूप से कम करता है।

Hui Wei, Seyedata Jodeiri Seyedian, Xiaobai Li, Guoying Zhao2026-07-20
💻 computer science

Multi-Modal Semantic Segmentation of Electrolyzer Components for Sustainable Hydrogen Technologies: A Dual-Branch Deep Learning Approach

यह शोध पत्र HREM-Net का प्रस्ताव करता है, जो एक द्वि-शाखा (dual-branch) डीप लर्निंग फ्रेमवर्क है जो उन्नत अटेंशन और फ्यूजन मॉड्यूल के साथ हाइपरस्पेक्ट्रल और RGB इमेजिंग को जोड़ता है ताकि इलेक्ट्रोलाइज़र सामग्रियों का उच्च-सटीक सेग्मेंटेशन प्राप्त किया जा सके, जिससे हाइड्रोजन प्रौद्योगिकियों के लिए स्वचालित पृथक्करण (disassembly) और सतत पुनर्चक्रण (recycling) सक्षम हो सके।

Wasimul Karim, Nur Mohammad Fahad, Abdul Hasib Siddique, Md Rafiqul Islam, Hooman Mehdizadeh-Rad, Asif Karim, Sami Azam2026-07-20
💻 computer science

ArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering

यह शोध पत्र ArtChart प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क और बेंचमार्क है जो एक विशेष प्लग-एंड-प्ले मॉड्यूल और एक मल्टी-एक्सपर्ट रीइन्फोर्समेंट लर्निंग रणनीति के माध्यम से गणितीय रूप से सटीक ज्यामिति, सटीक इन-इमेज टेक्स्ट रेंडरिंग और सुसंगत शैलीकरण को एकीकृत करके निष्ठापूर्ण कलात्मक चार्ट निर्माण प्राप्त करता है।

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma2026-07-20
💻 computer science

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

यह शोध पत्र कंपोजिशनल VQA में विजन-लैंग्वेज मॉडल की विफलताओं का विश्लेषण करने के लिए एक ऑपरेशन-केंद्रित मैकेनिस्टिक फ्रेमवर्क प्रस्तुत करता है, जो चार विशिष्ट विफलता मोड को प्रकट करता है और यह प्रदर्शित करता है कि वे विशिष्ट, विच्छेदित (dissociated) कम्प्यूटेशनल पथों के माध्यम से प्रसारित होते हैं, जिससे लक्षित विश्वसनीयता सुधारों के लिए एक आधार स्थापित होता है।

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang2026-07-20
⚡ electrical engineering

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

यह शोध पत्र ऑडियो-विजुअल फ्लेमिंगो (AV-Flamingo) को प्रस्तुत करता है, जो एक पूर्णतः ओपन स्टेट-ऑफ-द-आर्ट लार्ज लैंग्वेज मॉडल है जिसे एक विशाल नए डेटासेट, एक प्रगतिशील तीन-चरणीय प्रशिक्षण पाठ्यक्रम और एक नवीन टेम्पोरल इंटरलीव्ड चेन-ऑफ-थॉट फ्रेमवर्क का लाभ उठाकर लंबे, जटिल वास्तविक दुनिया के वीडियो पर संयुक्त समझ और तर्क के लिए डिज़ाइन किया गया है।

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam (…)2026-07-20
💬 NLP

An Exam for Active Observers

यह शोध पत्र ActiveVision को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सक्रिय दृश्य अवलोकन (active visual observation) करने की क्षमता मौलिक रूप से नहीं है, जैसा कि मानव प्रदर्शन की तुलना में पुनरावृत्ति संबंधी धारणा (iterative perception) की आवश्यकताओं वाले कार्यों पर उनकी लगभग पूर्ण विफलता से सिद्ध होता है।

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger2026-07-20