🤖 AI

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models

यह शोध पत्र STORM को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), स्थानिक-जागरूक (spatial-aware) टोकन रिडक्शन फ्रेमवर्क है जो ग्रिड टोपोलॉजी और पड़ोस की सुसंगतता (neighborhood coherence) को बनाए रखने के लिए स्थानीय बाधाओं को लागू करके संरचनात्मक रूप से संवर्धित मम्बा (Mamba) मॉडलों के प्रदर्शन पतन (performance collapse) को हल करता है।

Jindi Lv, Aoyu Li, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Qing Ye, Yueqi Duan, Wentao Feng, Jiancheng Lv2026-06-19
🤖 AI

Speeding up the annotation process in semantic segmentation industrial applications

यह शोध पत्र एक अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि अनसुपरवाइज्ड कंप्यूटर विजन एल्गोरिदम का प्री-एनोटेशन स्टेप के रूप में उपयोग करने से उच्च-रिज़ॉल्यूशन वाले औद्योगिक स्टील माइक्रोस्ट्रक्चर इमेजेस के लिए सिमेंटिक सेगमेंटेशन लेबलिंग समय में लगभग 78% (170 से घटाकर 37 घंटे) की कमी आती है, और साथ ही अपने प्रकार के सबसे बड़े सार्वजनिक डेटासेट और एक प्रमाणित डीप लर्निंग मॉडल को भी मुक्त करता है।

Marta Fernandez-Moreno, Margarita Guerrero, Rosalia Rementeria, Pablo Mesejo, Raul Moreno2026-06-19
🤖 AI

Triangular Consistency as a Universal Constraint for Learning Optical Flow

यह शोध पत्र "त्रिकोणीय निरंतरता" (triangular consistency) का प्रस्ताव करता है, जो एक सार्वभौमिक, आर्किटेक्चर-अज्ञेयवादी बाधा है जो बिना किसी अतिरिक्त एनोटेशन या कम्प्यूटेशनल ओवरहेड के, सुपरवाइज्ड, अनसुपरवाइज्ड और ट्रांसफर सेटिंग्स में सीखने के प्रदर्शन को सुधारने के लिए संयोजित ऑप्टिकल फ्लो के बीच ज्यामितीय निरंतरता लागू करती है।

Yi Xiao, Carlos Rodriguez Coronel, Jing Zhan, Haniyeh Ehsani Oskouie, Alex Wong, Dong Lao2026-06-19
⚡ electrical engineering

SIMBA: ABidirectional Retrieval Forward Simulation Framework for Modeling FY-4A GIIRS Hyperspectral Infrared Radiances Toward NWP Applications

यह शोध पत्र SIMBA को प्रस्तुत करता है, जो एक नवीन द्विदिश (bidirectional) डीप लर्निंग फ्रेमवर्क है जो चक्र-संगति बाधाओं (cycle-consistency constraints) और एक द्विदिश मंबा (Mamba) आर्किटेक्चर का उपयोग करके FY-4A GIIRS डेटा के लिए वायुमंडलीय प्रोफाइल पुनर्प्राप्ति और हाइपरस्पेक्ट्रल इन्फ्रारेड रेडिएंस सिमुलेशन को संयुक्त रूप से निष्पादित करता है, ताकि संख्यात्मक मौसम पूर्वानुमान अनुप्रयोगों के लिए मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।

Jingdong Shen, Fu Wang*, Qifeng Lu, Hao Huang, Chunqiang Wu, Chi Yang, Xiaofang Liu2026-06-19
🤖 AI

Advancing DialNav through Automatic Embodied Dialog Augmentation

DialNav फ्रेमवर्क को सीमित करने वाली डेटा की कमी को दूर करने के लिए, यह शोध पत्र 238K स्वचालित रूप से जनरेट किए गए संवाद एपिसोड के एक बड़े पैमाने के संग्रह—RAINbow डेटासेट—के साथ-साथ दोहरी-रणनीति प्रशिक्षण और एक लोकलाइजेशन मॉडल को प्रस्तुत करता है, जो सामूहिक रूप से देखे गए (seen) और अनदेखे (unseen) नेविगेशन स्प्लिट्स दोनों पर सफलता दर में महत्वपूर्ण सुधार के साथ एक नया स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo2026-06-19
🤖 AI

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

यह शोध पत्र ROSE प्रस्तुत करता है, जो एक नियंत्रित बेंचमार्क है यह प्रदर्शित करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (multimodal large language models) विजुअल काउंटिंग और कॉन्टेक्स्ट-कंडीशन्ड एक्शन्स के बीच एक महत्वपूर्ण प्रदर्शन अंतराल से जूझते हैं, जो उच्च मानव प्रदर्शन के बावजूद साझा विजुअल साक्ष्यों को कार्य-विशिष्ट व्यवहारों में अनुवादित करने में एक स्पष्ट बाधा को उजागर करता है।

Yihao Wang, Zijian He, Jie Ren, Keze Wang2026-06-19
🤖 AI

The Algorithmic-Human Manager: AI, Apps, and Workers in the Indian Gig Economy

यह शोध पत्र भारत की ब्लू-कॉलर गिग अर्थव्यवस्था पर एआई-संचालित एल्गोरिद्मिक प्रबंधन के दोहरे प्रभाव की जांच करता है, जो यह प्रकट करता है कि कैसे अपारदर्शी स्वचालित प्रणालियाँ परिचालन दक्षता तो पैदा करती हैं परंतु निष्पक्षता और श्रमिक गरिमा को कमजोर करती हैं, और अंततः तकनीकी दक्षता के साथ मानवीय जवाबदेही को संतुलित करने के लिए एक हाइब्रिड "एल्गोरिद्मिक-मानवीय प्रबंधक" ढांचे की वकालत करता है।

Omir Kumar, Krishnan Narayanan2026-06-19
🤖 AI

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

यह शोध पत्र ENPIRE पेश करता है, जो एक ऐसा ढांचा है जो कोडिंग एजेंटों को एनवायरनमेंट रिसेट, पैरेलल रोलआउट और इटरेटिव कोड रिफाइनमेंट के क्लोज्ड-लूप सिस्टम के माध्यम से वास्तविक दुनिया में रोबोटिक मैनिपुलेशन पॉलिसी को स्वायत्त रूप से सुधारने में सक्षम बनाता है, जिससे न्यूनतम मानवीय पर्यवेक्षण के साथ जटिल डेक्सट्रस कार्यों पर उच्च सफलता दर प्राप्त होती है।

Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy (…)2026-06-19
🤖 AI

Reward as An Agent for Embodied World Models

यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करता है जो "रिवॉर्ड ऐज़ एन एजेंट" (एक सुदृढ़ रिवॉर्ड सिग्नल के लिए एक एजेंटिक सत्यापन प्रणाली) को "डाइनैमिक-अवेयर ट्राजेक्टरी डाइवर्सिफिकेशन" की विधि "डाइनैमिक-जीआरपीओ" (DynDiff-GRPO) के साथ एकीकृत करता है, ताकि रिवॉर्ड हैकिंग को कम करते हुए और रूढ़िवादी व्यवस्थाओं से परे अन्वेषण का विस्तार करते हुए एम्बॉडीड वर्ल्ड मॉडल्स में सुरक्षित और स्केलेबल सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) को सक्षम बनाया जा सके।

Pu Li, Zhigang Lin, Qiang Wu, Yongxuan Lv, Fei Wang, Shan You2026-06-19
🤖 machine learning

StreamKL: Fast and Memory-Efficient KL Divergence for Boosting Attention Distillation

StreamKL एक नवीन फ्यूज्ड GPU प्रिमिटिव (fused GPU primitive) पेश करता है जो क्वेरी-की टाइल्स (query-key tiles) को एक ही पास में स्ट्रीम करके अटेंशन डिस्टिलेशन (attention distillation) की द्विघातीय मेमोरी और I/O बाधाओं को समाप्त करता है, जिससे एक सिंगल GPU पर लॉन्ग-कॉन्टेक्स्ट डिस्टिलेशन सक्षम करने के लिए मेमोरी फुटप्रिंट को O(NQNK)O(N_QN_K) से घटाकर O(1)O(1) करने के साथ महत्वपूर्ण गति प्राप्त होती है।

Guangda Liu, Yiquan Wang, Chengwei Li, Wenhao Chen, Jing Lin, Yiwu Yao, Danning Ke, Wenchao Ding, Jieru Zhao2026-06-19