🤖 AI

Triangular Consistency as a Universal Constraint for Learning Optical Flow

यह शोध पत्र "त्रिकोणीय निरंतरता" (triangular consistency) का प्रस्ताव करता है, जो एक सार्वभौमिक, आर्किटेक्चर-अज्ञेयवादी बाधा है जो बिना किसी अतिरिक्त एनोटेशन या कम्प्यूटेशनल ओवरहेड के, सुपरवाइज्ड, अनसुपरवाइज्ड और ट्रांसफर सेटिंग्स में सीखने के प्रदर्शन को सुधारने के लिए संयोजित ऑप्टिकल फ्लो के बीच ज्यामितीय निरंतरता लागू करती है।

Yi Xiao, Carlos Rodriguez Coronel, Jing Zhan, Haniyeh Ehsani Oskouie, Alex Wong, Dong Lao2026-06-19
🤖 AI

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

यह शोध पत्र ROSE प्रस्तुत करता है, जो एक नियंत्रित बेंचमार्क है यह प्रदर्शित करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (multimodal large language models) विजुअल काउंटिंग और कॉन्टेक्स्ट-कंडीशन्ड एक्शन्स के बीच एक महत्वपूर्ण प्रदर्शन अंतराल से जूझते हैं, जो उच्च मानव प्रदर्शन के बावजूद साझा विजुअल साक्ष्यों को कार्य-विशिष्ट व्यवहारों में अनुवादित करने में एक स्पष्ट बाधा को उजागर करता है।

Yihao Wang, Zijian He, Jie Ren, Keze Wang2026-06-19
🤖 machine learning

Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis

यह शोध पत्र सेमेंटिक-एंकोर्ड इविडेंशियल फ्यूजन सर्वाइवल (SAEFS) फ्रेमवर्क का प्रस्ताव करता है, जो विजुअल क्वेश्चन अनस्वर्सिंग का लाभ उठाकर डोमेन-इनवेरिएंट सेमेंटिक एंकर्स को निकालता है और उन्हें सतर्क इविडेंशियल फ्यूजन के माध्यम से विजुअल एविडेंस के साथ जोड़ता है, जिससे मौजूदा पिक्सेल-आधारित विधियों की तुलना में क्रॉस-सेंटर होल-स्लाइड इमेज सर्वाइवल एनालिसिस में बेहतर ज़ीरो-शॉट सामान्यीकरण और विश्वसनीयता प्राप्त होती है।

Yucheng Xing, Ling Huang, Pei Liu, Jingying Ma, Jiaqing Xu, Kai He, Mengling Feng2026-06-19
💻 computer science

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow एक नवीन क्रॉस-स्पेस फ्लो फॉर्मूलेशन पेश करता है जो शोर वाले लेटेंट इनपुट्स को सीधे पिक्सेल-स्पेस आउटपुट में मैप करके एक-चरण वाली इमेज जनरेशन को सक्षम बनाता है, जिससे यह इन्फरेंस के दौरान एक अलग डिकोडर की आवश्यकता को समाप्त करने के लिए लेटेंट रिप्रेजेंटेशन की दक्षता को सीधे पिक्सेल-स्पेस सुपरविजन के साथ जोड़ देता है।

Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang2026-06-19
🤖 AI

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

यह शोधपत्र डिफ्यूजन ट्रांसफॉर्मर्स के लिए एक नवीन वेरिएबल-लेंथ टोकेनाइज़र प्रस्तुत करता है जो लर्नबल ग्लोबल मर्जिंग का उपयोग करके डेटा-स्वतंत्र, क्रॉस-लेंथ रिप्रेजेंटेशन अलाइनमेंट को सक्षम बनाता है और बेहतर क्वालिटी-कंप्यूट ट्रेड-ऑफ प्राप्त करता है, जिससे पारंपरिक ट्रंकेशन-आधारित विधियों में निहित सिमेंटिक मिसअलाइनमेंट की समस्याओं पर विजय प्राप्त होती है।

Dong Hoon Lee, Seunghoon Hong2026-06-19
💻 computer science

EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies

EventVLA एक एंड-टू-एंड फ्रेमवर्क है जो एक डायनेमिक कीफ्रेम एविडेंस मेमोरी मॉड्यूल को पेश करके लॉन्ग-होरिज़न रोबोटिक मैनिपुलेशन में मेमोरी बॉटलनैक्स पर विजय प्राप्त करता है, जो VLA लेटेंट एम्बेडिंग्स से स्वायत्त रूप से स्पार्स, टास्क-क्रिटिकल विजुअल इवेंट्स का पूर्वानुमान लगाता और संग्रहीत करता है, जिससे अत्याधुनिक तरीकों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

Ganlin Yang, Zhangzheng Tu, Yuqiang Yang, Sitong Mao, Junyi Dong, Tianxing Chen, Jiaqi Peng, Jing Xiong, Jiafei Cao, Jif (…)2026-06-19
💻 computer science

Stitching and dimensionality effects on large artificially generated volume datasets

यह अध्ययन क्रायो-इलेक्ट्रॉन माइक्रोस्कोपी के लिए डीप लर्निंग-आधारित स्टाइल ट्रांसफर में स्टिचिंग दृष्टिकोणों और आयामीता (2D बनाम 3D) का मूल्यांकन करता है, जो यह प्रकट करता है कि मानक संवेदी मेट्रिक्स उन स्टिचिंग आर्टिफैक्ट्स (stitching artifacts) का पता लगाने में विफल रहते हैं जो डाउनस्ट्रीम सेगमेंटेशन प्रदर्शन को खराब करते हैं और यह कि जबकि आर्टिफैक्ट-मुक्त स्टिचिंग वाले 3D मॉडल मामूली लाभ प्रदान करते हैं, 2D मॉडल कम कम्प्यूटेशनल लागत के साथ अधिक स्थिर प्रशिक्षण प्रदान करते हैं।

Lucas von Chamier, Jan Philipp Albrecht, Dagmar Kainmüller2026-06-19
🤖 machine learning

EFIQA: Explainable Fundus Image Quality Assessment via Anatomical Priors

यह शोध पत्र EFIQA को प्रस्तुत करता है, जो फंडस इमेज क्वालिटी असेसमेंट के लिए एक नवीन, लेबल-मुक्त ढांचा है, जो व्याख्यात्मक स्थानिक गुणवत्ता मानचित्र (spatial quality maps) उत्पन्न करने के लिए मास्क्ड इनपेंटिंग और फीचर डिस्टिलेशन के माध्यम से शारीरिक पूर्ववृत्तों (anatomical priors) का लाभ उठाता है, और सामान्यीकरण एवं व्याख्यात्मकता में सुपरवाइज्ड विधियों से बेहतर प्रदर्शन करता है।

Pengwei Wang, José Morano, Qian Wan, Hrvoje Bogunović2026-06-19
💻 computer science

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model

FrozenDrive एक पैरामीटर-मुक्त, ज़ीरो-शॉट फ्रेमवर्क है जो वैश्विक रूप से सुसंगत, टेक्स्ट-गाइडेड मल्टी-व्यू ड्राइविंग दृश्यों को उत्पन्न करने के लिए ज्ञान-संरक्षण वाले स्पैटियो-टेम्पोरल अटेंशन के साथ एक फ्रोजन डिफ्यूजन मॉडल का लाभ उठाता है, जो बिना फाइन-ट्यूनिंग के प्रतिकूल और दुर्लभ स्थितियों में स्वायत्त ड्राइविंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Yuhwan Jeong, Hyeonseong Kim, Daehyun We, Seonkyu Song, Jinnyeong Yang, Hyun-Kurl Jang, Youngho Yoon, Kuk-Jin Yoon2026-06-19
⚡ electrical engineering

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

यह शोध पत्र पिक्सेल-लेवल रेसिडुअल डिफ्यूजन ट्रांसफॉर्मर (PRDiT) का प्रस्ताव करता है, जो एक स्केलेबल दो-चरणीय ढांचा है जो उच्च-रिज़ॉल्यूशन, उच्च-फिडेलिटी 3D CT वॉल्यूम को कुशलतापूर्वक उत्पन्न करने के लिए एक स्थानीय MLP-आधारित डिनोइज़र को एक वैश्विक रेसिडुअल डिफ्यूजन ट्रांसफॉर्मर के साथ जोड़ता है और मानक मेडिकल इमेजिंग डेटासेट पर अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।

Zhenkai Zhang, Markus Hiller, Krista A. Ehinger, Tom Drummond2026-06-19