💻 computer science

Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale

यह शोधपत्र अफ़ोगैटो (Affogato) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जिसमें एक बड़े पैमाने के, ओपन-वोकैबुलरी 3D अफोर्डेंस डेटासेट (Affogato-750K) को उत्पन्न करने के लिए एक पूर्णतः स्वचालित पाइपलाइन और सरल एकीकृत मॉडल (Espresso) शामिल हैं, जो अनदेखी वस्तु और अफोर्डेंस श्रेणियों में सामान्यीकरण (generalization) में महत्वपूर्ण सुधार करते हैं।

Junha Lee, Eunha Park, Chunghyun Park, Dahyun Kang, Minsu Cho2026-07-02
💻 computer science

Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions

यह शोध पत्र एक डिज़ाइन स्पेस और प्रोटोटाइप सिस्टम प्रस्तुत करता है जो कई MLLM-जनित छवि विवरणों के बीच विविधताओं को उजागर करता है, और 15 दृष्टिबाधित और अल्पदृष्टि वाले प्रतिभागियों के साथ एक अध्ययन के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण अविश्वसनीय जानकारी का पता लगाने में महत्वपूर्ण सुधार करता है और एकल विवरणों की तुलना में अत्यधिक पसंदीदा है।

Meng Chen, Akhil Iyer, Amy Pavel2026-07-02
💻 computer science

ENSAM: an efficient foundation model for interactive segmentation of 3D medical images

ENSAM एक हल्का, फाउंडेशन मॉडल है जो इंटरैक्टिव 3D मेडिकल इमेज सेगमेंटेशन के लिए है और जो SegResNet-आधारित आर्किटेक्चर को नॉर्मलाइज्ड अटेंशन और म्यूऑन (Muon) ऑप्टिमाइज़र जैसी उन्नत प्रशिक्षण तकनीकों के साथ जोड़कर सीमित डेटा और कंप्यूटेशनल बजट के तहत अत्याधुनिक प्रदर्शन प्राप्त करता है, और CVPR 2025 फाउंडेशन मॉडल्स फॉर इंटरैक्टिव 3D बायोमेडिकल इमेज सेगमेंटेशन चैलेंज में कई प्रीट्रेन्ड बेसलाइन्स से बेहतर प्रदर्शन करता है।

Elias Stenhede, Agnar Martin Bjørnstad, Arian Ranjbar2026-07-02
💻 computer science

Digitizing Paper ECGs at Scale: An Open-Source Algorithm for Clinical Research

यह शोध पत्र एक पूर्णतः स्वचालित, ओपन-सोर्स फ्रेमवर्क को प्रस्तुत और मान्य करता है जो लाखों मौजूदा कागजी ईसीजी (ECG) स्कैन को डिजिटल संकेतों में परिवर्तित करता है, जो बड़े पैमाने पर रेट्रोस्पेक्टिव क्लिनिकल अनुसंधान और एआई-संचालित निदान को सक्षम करने के लिए विविध डेटासेट पर अत्याधुनिक तरीकों से काफी बेहतर प्रदर्शन करता है।

Elias Stenhede, Agnar Martin Bjørnstad, Arian Ranjbar2026-07-02
💻 computer science

Unifying Convolution and Attention via Convolutional Nearest Neighbors

यह शोधपत्र कनवल्शनल नियरेस्ट नेबर्स (ConvNN) को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो यह प्रदर्शित करता है कि कनवल्शन और सेल्फ-अटेंशन एक एकल kk-नियरेस्ट नेबर एग्रीगेशन प्रक्रिया के विशेष मामले हैं, जिससे इन दोनों प्रमुख कंप्यूटर विजन आर्किटेक्चरों के बीच सेतु बनता है और ImageNet-1K पर अत्याधुनिक प्रदर्शन सुधार प्राप्त होता है।

Mingi Kang, Jeová Farias Sales Rocha Neto2026-07-02
💻 computer science

TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid

TetraSDF एक विश्लेषणात्मक आइसोसरफेस निष्कर्षण ढांचे (analytic isosurface extraction framework) को पेश करता है जो एक वैश्विक निरंतर पीसवाइज एफाइन संरचना (global continuous piecewise affine structure) को संरक्षित करने के लिए एक मल्टी-रेज़ोल्यूशन टेट्राहेड्रल पोजीशनल एनकोडर को ReLU MLP के साथ जोड़ता है, जो विविक्तीकरण त्रुटियों (discretization errors) के बिना सटीक ज़ीरो-लेवल सेट निष्कर्षण सक्षम बनाता है और उच्च-आवृत्ति SDF अभिव्योजकता (high-frequency SDF expressiveness) को बनाए रखता है।

Seonghun Oh, Youngjung Uh, Jin-Hwa Kim2026-07-02
🤖 machine learning

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

यह शोध पत्र VisReason को प्रस्तुत करता है, जो मानव-समान, बहु-चरणीय तर्कों वाले 489K एनोटेटेड उदाहरणों का एक बड़े पैमाने का डेटासेट है, और इसके विशेषज्ञ-क्यूरेटेड उपसमुच्चय VisReason-Pro को, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की चरण-दर-चरण दृश्य तर्क, व्याख्यात्मकता और सामान्यीकरण क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You2026-07-02
💻 computer science

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

यह शोध पत्र RoadBench प्रस्तुत करता है, जो पाँच चीनी शहरों के शहरी सड़क चिह्नों से प्राप्त आठ कार्यों और 3,000 से अधिक मैन्युअल रूप से सत्यापित मामलों वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि बर्ड्स-आई व्यू (Bird's-Eye View) और फर्स्ट-पर्सन व्यू (First-Person View) दोनों इनपुट पर मूल्यांकन किए जाने पर वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की सूक्ष्म स्थानिक समझ और तर्क क्षमताओं में महत्वपूर्ण कमियाँ हैं।

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li2026-07-02
💻 computer science

SONIC: Spectral Optimization of Noise for Inpainting with Consistency

यह शोध पत्र SONIC को प्रस्तुत करता है, जो एक ट्रेनिंग-फ्री इनपेंटिंग विधि है जो लीनियर एप्रोक्सिमेशन और स्पेक्ट्रल प्रीकंडीशनिंग का उपयोग करके प्रारंभिक नॉइज़ सैंपल को ऑप्टिमाइज़ करती है ताकि ऑफ-द-शेल्फ टेक्स्ट-टू-इमेज मॉडल्स को बिना किसी अतिरिक्त ट्रेनिंग के स्पेशलाइज्ड इनपेंटिंग मॉडल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

Seungyeon Baek, Erqun Dong, Shadan Namazifard, Mark J. Matthews, Kwang Moo Yi2026-07-02
💻 computer science

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

यह शोध पत्र रिसेम्पलिंग फोर्सिंग (Resampling Forcing) को प्रस्तुत करता है, जो ऑटोरेग्रेसिव वीडियो डिफ्यूजन मॉडल्स के लिए एक टीचर-फ्री, एंड-टू-एंड ट्रेनिंग फ्रेमवर्क है, जो एक्सपोज़र बायस (exposure bias) को कम करने के लिए सेल्फ-रिसेम्पलिंग और कुशल, टेम्पोरल रूप से सुसंगत लॉन्ग-होराइजन जनरेशन को सक्षम करने के लिए हिस्ट्री रूटिंग का उपयोग करता है।

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin2026-07-02