⚡ electrical engineering

Benchmarking the Alignment of Data-Quality Metrics, Human Judgment and Land-Cover Segmentation Performance for Earth Observation

यह शोध पत्र प्रदर्शित करता है कि सिंथेटिक अर्थ ऑब्जर्वेशन (पृथ्वी अवलोकन) डेटा के लिए मानक स्वचालित फिडेलिटी मेट्रिक्स अक्सर मानव धारणा और डाउनस्ट्रीम सेगमेंटेशन प्रदर्शन के साथ गलत संरेखित होते हैं, जो यह प्रकट करता है कि वर्तमान मेट्रिक्स भू-स्थानिक अनुप्रयोगों के लिए अविश्वसनीय हैं और उन्हें कार्य उपयोगिता तथा मानव निर्णय पर आधारित मूल्यांकनों द्वारा प्रतिस्थापित किया जाना चाहिए।

Ümit Mert Çağlar, Alptekin Temizel2026-06-25
💻 computer science

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

यह शोध पत्र विजन-लैंग्वेज मॉडल्स के लिए एक तर्क-आधारित (rationale-informed) प्रूनिंग रणनीति प्रस्तावित करता है जो "दोहरी-सटीक" (doubly-correct) भविष्यवाणियों को सुनिश्चित करती है—जहाँ आउटपुट सटीक और साक्ष्य-आधारित दोनों होते हैं—ताकि मानव-रोबोट सहयोग के लिए कम-विलंबता (low-latency), सुरक्षित और विश्वसनीय एगोसेंट्रिक विजुअल समझ प्राप्त की जा सके।

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen2026-06-25
💻 computer science

Homomorphic Encryptions for Privacy Preserving Vision

यह शोध पत्र माइक्रोसॉफ्ट सीएल (Microsoft SEAL) और टेन्सिल (TenSEAL) का उपयोग करते हुए फुली होमोमोर्फिक एन्क्रिप्शन (Fully Homomorphic Encryption) का उपयोग करके एक गोपनीयता-संरक्षण कंप्यूटर विज़न फ्रेमवर्क प्रस्तुत करता है, जो विविध डेटासेट (MNIST से CIFAR-10 तक) में न्यूनतम सटीकता हानि के साथ एन्क्रिप्टेड डेटा पर सटीक सीएनएन (CNN) इन्फरेंस को सक्षम करने के साथ-साथ मल्टी-चैनल प्रोसेसिंग और कई कनवल्शनल लेयर्स जैसे जटिल ऑपरेशन्स का समर्थन करता है।

Preey Shah, Rohan Virani, Sanjari Srivastava2026-06-25
💻 computer science

Structuring Sparsity: Block-Sparse Featurizers Capture Visual Concept Manifolds

यह शोधपत्र विज़ुअल कॉन्सेप्ट्स को अलग-थलग दिशाओं के बजाय निम्न-आयामी मैनिफोल्ड्स के रूप में मॉडल करने के लिए ब्लॉक-स्पार्स फीचरइज़र (BSFs) प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण अधिक संक्षिप्त प्रतिनिधित्व प्रदान करता है, कर्व मैनिफोल्ड्स और लाइटिंग प्रभावों जैसी निरंतर कॉन्सेप्ट संरचनाओं को प्रकट करता है, और इमेज जनरेशन में व्याख्या योग्य नियंत्रण सक्षम करता है।

Thomas Fel, Matthew Kowal, Mozes Jacobs, Dron Hazra, Usha Bhalla, Lee Sharkey, Lucius Bushnaq, Satchel Grant, Tal Haklay (…)2026-06-25
🤖 machine learning

Pre-Warm: Input-Conditioned Weight Initialization for Convolutional Neural Networks

Pre-Warm एक शून्य-प्रशिक्षण-लागत (zero-training-cost) विधि है जो कन्वोल्शनल न्यूरल नेटवर्क की सटीकता में सुधार करती है, जिसमें प्रशिक्षण डेटा के क्लस्टरिंग मीन-सेंटर्ड लोकल पैचेस से प्राप्त सेंट्रोइड्स का उपयोग करके पहली परत के आधे फिल्टर को इनिशियलाइज़ किया जाता है, जबकि शेष के लिए केइमिंग इनिशियलाइजेशन (Kaiming initialization) को बरकरार रखा जाता है।

Rowan Martnishn2026-06-25
🤖 AI

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

यह शोध पत्र फिजिक्स क्वेश्चन सीन ग्राफ (PQSG) प्रस्तुत करता है, जो एक पदानुक्रमित, ग्राफ-आधारित मूल्यांकन पाइपलाइन है जो टेक्स्ट-टू-वीडियो जनरेशन की भौतिक सुसंगतता का सूक्ष्म सटीकता के साथ आकलन करने के लिए विजन-लैंग्वेज मॉडल का उपयोग करता है, जिसे नए फाइनफाईइवल (FinePhyEval) डेटासेट के माध्यम से मान्य किया गया है जो पूर्व विधियों की तुलना में मानव निर्णयों के साथ PQSG के बेहतर सहसंबंध को प्रदर्शित करता है।

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal2026-06-25
🤖 AI

ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency

ESTANet एक हल्का, रियल-टाइम फ्रेमवर्क है जो प्रोसीजरल वीडियो में ऑनलाइन एरर डिटेक्शन के लिए, जटिल आर्किटेक्चरल डिजाइनों के बिना अत्याधुनिक प्रदर्शन प्राप्त करने हेतु विभिन्न टेम्पोरल कॉन्टेक्स्ट वाले मानक और एरर-सेंसिटिव एक्शन डिटेक्टर्स के बीच प्रेडिक्शन इनकंसिस्टेंसी का लाभ उठाता है।

Shih-Po Lee, Reza Ghoddoosian, Faizan Siddiqui, Enna Sachdeva, Behzad Dariush2026-06-25
🤖 machine learning

REViT: Roto-reflection Equivariant Convolutional Vision Transformer

यह शोध पत्र REViT को प्रस्तुत करता है, जो एक नवीन डिस्क्रीट रोटो-रिफ्लेक्शन इक्विवैरिएंट विज़न ट्रांसफार्मर है जो रोटेशनल, फ्लिप और पोजीशनल सिमिट्रीज़ को प्रभावी ढंग से संरक्षित करने के लिए कन्वोल्यूशनल अटेंशन को शामिल करता है, जो मौजूदा इक्विवैरिएंट न्यूरल नेटवर्क दृष्टिकोणों की तुलना में इमेज क्लासिफिकेशन में बेहतर प्रदर्शन प्रदर्शित करता है।

Sheir A. Zaheer, Alexander C. Holston, Chan Y. Park2026-06-25
💻 computer science

Hypergraph Normal World Models for Logical Visual Anomaly Detection

यह शोध पत्र हाइपरग्राफ नॉर्मल वर्ल्ड मॉडल (Hypergraph Normal World Model) का प्रस्ताव करता है, जो एक वन-क्लास डिटेक्टर है जो केवल स्थानीय पैच के बजाय श्रेणी-विशिष्ट सामान्य संबंधों को मॉडल करने के लिए फ्रोजन (frozen) DINOv2 फीचर्स को पैच, रिलेशनल और हाइपरग्राफ सांख्यिकी में संकुचित (distill) करता है ताकि तार्किक दृश्य विसंगतियों (logical visual anomalies) की प्रभावी ढंग से पहचान की जा सके।

Weizhi Nie, Zibo Xu, Weijie Wang, Yuting Su2026-06-25
🤖 machine learning

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation

यह शोध पत्र तर्क देता है कि संक्षिप्तता उत्पन्न करने के लिए डेटा क्यूरेशन (data curation) VLM इन्फरेंस दक्षता में सुधार के लिए एक महत्वपूर्ण लीवर है, जो यह प्रदर्शित करता है कि संक्षिप्त और सटीक डेटा पर प्रशिक्षण, सटीकता से समझौता किए बिना, प्रति सही उत्तर की कम्प्यूटेशनल लागत (Cost-of-Pass) को काफी कम कर देता है, और अक्सर आउटपुट की लंबाई स्थिर होने पर भी प्रदर्शन में सुधार करता है।

DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab (…)2026-06-25