⚡ electrical engineering

Classical versus Deep Mirror-Symmetry Scoring: A Benchmark of Thirteen Methods

यह शोध पत्र इमेज मिरर-सिमेट्री स्कोरिंग के लिए तेरह क्लासिकल और डीप लर्निंग-आधारित विधियों का बेंचमार्किंग करता है, जिससे यह पता चलता है कि हालांकि डीप बैकबोन समग्र रूप से सर्वश्रेष्ठ प्रदर्शन करते हैं, एक ट्यून्ड क्लासिकल HOG डिस्क्रिप्टर काफी प्रतिस्पर्धी विकल्प प्रदान करता है जिसके CPU इन्फरेंस काफी तेज़ है, जो यह सुझाव देता है कि इस कार्य के लिए फ्रोजन डीप फीचर्स एक अच्छी तरह से ट्यून्ड क्लासिकल डिस्क्रिप्टर की तुलना में बहुत कम लाभ प्रदान करते हैं।

Maximilian Woehrer2026-07-10
💻 computer science

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

यह शोध पत्र एंडोस्कोपी में रेफरिंग इमेज सेगमेंटेशन के लिए एक बड़े पैमाने के बेंचमार्क, ReferEndoscopy को प्रस्तुत करता है, और AR-ERIS फ्रेमवर्क का प्रस्ताव करता है, जो सिमुलेटेड और वास्तविक दुनिया के डेटा में मजबूत सामान्यीकरण के साथ अत्याधुनिक ओपन-वोकैबुलरी कंपोजिशनल सेगमेंटेशन प्राप्त करने के लिए एट्रिब्यूट रिट्रीवल का लाभ उठाता है।

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann2026-07-10
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV एक एकीकृत विशाल मल्टीमॉडल मॉडल है जो एक टेम्पोरल सिमिलरिटी राउटर द्वारा निर्देशित पूर्ण-छवि जनरेशन को एक कॉम्पैक्ट विजुअल-अपडेट प्रतिमान से बदलकर तर्क दक्षता और प्रदर्शन को बढ़ाता है, जिसे StructCoT नामक एक नए बड़े पैमाने के इंटरलीव्ड रीजनिंग डेटासेट का समर्थन प्राप्त है।

Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu2026-07-10
🤖 machine learning

Predicting Viticulture Potential through an Ensemble of U-Net and a Geospatial Foundation Model

यह शोध पत्र ImageCLEF AI4Agri 2026 प्रतियोगिता के लिए दूसरे स्थान की रैंकिंग सबमिशन प्रस्तुत करता है जो दक्षिणी फ्रांस में अंगूर की खेती (विटिकल्चर) की क्षमता की भविष्यवाणी करने के लिए 68.32% सटीकता के साथ U-Net और Prithvi-2.0 जियोस्पेशियल फाउंडेशन मॉडल के एक एनसेंबल का उपयोग करता है, जो टिकाऊ कृषि नियोजन के लिए रिमोट सेंसिंग की प्रभावकारिता को प्रदर्शित करता है।

Jorge Ignacio Perez, Hwaai Kang Kee, Lucas Rassbach2026-07-10
💻 computer science

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

यह शोध पत्र VEGAS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), क्रॉस-मोडल मीट्रिक है जो व्यक्तिगत दर्शकों के ध्यान के साथ बेहतर तालमेल बिठाने वाले वीडियो कैप्शन का मूल्यांकन और चयन करने के लिए सिंक्रोनाइज़्ड गेज़ डेटा (synchronized gaze data) का लाभ उठाता है, जिससे बिना मॉडल रिट्रेनिंग के कैप्शन की गुणवत्ता और डाउनस्ट्रीम रिट्रीवल कार्यों में सुधार होता है।

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu2026-07-10
💬 NLP

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

यह शोध पत्र एक संज्ञानात्मक-संरचित बहुविध एजेंट (Cognitive-structured Multimodal Agent) प्रस्तुत करता है जो संरचित अमूर्तीकरण और पुनर्प्राप्ति के साथ एक एपिसोडिक मेमोरी में दृश्य सूचना को बाह्य करके दीर्घ-अवधि वाले कार्यों में मोनोलिथिक एकीकृत मॉडलों की सीमाओं को दूर करता है, जो बड़े बेसलाइन की तुलना में बेहतर सटीकता और दक्षता प्राप्त करते हुए एक स्केलेबल टूल-ऑगमेंटेड परिनियोजन ढांचा प्रदान करता है।

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li2026-07-10
💻 computer science

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

यह शोध पत्र INCLUDE-BENCH प्रस्तुत करता है, जो टेक्स्ट-टू-इमेज मॉडलों में विकलांगता संबंधी पूर्वाग्रहों के मूल्यांकन के लिए पहला बड़े पैमाने का बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान प्रणालियाँ व्यवस्थित रूप से व्हीलचेयर जैसे संकीर्ण रूढ़ियों पर निर्भर करती हैं और विकलांग लोगों को चित्रित करते समय वास्तविक दुनिया के पूर्वाग्रही जुड़ावों के साथ अधिक गहरा तालमेल प्रदर्शित करती हैं।

Sophia Lichtenberg, Albert Gatt, Judith Masthoff2026-07-10
💻 computer science

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner एक GRPO-आधारित फ्रेमवर्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को एक दोहरे-स्तरीय विनियमन तंत्र (dual-level regulation mechanism) के माध्यम से प्रत्यक्ष उत्तर देने और स्पष्ट तर्क करने के बीच अनुकूल रूप से चयन करने में सक्षम बनाता है, जिससे विषम मल्टीटास्क सेटिंग्स में सटीकता-दक्षता संतुलन (accuracy-efficiency trade-off) को अनुकूलित किया जा सके।

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye2026-07-10
🤖 machine learning

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

यह शोध पत्र स्ट्रक्चर्ड स्पार्स ऑटोएनकोडर्स (S2AES^2AE) का प्रस्ताव करता है, जो एक नवीन विधि है जो इमेज पैचेस को समूहीकृत करके और स्ट्रक्चर्ड स्पैरसिटी रेगुलराइजेशन लागू करके विजन-लैंग्वेज मॉडल्स में सिमेंटिक और स्पेशियल कंसिस्टेंसी को लागू करती है, जिससे वैनिला SAEs की तुलना में कॉन्सेप्ट डिसेंटैंगलमेंट, सिमेंटिक अलाइनमेंट और रिप्रेजेंटेशनल एफिशिएंसी में महत्वपूर्ण सुधार प्राप्त होता है।

Weiduo Liao, Yunqiao Yang, Ying Wei2026-07-10
💻 computer science

Native Video-Action Pretraining for Generalizable Robot Control

LingBot-VA 2.0 एक वीडियो-एक्शन फाउंडेशन मॉडल है जिसे विशेष रूप से रोबोटिक एम्बॉडमेंटमेंट के लिए बनाया गया है, जिसमें एक सिमेंटिक विजुअल-एक्शन टोकेनाइज़र, कॉज़ल प्रीट्रेनिंग, एक स्पार्स MoE बैकबोन और एक एसिंक्रोनस इन्फरेंस स्कीम शामिल है ताकि वास्तविक दुनिया के वातावरण में मजबूत, फ्यू-शॉट जनरलाइज़ेबल कंट्रोल प्राप्त किया जा सके।

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei X (…)2026-07-10