💻 computer science

U-shaped Multi-granularity Learning for Vision-Language Models

विज़न-लैंग्वेज प्रॉम्प्ट लर्निंग में ग्रैनुलैरिटी (सूक्ष्मता) की दुविधा को संबोधित करने के लिए, यह शोध पत्र UPrompt का प्रस्ताव करता है, जो एक U-आकार का मल्टी-ग्रैनुलैरिटी फ्रेमवर्क है जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ 17 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए कोर्स-टू-फाइन (स्थूल-से-सूक्ष्म) कॉन्टेक्स्ट प्रोपेगेशन और फाइन-टू-कोर्स (सूक्ष्म-से-स्थूल) पदानुक्रमित पर्यवेक्षण को एकीकृत करता है।

Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo2026-07-17
🤖 machine learning

Parameter-efficient Prompt Tuning of Vision Foundation Model With Adaptive Focal Loss for Interpretable MCI Screening

यह शोध पत्र एक पैरामीटर-कुशल ढांचे का प्रस्ताव करता है जो डेटा की कमी और वर्ग असंतुलन से पार पाने के लिए सीखने योग्य प्रॉम्प्ट टोकन और एक अनुकूली फोकल लॉस का उपयोग करके एक फ्रोजन DINOv2-Small मॉडल को अनुकूलित करता है, ताकि न्यूरोसाइकोलॉजिकल ड्राइंग टेस्ट से माइल्ड कॉग्निटिव इम्पेयरमेंट की आंतरिक रूप से व्याख्या योग्य, उच्च-प्रदर्शन वाली स्क्रीनिंग सक्षम की जा सके।

Javad Khoramdel, Farhad Hoseyni, Amirhossein Nikoofard2026-07-17
💻 computer science

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA एक वीकली-सुपरवाइज्ड फ्रेमवर्क है जो 674K छवियों में नॉर्मलाइज्ड ऑब्जेक्ट कोऑर्डिनेट्स सुपरविजन के माध्यम से ज्योमेट्री-ग्राउंडेड फीचर लर्निंग को स्केल करता है और स्टेट-ऑफ-द-आर्ट, जीरो-शॉट CAD-टू-इमेज अलाइनमेंट प्राप्त करने के लिए एक ज्यामितीय रूप से सुसंगत मैचिंग एल्गोरिदम का उपयोग करता है जो दोनों मजबूत जीरो-शॉट बेसलाइन्स और पूरी तरह से सुपरवाइज्ड तरीकों से बेहतर प्रदर्शन करता है।

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez2026-07-17
🤖 machine learning

DriftWorld: Fast World Modeling through Drifting

DriftWorld एक अभिनव एक्शन-कंडीशन्ड वर्ल्ड मॉडल पेश करता है जो भविष्य के फ्रेम को सिंगल फॉरवर्ड पास में जेनरेट करने के लिए ड्रिफ्टिंग जनरेटिव मॉडल्स का लाभ उठाता है, जिससे डिफ्यूजन-आधारित बेसलाइन्स की तुलना में 17 गुना तेज़ इन्फरेंस प्राप्त होता है और साथ ही रोबोटिक प्लानिंग और पॉलिसी इवैल्यूएशन में स्टेट-ऑफ-द-आर्ट प्रदर्शन बनाए रखा जाता है।

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du2026-07-17
🤖 AI

Towards Hierarchical Structure Understanding of Newspaper Images

यह शोध पत्र एक मॉड्यूलर बॉटम-अप पाइपलाइन और 'तिरामिसु' (Tiramisu) नामक एक नवीन एंड-टू-एंड ट्रांसफार्मर आर्किटेक्चर के रूप में दो पूरक दृष्टिकोणों का प्रस्ताव करते हुए जटिल समाचार पत्र लेआउट को समझने की चुनौती को संबोधित करता है—साथ ही ऐतिहासिक समाचार पत्रों में पदानुक्रमित सूचना पुनर्प्राप्ति का मूल्यांकन करने के लिए एक नया डेटासेट, 'फिनलम ला लिबर्टी' (Finlam La Liberté) पेश करता है।

William Mocaër, Solène Tarride, Thomas Constum, Merveilles Agbeti-Messan, Tom Simon, Clément Chatelain, Stéphane Nicolas (…)2026-07-17
🤖 machine learning

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

AlphaWiSE एक पोस्ट-हॉक वेट इंटरपोलेशन विधि है जो निरंतर मल्टीमॉडल रिप्रेजेंटेशन लर्निंग को बेहतर बनाने के लिए एम्पलर मेमोरी पर फिट किए गए एक एकल स्केलर गुणांक का उपयोग करके दो फ्रोजन चेकपॉइंट्स को अनुकूल रूप से संयोजित करती है, जिससे इन्फरेंस समय या मॉडल के आकार में वृद्धि नहीं होती है।

Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu2026-07-17
🤖 AI

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

यह शोधपत्र Symbal को प्रस्तुत करता है, जो फाउंडेशन मॉडल्स का उपयोग करने वाली एक द्वि-चरणीय विधि है जिसका उपयोग छवियों और MLLM-जनित कैप्शन के बीच व्यवस्थित विसंगतियों का पता लगाने और उनका सारांश प्रस्तुत करने के लिए किया जाता है, साथ ही SymbalBench को भी प्रस्तुत करता है, जो एक बड़े पैमाने का बेंचमार्क है जो अंतर्निहित मॉडल्स तक पहुँच की आवश्यकता के बिना इमेज-टेक्स्ट डेटासेट के ऑडिट करने में Symbal के उत्कृष्ट प्रदर्शन को प्रदर्शित करता है।

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz2026-07-17
💬 NLP

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

यह शोध पत्र मीडियाइवल मेडिकोको 2025 जीआई एंडोस्कोपी डेटासेट पर नौ मल्टीमॉडल वीक्यूए (VQA) प्रणालियों का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि जहाँ पैरामीटर-कुशल अनुकूलन (parameter-efficient adaptation) मजबूत प्रदर्शन प्रदान करता है, वहीं विश्वसनीय स्वास्थ्य सेवा एआई प्राप्त करने के लिए केवल उत्तर की सटीकता के बजाय संरचित तर्क (structured reasoning), स्पष्ट ग्राउंडिंग (explicit grounding) और सुदृढ़ मूल्यांकन मेट्रिक्स को प्राथमिकता देना आवश्यक है।

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks2026-07-17
💻 computer science

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

यह शोध पत्र ARMOR++ को प्रस्तुत करता है, जो एक सुदृढ़ मल्टी-एजेंट फ्रेमवर्क है जो सख्त ब्लैक-बॉक्स बाधाओं के तहत मौजूदा अत्याधुनिक विधियों की तुलना में डीपफेक डिटेक्टरों के विरुद्ध काफी उच्च स्थानांतरणीयता और हमला सफलता दर प्राप्त करने के लिए Qwen2.5-VL और Qwen3 का उपयोग करके प्रतिकूल प्रिमिटिव्स (adversarial primitives) के एक विविध सेट को ऑर्केस्ट्रेट करता है।

Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis2026-07-17
🤖 machine learning

Online Neural Space Time Memory for Dynamic Novel View Synthesis

यह शोध पत्र गतिशील नवीन दृश्य संश्लेषण (डायनेमिक नोवेल व्यू सिंथेसिस) के लिए एक ऑनलाइन न्यूरल स्पेस-टाइम मेमोरी फ्रेमवर्क प्रस्तावित करता है जो आवधिक मेमोरी अपडेट को प्रति-फ्रेम अनुप्रयोग से अलग करके वास्तविक समय का प्रदर्शन प्राप्त करता है, जिससे सख्त कम्प्यूटेशनल बाधाओं के साथ निरंतर दीर्घकालिक पुनर्निर्माण को संतुलित किया जा सके।

Baback Elmieh, Lynn Tsai, Zeman Li, Srinivas Kaza, Tiancheng Sun, Gabor Csapo, Ali Behrouz, Yuan Deng, Stephen Lombardi (…)2026-07-17