🤖 machine learning

Curvature-Guided Mixing for MLLM Adaptation

यह शोध पत्र कर्वेचर-गाइडेड मिक्सिंग (CGM) का प्रस्ताव करता है, जो एक सैद्धांतिक रूप से आधारित ढांचा है जो अनुकूलतम पैरामीटर मिश्रण अनुपातों को विश्लेषणात्मक रूप से व्युत्पन्न करने के लिए द्वितीय-क्रम हेसियन सन्निकटन (second-order Hessian approximations) का उपयोग करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करते हुए कार्य विशिष्टता और सामान्य ज्ञान प्रतिधारण के बीच प्रभावी ढंग से संतुलन बनाता है।

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang2026-06-25
🤖 AI

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

यह शोध पत्र युवियन वीएल (Yuvion VL) को प्रस्तुत करता है, जो कंटेंट और एआई सुरक्षा के लिए विशेष रूप से निर्मित मल्टीमॉडल फाउंडेशन मॉडल्स का एक परिवार है, जो वास्तविक दुनिया के मल्टीमॉडल जोखिमों की पहचान करने में उद्योग-अग्रणी मजबूती और प्रदर्शन प्राप्त करने के लिए एक एडवर्सरियल-अवेयर डेटा पाइपलाइन, एक तीन-चरणीय प्रशिक्षण रणनीति और एक नवीन कन्फ्यूज-देन-कॉन्ट्रास्ट फाइन-ट्यूनिंग फ्रेमवर्क का लाभ उठाता है।

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian (…)2026-06-25
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer एक नेटिव-स्ट्रीमिंग, एंड-टू-एंड इंटरैक्टिव फाउंडेशन मॉडल है जो लगभग 200 ms मॉडल-साइड लेटेंसी के साथ सब-सेकंड, फुल-डुप्लेक्स मल्टीमॉडल संचार प्राप्त करने के लिए एक ही ट्रांसफॉर्मर के भीतर भाषा, ऑडियो और वीडियो प्रोसेसिंग को एकीकृत करता है, जो पारंपरिक कैस्केडेड सिस्टम में निहित त्रुटि संचय और देरी को समाप्त करता है।

Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang (…)2026-06-25
🤖 AI

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

यह शोध पत्र इस बात की जांच करता है कि क्या विजन-लैंग्वेज मॉडल रीजनिंग टोकन काउंट को रिएक्शन टाइम के प्रॉक्सी के रूप में उपयोग करके मानव जैसे विजुअल सर्च व्यवहार प्रदर्शित करते हैं, जिसमें यह पाया गया है कि हालांकि मॉडल फ्लैट फीचर सर्च कॉस्ट और बढ़ते कंजंक्शन कॉस्ट जैसे प्रमुख मानवीय हस्ताक्षरों की नकल करते हैं, वे टारगेट-प्रेजेंट स्लोप्स, एन्यूमरेशन सटीकता और एडेप्टिव डेलिब्रेशन रणनीतियों में स्पष्ट संज्ञानात्मक विचलन भी प्रकट करते हैं।

Farahnaz Wick2026-06-25
⚡ electrical engineering

Benchmarking the Alignment of Data-Quality Metrics, Human Judgment and Land-Cover Segmentation Performance for Earth Observation

यह शोध पत्र प्रदर्शित करता है कि सिंथेटिक अर्थ ऑब्जर्वेशन (पृथ्वी अवलोकन) डेटा के लिए मानक स्वचालित फिडेलिटी मेट्रिक्स अक्सर मानव धारणा और डाउनस्ट्रीम सेगमेंटेशन प्रदर्शन के साथ गलत संरेखित होते हैं, जो यह प्रकट करता है कि वर्तमान मेट्रिक्स भू-स्थानिक अनुप्रयोगों के लिए अविश्वसनीय हैं और उन्हें कार्य उपयोगिता तथा मानव निर्णय पर आधारित मूल्यांकनों द्वारा प्रतिस्थापित किया जाना चाहिए।

Ümit Mert Çağlar, Alptekin Temizel2026-06-25
💻 computer science

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

यह शोध पत्र विजन-लैंग्वेज मॉडल्स के लिए एक तर्क-आधारित (rationale-informed) प्रूनिंग रणनीति प्रस्तावित करता है जो "दोहरी-सटीक" (doubly-correct) भविष्यवाणियों को सुनिश्चित करती है—जहाँ आउटपुट सटीक और साक्ष्य-आधारित दोनों होते हैं—ताकि मानव-रोबोट सहयोग के लिए कम-विलंबता (low-latency), सुरक्षित और विश्वसनीय एगोसेंट्रिक विजुअल समझ प्राप्त की जा सके।

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen2026-06-25
💻 computer science

Homomorphic Encryptions for Privacy Preserving Vision

यह शोध पत्र माइक्रोसॉफ्ट सीएल (Microsoft SEAL) और टेन्सिल (TenSEAL) का उपयोग करते हुए फुली होमोमोर्फिक एन्क्रिप्शन (Fully Homomorphic Encryption) का उपयोग करके एक गोपनीयता-संरक्षण कंप्यूटर विज़न फ्रेमवर्क प्रस्तुत करता है, जो विविध डेटासेट (MNIST से CIFAR-10 तक) में न्यूनतम सटीकता हानि के साथ एन्क्रिप्टेड डेटा पर सटीक सीएनएन (CNN) इन्फरेंस को सक्षम करने के साथ-साथ मल्टी-चैनल प्रोसेसिंग और कई कनवल्शनल लेयर्स जैसे जटिल ऑपरेशन्स का समर्थन करता है।

Preey Shah, Rohan Virani, Sanjari Srivastava2026-06-25
💻 computer science

Structuring Sparsity: Block-Sparse Featurizers Capture Visual Concept Manifolds

यह शोधपत्र विज़ुअल कॉन्सेप्ट्स को अलग-थलग दिशाओं के बजाय निम्न-आयामी मैनिफोल्ड्स के रूप में मॉडल करने के लिए ब्लॉक-स्पार्स फीचरइज़र (BSFs) प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण अधिक संक्षिप्त प्रतिनिधित्व प्रदान करता है, कर्व मैनिफोल्ड्स और लाइटिंग प्रभावों जैसी निरंतर कॉन्सेप्ट संरचनाओं को प्रकट करता है, और इमेज जनरेशन में व्याख्या योग्य नियंत्रण सक्षम करता है।

Thomas Fel, Matthew Kowal, Mozes Jacobs, Dron Hazra, Usha Bhalla, Lee Sharkey, Lucius Bushnaq, Satchel Grant, Tal Haklay (…)2026-06-25
🤖 machine learning

Pre-Warm: Input-Conditioned Weight Initialization for Convolutional Neural Networks

Pre-Warm एक शून्य-प्रशिक्षण-लागत (zero-training-cost) विधि है जो कन्वोल्शनल न्यूरल नेटवर्क की सटीकता में सुधार करती है, जिसमें प्रशिक्षण डेटा के क्लस्टरिंग मीन-सेंटर्ड लोकल पैचेस से प्राप्त सेंट्रोइड्स का उपयोग करके पहली परत के आधे फिल्टर को इनिशियलाइज़ किया जाता है, जबकि शेष के लिए केइमिंग इनिशियलाइजेशन (Kaiming initialization) को बरकरार रखा जाता है।

Rowan Martnishn2026-06-25
🤖 AI

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

यह शोध पत्र फिजिक्स क्वेश्चन सीन ग्राफ (PQSG) प्रस्तुत करता है, जो एक पदानुक्रमित, ग्राफ-आधारित मूल्यांकन पाइपलाइन है जो टेक्स्ट-टू-वीडियो जनरेशन की भौतिक सुसंगतता का सूक्ष्म सटीकता के साथ आकलन करने के लिए विजन-लैंग्वेज मॉडल का उपयोग करता है, जिसे नए फाइनफाईइवल (FinePhyEval) डेटासेट के माध्यम से मान्य किया गया है जो पूर्व विधियों की तुलना में मानव निर्णयों के साथ PQSG के बेहतर सहसंबंध को प्रदर्शित करता है।

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal2026-06-25