💻 computer science

Neural Particle Automata: Learning Self-Organizing Particle Dynamics

यह शोध पत्र न्यूरल पार्टिकल ऑटोमेटा (NPA) को प्रस्तुत करता है, जो न्यूरल सेलुलर ऑटोमेटा का एक सीखने योग्य, पार्टिकल-आधारित सामान्यीकरण है, जो मॉर्फोजेनेसिस और टेक्सचर सिंथेसिस जैसे कार्यों के लिए स्केलेबल, स्व-संगठित गतिकी को सक्षम करने हेतु डिफरेंशिएबल स्मूद्थड पार्टिकल हाइड्रोडायनामिक्स ऑपरेटर्स का उपयोग करता है।

Hyunsoo Kim, Ehsan Pajouheshgar, Sabine Süsstrunk, Wenzel Jakob, Jinah Park2026-06-25
💬 NLP

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

यह शोधपत्र SPARC प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल्स में विजुअल परसेप्शन को रीजनिंग से अलग करता है ताकि कुशल, एसिमेट्रिक टेस्ट-टाइम स्केलिंग को सक्षम बनाया जा सके और कम टोकन बजट के साथ विजुअल रीजनिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigot (…)2026-06-25
💻 computer science

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion एक एकीकृत ढांचा है जो मौजूदा विधियों की तुलना में वीडियो निर्माण में काफी बेहतर दृश्य निष्ठा और गति सुसंगतता प्राप्त करने के लिए एक नए वास्तविक-विश्व डेटासेट (RealCOD-25K) द्वारा समर्थित, स्पष्ट ज्यामिति-जागरूक संकेतों और 3D प्रक्षेपवक्र एम्बेडिंग का उपयोग करके कैमरा प्रक्षेपवक्र और वस्तु गतिशीलता को संयुक्त रूप से नियंत्रित करता है।

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang2026-06-25
🤖 machine learning

Curvature-Guided Mixing for MLLM Adaptation

यह शोध पत्र कर्वेचर-गाइडेड मिक्सिंग (CGM) का प्रस्ताव करता है, जो एक सैद्धांतिक रूप से आधारित ढांचा है जो अनुकूलतम पैरामीटर मिश्रण अनुपातों को विश्लेषणात्मक रूप से व्युत्पन्न करने के लिए द्वितीय-क्रम हेसियन सन्निकटन (second-order Hessian approximations) का उपयोग करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करते हुए कार्य विशिष्टता और सामान्य ज्ञान प्रतिधारण के बीच प्रभावी ढंग से संतुलन बनाता है।

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang2026-06-25
🤖 AI

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

यह शोध पत्र युवियन वीएल (Yuvion VL) को प्रस्तुत करता है, जो कंटेंट और एआई सुरक्षा के लिए विशेष रूप से निर्मित मल्टीमॉडल फाउंडेशन मॉडल्स का एक परिवार है, जो वास्तविक दुनिया के मल्टीमॉडल जोखिमों की पहचान करने में उद्योग-अग्रणी मजबूती और प्रदर्शन प्राप्त करने के लिए एक एडवर्सरियल-अवेयर डेटा पाइपलाइन, एक तीन-चरणीय प्रशिक्षण रणनीति और एक नवीन कन्फ्यूज-देन-कॉन्ट्रास्ट फाइन-ट्यूनिंग फ्रेमवर्क का लाभ उठाता है।

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian (…)2026-06-25
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer एक नेटिव-स्ट्रीमिंग, एंड-टू-एंड इंटरैक्टिव फाउंडेशन मॉडल है जो लगभग 200 ms मॉडल-साइड लेटेंसी के साथ सब-सेकंड, फुल-डुप्लेक्स मल्टीमॉडल संचार प्राप्त करने के लिए एक ही ट्रांसफॉर्मर के भीतर भाषा, ऑडियो और वीडियो प्रोसेसिंग को एकीकृत करता है, जो पारंपरिक कैस्केडेड सिस्टम में निहित त्रुटि संचय और देरी को समाप्त करता है।

Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang (…)2026-06-25
🤖 AI

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

यह शोध पत्र इस बात की जांच करता है कि क्या विजन-लैंग्वेज मॉडल रीजनिंग टोकन काउंट को रिएक्शन टाइम के प्रॉक्सी के रूप में उपयोग करके मानव जैसे विजुअल सर्च व्यवहार प्रदर्शित करते हैं, जिसमें यह पाया गया है कि हालांकि मॉडल फ्लैट फीचर सर्च कॉस्ट और बढ़ते कंजंक्शन कॉस्ट जैसे प्रमुख मानवीय हस्ताक्षरों की नकल करते हैं, वे टारगेट-प्रेजेंट स्लोप्स, एन्यूमरेशन सटीकता और एडेप्टिव डेलिब्रेशन रणनीतियों में स्पष्ट संज्ञानात्मक विचलन भी प्रकट करते हैं।

Farahnaz Wick2026-06-25
⚡ electrical engineering

Benchmarking the Alignment of Data-Quality Metrics, Human Judgment and Land-Cover Segmentation Performance for Earth Observation

यह शोध पत्र प्रदर्शित करता है कि सिंथेटिक अर्थ ऑब्जर्वेशन (पृथ्वी अवलोकन) डेटा के लिए मानक स्वचालित फिडेलिटी मेट्रिक्स अक्सर मानव धारणा और डाउनस्ट्रीम सेगमेंटेशन प्रदर्शन के साथ गलत संरेखित होते हैं, जो यह प्रकट करता है कि वर्तमान मेट्रिक्स भू-स्थानिक अनुप्रयोगों के लिए अविश्वसनीय हैं और उन्हें कार्य उपयोगिता तथा मानव निर्णय पर आधारित मूल्यांकनों द्वारा प्रतिस्थापित किया जाना चाहिए।

Ümit Mert Çağlar, Alptekin Temizel2026-06-25
💻 computer science

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

यह शोध पत्र विजन-लैंग्वेज मॉडल्स के लिए एक तर्क-आधारित (rationale-informed) प्रूनिंग रणनीति प्रस्तावित करता है जो "दोहरी-सटीक" (doubly-correct) भविष्यवाणियों को सुनिश्चित करती है—जहाँ आउटपुट सटीक और साक्ष्य-आधारित दोनों होते हैं—ताकि मानव-रोबोट सहयोग के लिए कम-विलंबता (low-latency), सुरक्षित और विश्वसनीय एगोसेंट्रिक विजुअल समझ प्राप्त की जा सके।

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen2026-06-25
💻 computer science

Homomorphic Encryptions for Privacy Preserving Vision

यह शोध पत्र माइक्रोसॉफ्ट सीएल (Microsoft SEAL) और टेन्सिल (TenSEAL) का उपयोग करते हुए फुली होमोमोर्फिक एन्क्रिप्शन (Fully Homomorphic Encryption) का उपयोग करके एक गोपनीयता-संरक्षण कंप्यूटर विज़न फ्रेमवर्क प्रस्तुत करता है, जो विविध डेटासेट (MNIST से CIFAR-10 तक) में न्यूनतम सटीकता हानि के साथ एन्क्रिप्टेड डेटा पर सटीक सीएनएन (CNN) इन्फरेंस को सक्षम करने के साथ-साथ मल्टी-चैनल प्रोसेसिंग और कई कनवल्शनल लेयर्स जैसे जटिल ऑपरेशन्स का समर्थन करता है।

Preey Shah, Rohan Virani, Sanjari Srivastava2026-06-25