💻 computer science

Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering

यह शोध पत्र "काउंटरफीट आन्सर्स" (Counterfeit Answers) नामक एक नवीन प्रतिकूल हमले के परिदृश्य को प्रस्तुत करता है जो दस्तावेज़ की सामग्री को दृश्य रूप से अदृश्य तरीकों से गढ़ता है ताकि OCR-मुक्त डॉक्यूमेंट विजुअल क्वेश्चन अनस्वियरिंग मॉडल्स को विशिष्ट या गलत उत्तर उत्पन्न करने के लिए हेरफेर किया जा सके, जो Pix2Struct और Donut जैसे अत्याधुनिक सिस्टम की महत्वपूर्ण कमजोरियों को प्रदर्शित करता है।

Marco Pintore, Maura Pintor, Dimosthenis Karatzas, Battista Biggio2026-06-25
💻 computer science

SplatPainter: Interactive Authoring of 3D Gaussians from 2D Edits via Test-Time Training

SplatPainter एक स्टेट-अवेयर फीडफॉरवर्ड मॉडल है जो तीव्र, सटीक और पहचान-संरक्षित रिफाइनमेंट के लिए टेस्ट-टाइम ट्रेनिंग का लाभ उठाकर 2D उपयोगकर्ता इनपुट के माध्यम से 3D गॉसियन एसेट्स के इंटरैक्टिव, हाई-फिडेलिटी संपादन को सक्षम बनाता है।

Yang Zheng, Hao Tan, Kai Zhang, Peng Wang, Leonidas Guibas, Gordon Wetzstein, Wang Yifan2026-06-25
💻 computer science

VENI: Variational Encoder for Natural Illumination

यह शोध पत्र VENI का प्रस्ताव करता है, जो एक रोटेशन-इक्विवेरिएंट वेरिएशनल ऑटोएन्कोडर है जो 2D प्रोजेक्शन के बिना एक गोले पर प्राकृतिक प्रकाश व्यवस्था को मॉडल करने के लिए एक नवीन वेक्टर न्यूरॉन विजन ट्रांसफार्मर और एक कंडीशनल न्यूरल फील्ड का उपयोग करता है, जिससे मौजूदा विधियों की तुलना में अधिक सुचारू इंटरपोलेशन के साथ एक सुव्यवस्थित लेटेंट स्पेस प्राप्त होता है।

Paul Walker, James A. D. Gardner, Andreea Ardelean, William A. P. Smith, Bernhard Egger2026-06-25
💻 computer science

Neural Particle Automata: Learning Self-Organizing Particle Dynamics

यह शोध पत्र न्यूरल पार्टिकल ऑटोमेटा (NPA) को प्रस्तुत करता है, जो न्यूरल सेलुलर ऑटोमेटा का एक सीखने योग्य, पार्टिकल-आधारित सामान्यीकरण है, जो मॉर्फोजेनेसिस और टेक्सचर सिंथेसिस जैसे कार्यों के लिए स्केलेबल, स्व-संगठित गतिकी को सक्षम करने हेतु डिफरेंशिएबल स्मूद्थड पार्टिकल हाइड्रोडायनामिक्स ऑपरेटर्स का उपयोग करता है।

Hyunsoo Kim, Ehsan Pajouheshgar, Sabine Süsstrunk, Wenzel Jakob, Jinah Park2026-06-25
💬 NLP

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

यह शोधपत्र SPARC प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल्स में विजुअल परसेप्शन को रीजनिंग से अलग करता है ताकि कुशल, एसिमेट्रिक टेस्ट-टाइम स्केलिंग को सक्षम बनाया जा सके और कम टोकन बजट के साथ विजुअल रीजनिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigot (…)2026-06-25
💻 computer science

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion एक एकीकृत ढांचा है जो मौजूदा विधियों की तुलना में वीडियो निर्माण में काफी बेहतर दृश्य निष्ठा और गति सुसंगतता प्राप्त करने के लिए एक नए वास्तविक-विश्व डेटासेट (RealCOD-25K) द्वारा समर्थित, स्पष्ट ज्यामिति-जागरूक संकेतों और 3D प्रक्षेपवक्र एम्बेडिंग का उपयोग करके कैमरा प्रक्षेपवक्र और वस्तु गतिशीलता को संयुक्त रूप से नियंत्रित करता है।

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang2026-06-25
🤖 machine learning

Curvature-Guided Mixing for MLLM Adaptation

यह शोध पत्र कर्वेचर-गाइडेड मिक्सिंग (CGM) का प्रस्ताव करता है, जो एक सैद्धांतिक रूप से आधारित ढांचा है जो अनुकूलतम पैरामीटर मिश्रण अनुपातों को विश्लेषणात्मक रूप से व्युत्पन्न करने के लिए द्वितीय-क्रम हेसियन सन्निकटन (second-order Hessian approximations) का उपयोग करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करते हुए कार्य विशिष्टता और सामान्य ज्ञान प्रतिधारण के बीच प्रभावी ढंग से संतुलन बनाता है।

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang2026-06-25
🤖 AI

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

यह शोध पत्र युवियन वीएल (Yuvion VL) को प्रस्तुत करता है, जो कंटेंट और एआई सुरक्षा के लिए विशेष रूप से निर्मित मल्टीमॉडल फाउंडेशन मॉडल्स का एक परिवार है, जो वास्तविक दुनिया के मल्टीमॉडल जोखिमों की पहचान करने में उद्योग-अग्रणी मजबूती और प्रदर्शन प्राप्त करने के लिए एक एडवर्सरियल-अवेयर डेटा पाइपलाइन, एक तीन-चरणीय प्रशिक्षण रणनीति और एक नवीन कन्फ्यूज-देन-कॉन्ट्रास्ट फाइन-ट्यूनिंग फ्रेमवर्क का लाभ उठाता है।

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian (…)2026-06-25
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer एक नेटिव-स्ट्रीमिंग, एंड-टू-एंड इंटरैक्टिव फाउंडेशन मॉडल है जो लगभग 200 ms मॉडल-साइड लेटेंसी के साथ सब-सेकंड, फुल-डुप्लेक्स मल्टीमॉडल संचार प्राप्त करने के लिए एक ही ट्रांसफॉर्मर के भीतर भाषा, ऑडियो और वीडियो प्रोसेसिंग को एकीकृत करता है, जो पारंपरिक कैस्केडेड सिस्टम में निहित त्रुटि संचय और देरी को समाप्त करता है।

Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang (…)2026-06-25
🤖 AI

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

यह शोध पत्र इस बात की जांच करता है कि क्या विजन-लैंग्वेज मॉडल रीजनिंग टोकन काउंट को रिएक्शन टाइम के प्रॉक्सी के रूप में उपयोग करके मानव जैसे विजुअल सर्च व्यवहार प्रदर्शित करते हैं, जिसमें यह पाया गया है कि हालांकि मॉडल फ्लैट फीचर सर्च कॉस्ट और बढ़ते कंजंक्शन कॉस्ट जैसे प्रमुख मानवीय हस्ताक्षरों की नकल करते हैं, वे टारगेट-प्रेजेंट स्लोप्स, एन्यूमरेशन सटीकता और एडेप्टिव डेलिब्रेशन रणनीतियों में स्पष्ट संज्ञानात्मक विचलन भी प्रकट करते हैं।

Farahnaz Wick2026-06-25