💻 computer science

OAMVOS:2nd Report for 5th PVUW MOSE Track

यह शोधपत्र एक विश्वसनीयता-जागरूक स्टेट मशीन, ब्रांच-आधारित रिकवरी और एक चयनात्मक मेमोरी प्रबंधन नीति को लागू करके, लंबी अवधि के अवरोधों (occlusions) और छोटे ऑब्जेक्ट्स के गायब होने के विरुद्ध मजबूती में सुधार करने के लिए DAM4SAM ट्रैकर का एक अवरोध- (occlusion) और पुन: प्रकटीकरण-जागरूक (reappearance-aware) विस्तार प्रस्तावित करता है।

Deshui Miao, Xingsen Huang, Yameng Gu, Xiaogang yu, Xin Li, Ming-Hsuan Yang2026-04-28
💻 computer science

Neural Network Optimization Reimagined: Decoupled Techniques for Scratch and Fine-Tuning

DualOpt एक नवीन अनुकूलन दृष्टिकोण है जो स्क्रैच से प्रशिक्षण के लिए वास्तविक समय के परत-वार वेट डिके (layer-wise weight decay) और ज्ञान विस्मृति को रोकने तथा विभिन्न विजन कार्यों में प्रदर्शन में सुधार करने के लिए एक एकीकृत वेट रोलबैक (weight rollback) तंत्र को पेश करके प्रशिक्षण रणनीतियों को अलग करता है।

Xin Ning, Qiankun Li, Xiaolong Huang, Qiupu Chen, Feng He, Weijun Li, Prayag Tiwari, Xinwang Liu2026-04-28
💻 computer science

SwarmDrive: Semantic V2V Coordination for Latency-Constrained Cooperative Autonomous Driving

स्वार्मड्राइव (SwarmDrive) एक सिमेंटिक V2V समन्वय ढांचा है जो क्लाउड-आधारित या विशुद्ध रूप से स्थानीय दृष्टिकोणों की तुलना में ओक्लूडेड (occluded) परिदृश्यों में स्वायत्त ड्राइविंग सफलता दर में सुधार करने और विलंबता (latency) को कम करने के लिए स्थानीय स्मॉल लैंग्वेज मॉडल्स (SLMs) और इवेंट-ट्रिगर्ड संचार का उपयोग करता है।

Anjie Qiu, Donglin Wang, Zexin Fang, Sanket Partani, Hans D. Schotten2026-04-28
💻 computer science

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review

यह शोध पत्र **IntraAgent** को प्रस्तुत करता है, जो सूक्ष्म-स्तरीय (fine-grained), सामग्री-आधारित (content-grounded) सूचना पुनर्प्राप्ति के नए **IntraView** कार्य के लिए डिज़ाइन किया गया एक LLM-आधारित एजेंट है, जो मानव साहित्य समीक्षा प्रक्रियाओं की नकल करने के लिए दो-चरणीय "सेक्शन रैंकिंग" और "पुनरावृत्ति पठन" (Iterative Reading) पाइपलाइन का उपयोग करता है और नए प्रस्तावित **IntraBench** बेंचमार्क पर मौजूदा RAG बेसलाइनों से बेहतर प्रदर्शन करता है।

Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang2026-04-28
🤖 machine learning

Towards Understanding the Expressive Power of GNNs with Global Readout

यह शोध पत्र यह प्रदर्शित करके कि स्थानीय एकत्रीकरण (local aggregation) और वैश्विक रीडआउट (global readout) के बीच की अंतःक्रिया उन्हें C2C_2 तर्क की तार्किक अभिव्यंजना शक्ति से आगे जाने की अनुमति देती है, संदेश-पासिंग GNNs की अभिव्यंजक शक्ति की जांच करता है, साथ ही उन विशिष्ट बाधाओं की पहचान करता है जो एकत्रीकरण या ग्राफ डिग्री पर लागू होने पर ग्लोबल काउंटिंग वाले ग्रेडेड मोडल लॉजिक (graded modal logic with global counting) के माध्यम से विशेषताकरण (characterisability) को पुनः स्थापित करती हैं।

Maurice Funk, Daumantas Kojelis2026-04-28
💻 computer science

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE एक ब्लैक-बॉक्स रेड-टीमिंग विधि है जो व्यक्तिगत प्रॉम्प्ट के बजाय निष्पादन योग्य (executable) अटैक प्रोग्रामों को विकसित करने के लिए एक कोडिंग एजेंट का उपयोग करती है, जिससे संरचनात्मक और कंट्रोल-फ्लो अनुकूलन संभव होता है जो विविध लार्ज लैंग्वेज मॉडल्स में जेलब्रेक सफलता दर को महत्वपूर्ण रूप से सुधारता है।

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri2026-04-28
🤖 machine learning

When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning

यह शोध पत्र फ्रोजन ऑफलाइन रीइन्फोर्समेंट लर्निंग पॉलिसीज़ के लिए पोस्ट-ट्रेनिंग स्टीयरिंग का एक एकीकृत क्लोज्ड-फॉर्म विश्लेषण प्रदान करता है, जो यह प्रदर्शित करता है कि प्रोडक्ट-ऑफ-एक्सपर्ट्स और KL-रेगुलराइज्ड अडैप्टेशन "एक्टर-एंकर्ड" सुरक्षा तंत्र के रूप में कार्य करते हैं जो तैनाती के उद्देश्यों में परिवर्तन होने पर गारंटीकृत प्रदर्शन लाभ के बजाय क्रमिक गिरावट (ग्रेसफुल डिग्रेडेशन) प्रदान करते हैं।

Elias Hossain, Mohammad Jahid Ibna Basher, Ivan Garibay, Ozlem Garibay, Niloofar Yousefi2026-04-28
💻 computer science

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM एक प्रशिक्षण-मुक्त (training-free), मॉडल-अज्ञेय (model-agnostic) ढांचा है जो विजन-लैंग्वेज मॉडल्स को छवियों पर संपादन योग्य SVG ओवरले जेनरेट करने में सक्षम बनाता है, जिससे विभिन्न बेंचमार्क में उनके तर्क को दृश्य रूप से समझाने और एनोटेशन कार्यों को करने की क्षमता में महत्वपूर्ण सुधार होता है।

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen2026-04-28
💻 computer science

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

RCSR एक पर्सनलाइजेशन-फ्रेंडली फेडरेटेड लर्निंग फ्रेमवर्क है जो प्रोटोटाइप एंकरिंग, एक रिट्रीवल-सेंट्रिक सिमेंटिक राउटर और एक फ्रोजन CLIP बैकबोन पर निर्मित लाइटवेट क्लाइंट-स्पेसिफिक एडेप्टर्स का उपयोग करके क्रॉस-मोडल रिट्रीवल में नॉन-IID डेटा और मिसिंग मोडैलिटीज़ की समस्या को संबोधित करता है।

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li2026-04-28
🤖 machine learning

Quantifying and Mitigating Self-Preference Bias of LLM Judges

यह शोध पत्र समान-गुणवत्ता वाले प्रतिक्रिया युग्मों (response pairs) का उपयोग करके LLM-as-a-judge प्रणालियों में स्व-वरीयता पूर्वाग्रह (Self-Preference Bias) को मापने और कम करने के लिए एक पूर्णतः स्वचालित ढांचे को प्रस्तुत करता है ताकि मूल्यांकन संबंधी पूर्वाग्रह को मॉडल क्षमता से अलग किया जा सके, और अंततः एक बहु-आयामी मूल्यांकन रणनीति प्रस्तावित करता है जो पूर्वाग्रह को औसतन 31.5% तक कम करती है।

Jinming Yang, Chuxian Qiu, Zhenyu Deng, Xinshan Jiao, Tao Zhou2026-04-28