🔢 mathematics

Quantum spatial best-arm identification via quantum walks

यह शोध पत्र क्वांटम स्पेशियल बेस्ट-आर्म आइडेंटिफिकेशन (QSBAI) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो ग्राफ-प्रतिबंधित बैंडिट्स में बेस्ट-आर्म आइडेंटिफिकेशन समस्या को हल करने के लिए क्वांटम वॉक्स का लाभ उठाता है, जिसमें स्थानिक प्रतिबंधों को सुपरपोजिशन में एनकोड किया गया है और एम्प्लीट्यूड एम्प्लीफिकेशन तकनीकों को सामान्य ग्राफ संरचनाओं तक विस्तारित किया गया है।

Tomoki Yamagami, Etsuo Segawa, Takatomo Mihana, André Röhm, Atsushi Uchida, Ryoichi Horisaki2026-04-22
🤖 AI

VideoAgent: Personalized Synthesis of Scientific Videos

यह शोध पत्र VideoAgent प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो वैज्ञानिक वीडियो संश्लेषण को व्यक्तिगत, दर्शकों के अनुकूल वीडियो बनाने के लिए एक इरादा-संचालित योजना (intent-driven planning) समस्या के रूप में पुनर्व्याख्या करता है, जिसमें स्थिर स्लाइडों को एनिमेशन के साथ गतिशील रूप से अंतर्निहित किया जाता है, और इसके साथ ही मल्टीमॉडल गुणवत्ता और शैक्षणिक उपयोगिता का आकलन करने के लिए प्रस्तावित SciVidEval बेंचमार्क भी दिया गया है।

Xiao Liang, Bangxin Li, Zixuan Chen, Hanyue Zheng, Zhi Ma, Di Wang, Cong Tian, Quan Wang2026-04-22
💬 NLP

RepIt: Steering Language Models with Concept-Specific Refusal Vectors

यह शोधपत्र RepIt को प्रस्तुत करता है, जो एक डेटा-कुशल ढांचा है जो अवधारणा-विशिष्ट सक्रियण वेक्टरों (concept-specific activation vectors) को अलग करके अर्थपूर्ण बैकडोर वाले "मॉडल ऑर्गेनिज्म" बनाता है, जिससे बड़े भाषा मॉडल (LLMs) विनाश के हथियारों जैसे खतरनाक विषयों पर सुरक्षा निषेधों (safety refusals) को चुनिंदा रूप से दरकिनार करने में सक्षम होते हैं, जबकि वे मानक बेंचमार्क पर सुरक्षित व्यवहार बनाए रखते हैं।

Vincent Siu, Nathan W. Henry, Nicholas Crispino, Yang Liu, Dawn Song, Chenguang Wang2026-04-22
🤖 AI

ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models

ORCA एक एजेंटिक रीजनिंग फ्रेमवर्क है जो छोटे विजुअल टूल्स का उपयोग करते हुए एक इन्फरेंस-टाइम ऑब्जर्व-रीजन-क्रिटीक-एक्ट लूप के माध्यम से प्रीट्रेन किए गए लार्ज विजन-लैंग्वेज मॉडल्स की तथ्यात्मक सटीकता और एडवर्सरियल रोबस्टनेस को बढ़ाता है, जिससे बिना मॉडल रिट्रेनिंग या इंटरनल एक्सेस के हैलुसिनेशन और एडवर्सरियल बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian2026-04-22
🤖 AI

Visual Reasoning Agent: Robust Vision Systems in Remote Sensing via Inference-Time Scaling

यह शोध पत्र विज़ुअल रीजनिंग एजेंट (VRA) को पेश करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो बिना किसी मॉडल पुनप्रशिक्षण के रिमोट सेंसिंग में विज़ुअल रीजनिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाने के लिए एक 'थिंक-क्रिटीक-एक्ट' (सोचें-आलोचना करें-कार्य करें) लूप के माध्यम से बड़े विजन-लैंग्वेज मॉडल्स को एक रीजनिंग मॉडल के साथ व्यवस्थित करता है।

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian2026-04-22
💬 NLP

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

यह शोध पत्र 'InsideOut' बेंचमार्क प्रस्तुत करता है ताकि LLM-जनित साक्षात्कार स्क्रिप्ट में "इनसाइडर-आउटसाइडर पूर्वाग्रह" (जहाँ मॉडल अन्य संस्कृतियों के बजाय मुख्यधारा की संस्कृतियों को प्राथमिकता देते हैं) को व्यवस्थित रूप से पहचान और परिमाणित किया जा सके, और यह प्रदर्शित करता है कि एजेंट-आधारित शमन ढांचे (mitigation frameworks) इस सांस्कृतिक पूर्वाग्रह को कम करने में प्रॉम्प्ट-आधारित तरीकों की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Yixin Wan, Xingrun Chen, Kai-Wei Chang2026-04-22
🤖 machine learning

How does the optimizer implicitly bias the model merging loss landscape?

यह शोध पत्र प्रकट करता है कि मॉडल विलय (model merging) की सफलता ऑप्टिमाइज़र डायनेमिक्स से प्राप्त एक एकीकृत "प्रभावी शोर पैमाने" (effective noise scale) के साथ एक गैर-एकदिष्ट (non-monotonic) संबंध द्वारा शासित होती है, जो यह दर्शाता है कि लर्निंग रेट, वेट डिके, बैच साइज और डेटा ऑग्मेंटेशन जैसे कारक वैश्विक लॉस लैंडस्केप की ज्यामिति को आकार देने के लिए निर्धारित करते हैं कि क्या स्वतंत्र रूप से प्रशिक्षित समाधानों को प्रभावी ढंग से संयोजित किया जा सकता है।

Chenxiang Zhang, Alexander Theus, Damien Teney, Antonio Orvieto, Jun Pang, Sjouke Mauw2026-04-22
🤖 machine learning

Towards Generalization of Graph Neural Networks for AC Optimal Power Flow

यह शोध पत्र एक हाइब्रिड हेटेरोजेनियस मैसेज पासिंग न्यूरल नेटवर्क (HH-MPNN) प्रस्तुत करता है जो विविध ग्रिड आकारों और N-1 आकस्मिकताओं (contingencies) के लिए स्केलेबल, टोपोलॉजी-लचीले और निकट-इष्टतम समाधान प्राप्त करता है, जो पारंपरिक सॉल्वर की तुलना में 5,000 गुना तक की कम्प्यूटेशनल गति प्रदान करता है।

Olayiwola Arowolo, Jochen L. Cremer2026-04-22
🤖 AI

How to Teach Large Multimodal Models New Skills

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज मल्टीमॉडल मॉडल्स के विशिष्ट घटकों, जैसे कि सेल्फ-अटेंशन प्रोजेक्शन्स या एमएलपी गेट्स को चुनिंदा रूप से ट्यून करना, आउटपुट डिस्ट्रीब्यूशन शिफ्ट को नियंत्रित करके क्रमिक कौशल शिक्षण (sequential skill learning) के दौरान होने वाले कैटास्ट्रोफिक फॉरगेटिंग को प्रभावी ढंग से कम करता है, जो जटिल तंत्रों जैसे कि रिप्ले या सहायक मापदंडों की आवश्यकता के बिना फुल फाइन-ट्यूनिंग और मौजूदा शमन विधियों से बेहतर प्रदर्शन करता है।

Zhen Zhu, Yiming Gong, Yao Xiao, Yaoyao Liu, Derek Hoiem2026-04-22
🤖 AI

ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition

यह शोध पत्र ReefNet को प्रस्तुत करता है, जो एक बड़े पैमाने का सार्वजनिक डेटासेट और बेंचमार्क है जिसमें लगभग 925,000 विशेषज्ञ-सत्यापित कोरल रीफ एनोटेशन शामिल हैं जिन्हें एक मानकीकृत वर्गीकरण (टैक्सोनॉमी) के अनुरूप मैप किया गया है, जिसका उपयोग लेबल शोर (लेबल नॉइज़), वर्ग असंतुलन और डोमेन शिफ्ट की वास्तविक स्थितियों में सूक्ष्म कोरल पहचान के लिए वर्तमान विजन-लैंग्वेज और मल्टीमॉडल मॉडलों की महत्वपूर्ण सीमाओं का मूल्यांकन करने और उन्हें उजागर करने के लिए किया जाता है।

Abdulwahab Felemban, Yahia Battach, Faizan Farooq Khan, Yuqian Fu, Xuhui Liu, Yesmeen M. Khattab, Yousef A. Radwan, Xian (…)2026-04-22