🤖 machine learning

Multimodal Ordinal Modeling of Alzheimer's Disease Severity Using Structural MRI and Clinical Data

यह शोध पत्र एक अटेंशन-एन्हांस्ड मल्टीमॉडल मशीन लर्निंग फ्रेमवर्क प्रस्तावित करता है जो अल्जाइमर रोग की गंभीरता के सुदृढ़, व्याख्यात्मक और नैदानिक रूप से सुसंगत स्वचालित स्टेजिंग प्राप्त करने के लिए ऑर्डिनल रिग्रेशन का उपयोग करते हुए T1-वेटेड MRI को क्लिनिकल और जेनेटिक डेटा के साथ एकीकृत करता है।

Boris-Stephan Rauchmann, Jonathan Laib, Buse Ercik, Robert Perneczky, Sergio Altares-López2026-06-11
🤖 AI

Toward Trustworthy AI: Multi-Target Adversarial Attacks and Robust Defenses for Continuous Data Summarization

यह शोध पत्र निरंतर डेटा सारांशीकरण (continuous data summarization) को कम करने के लिए DR-सबमॉड्यूलर अनुकूलन (DR-submodular optimization) पर आधारित एक मल्टी-टारगेट एडवरसैरियल अटैक फ्रेमवर्क और एक नियमित मैक्स-मिन रक्षा रणनीति का प्रस्ताव करके विश्वसनीय एआई (trustworthy AI) की भेद्यता को संबोधित करता है, जो दोनों ही वास्तविक डेटा पर सैद्धांतिक गारंटियों और अनुभवजन्य सत्यापन द्वारा समर्थित हैं।

Yuefang Lian, Longkun Guo, Zhongrui Zhao, Zhigang Lu, Yanan Cai, Shuchao Pang, Dachuan Xu, Jason Xue2026-06-11
💬 NLP

WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning

यह शोध पत्र WorldReasoner को प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है जो भाषा मॉडल एजेंटों की घटना पूर्वानुमान क्षमताओं का आकलन करने के लिए केवल पूर्वानुमान तिथि से पूर्व उपलब्ध जानकारी का उपयोग करके सटीक, साक्ष्य-आधारित और कारण-युक्त भविष्यवाणियां उत्पन्न करने की उनकी क्षमता का कठोरता से परीक्षण करता है, जिससे यह पता चलता है कि हालांकि टेम्पोरल रिट्रीवल (temporal retrieval) और कॉज़ल ग्राफ निर्माण प्रदर्शन को बढ़ाते हैं, फिर भी एजेंट जमीनी साक्ष्यों को सुव्यवस्थित संभाव्यताओं में अनुवाद करने में संघर्ष करते हैं।

Yizhou Chi, Eric Chamoun, Zifeng Ding, Andreas Vlachos2026-06-11
🤖 AI

Feature-Aligned Speech Watermarking for Robustness to Reconstruction Distortions

यह शोध पत्र एक फीचर-अलाइन्ड स्पीच वॉटरमार्किंग पद्धति का प्रस्ताव करता है जो उच्च-ऊर्जा वाले वॉटरमार्क को स्वर युक्त (voiced) क्षेत्रों में एम्बेड करने के लिए एक प्री-ट्रेन्ड स्पीच कोडेक का लाभ उठाता है, जिससे देखे गए और अनदेखे स्पीच रिकंस्ट्रक्शन मॉडल्स के विरुद्ध सुदृढ़ रहने वाले अदृश्य ऑडियो को प्राप्त करने के लिए पारंपरिक फिडेलिटी-रोबस्टनेस ट्रेड-ऑफ पर विजय प्राप्त की जा सके।

Haiyun Li, Shuhai Peng, Zhisheng Zhang, Jingran Xie, Xiaofeng Xie, Hanyang Peng, Zhiyong Wu2026-06-11
🤖 AI

Designing AI-Supported Focus Groups: A Role x Modality Playbook

यह शोध पत्र लाइव बातचीत में जनरेटिव एआई पर मौजूदा शोध का संश्लेषण करता है ताकि एआई-सहायता प्राप्त फोकस समूहों के लिए एक पद्धतिगत प्लेबुक प्रस्तावित की जा सके, जिसे एआई भूमिकाओं (टूल, को-होस्ट, होस्ट) और माध्यमों (टेक्स्ट, वॉयस, एम्बोडीड) द्वारा व्यवस्थित किया गया है, जबकि यह संवादात्मक समझौतों (इंटरेक्शनल ट्रेड-ऑफ्स) और भविष्य के मूल्यांकन के लिए खुले प्रश्नों पर प्रकाश डालता है।

Zhiqing Wang, Steven Dow2026-06-11
🤖 AI

Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning

यह शोध पत्र TASM को प्रस्तुत करता है, जो डायनेमिक मल्टी-मोडल इन-कॉन्टेक्स्ट लर्निंग के लिए एक ट्रेनिंग-फ्री फ्रेमवर्क है, जो टास्क-वेक्टर गाइडेड कम्प्रेशन, बाइपार्टाइट ग्राफ मैचिंग के माध्यम से सेमैंटिक्स-अवेयर टोकन मर्जिंग और एक पदानुक्रमित मेमोरी संरचना का उपयोग करके कॉन्टेक्स्ट विंडो और KV कैश सीमाओं को दूर करता है ताकि सिमेंटिक अखंडता को बाधित किए बिना कुशल, क्वेरी-एडेप्टिव रिट्रीवल सक्षम किया जा सके।

Zhirui Chen, Ziwei Chen, Ling Shao2026-06-11
🤖 machine learning

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

यह शोध पत्र ART (आर्ट-बेस्ड रीइन्फोर्समेंट ट्रेनिंग) का प्रस्ताव देता है, जो एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है जो फ्रोजन मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सूचना इंजेक्ट करने के लिए रॉ विजुअल इनपुट्स को ऑप्टिमाइज़ करती है, जिससे उनके कंप्यूटेशनल ग्राफ को संशोधित किए बिना vLLM जैसे हाई-थ्रूपुट इंजनों के साथ अनुकूलता सक्षम होती है और साथ ही LoRA के समान सटीकता प्राप्त होती है।

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski2026-06-11
🤖 AI

Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction

यह शोध पत्र Embodied-BenchClaw को प्रस्तुत करता है, जो एक स्वायत्त मल्टी-एजेंट सिस्टम है जो पांच-चरणीय पाइपलाइन के माध्यम से सत्यापन योग्य, रखरखाव योग्य और विविध एम्बोडीड स्थानिक बुद्धिमत्ता (embodied spatial intelligence) बेंचमार्क के निर्माण को स्वचालित करता है, जिससे मौजूदा मूल्यांकन ढांचों की श्रम-गहन और स्थिर सीमाओं को संबोधित किया जा सके।

Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Jianwei Hu, Qiang Ma2026-06-11
🤖 AI

Quality Adaptive Angular Margin Learning for Respiratory Sound Classification

यह शोध पत्र QLung प्रस्तुत करता है, जो एक गुणवत्ता-अनुकूली कोणीय मार्जिन लर्निंग फ्रेमवर्क (quality-adaptive angular margin learning framework) है, जो मार्जिन को गतिशील रूप से स्केल करने के लिए नो-रेफरेंस ऑडियो गुणवत्ता मेट्रिक्स का लाभ उठाता है, जिससे मौजूदा अत्याधुनिक विधियों की तुलना में श्वसन ध्वनि वर्गीकरण कार्यों पर बेहतर इन-डिस्ट्रीब्यूशन और आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन प्राप्त होता है।

Yoon Tae Kim, Heejoon Koo, Miika Toikkanen, June-Woo Kim2026-06-11
🤖 AI

The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

यह शोध पत्र OT-GRPO नामक एक स्व-पर्यवेक्षित सुदृढीकरण शिक्षण (self-supervised reinforcement learning) ढांचे का प्रस्ताव करता है जो ज्यामितीय और अर्थ संबंधी रूपांतरणों के तहत तार्किक निरंतरता के लिए अनुकूलन करके लार्ज रीजनिंग मॉडल्स की स्थानिक तर्क क्षमताओं को बढ़ाता है, जिससे बिना किसी ग्राउंड-ट्रुथ एनोटेशन की आवश्यकता के पर्यवेक्षित विधियों के तुलनीय प्रदर्शन प्राप्त होता है।

Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas2026-06-11