🤖 AI

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models

यह शोध पत्र 'डिवाइड-एंड-डीनॉइज़' (Divide-and-Denoise) को प्रस्तुत करता है, जो एक गेम-थ्योoretic ढांचा है जो नमूने के क्षेत्रों को प्रत्येक मॉडल की विशेषज्ञता के आधार पर गतिशील रूप से आवंटित करके कई पूर्व-प्रशिक्षित डिफ्यूजन मॉडलों को निष्पक्ष रूप से समन्वित करता है, जिससे संघर्षों का समाधान होता है और मिश्रित छवि निर्माण की गुणवत्ता में सुधार होता है।

Abhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski, Tommi Jaakkola2026-06-16
🤖 AI

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

यह शोध पत्र एक एकीकृत सैद्धांतिक ढांचे और एक ज्यामितीय हस्तक्षेप जिसे ऑर्थोगोनल सिमेंटिक प्रोजेक्शन (OSP) कहा जाता है, प्रस्तुत करता है ताकि विजन-लैंग्वेज मॉडल स्पष्टीकरणों में सिमेंटिक मतिभ्रम (hallucinations) को गणितीय रूप से समझाने और कम करने के लिए क्वेरी वेक्टर्स को डिस्ट्रैक्टर अवधारणाओं के विरुद्ध ऑर्थोगोनलाइज़ किया जा सके ताकि सुदृढ़ व्याख्यात्मकता सुनिश्चित की जा सके।

Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi2026-06-16
🤖 AI

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis

यह शोध पत्र स्कैबी (Scribby) को प्रस्तुत करता है, जो एक बहु-स्तरीय एलएलएम (LLM) फ्रेमवर्क है जो विस्तृत संरचनात्मक अंतर्दृष्टि और प्रासंगिकता-आधारित विज़ुअलाइज़ेशन उत्पन्न करने के लिए माइक्रो-लेवल सिमेंटिक सेंटेंस ग्रुपिंग को मैक्रो-लेवल ट्रांसक्रिप्ट अंडरस्टैंडिंग के साथ जोड़कर दीर्घ-रूप वीडियो विश्लेषण को बढ़ाता है।

Julian Abelarde, Hugo Garrido-Lestache Belinchon2026-06-16
🤖 AI

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

यह शोध पत्र JoyAI-VL-Interaction को प्रस्तुत करता है, जो एक ओपन-सोर्स, 8B-स्केल विजन-लैंग्वेज मॉडल है जो पारंपरिक टर्न-आधारित प्रतिक्रियाओं से हटकर वास्तविक समय की स्वायत्त अंतःक्रिया की ओर बढ़ता है, जो यह निर्णय लेने के लिए निरंतर विजुअल इनपुट की निगरानी करता है कि कब बोलना है या कार्य सौंपना है, जिसके साथ एक पूर्ण रूप से तैनात करने योग्य सिस्टम और प्रशिक्षण रेसिपी भी है जो मानव मूल्यांकन में मौजूदा वीडियो-कॉल सहायकों से बेहतर प्रदर्शन करती है।

Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, S (…)2026-06-16
🤖 AI

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite एक स्केलेबल, दो-चरणीय फ्रेमवर्क है जो एक उच्च-क्षमता वाले मल्टीमॉडल लार्ज लैंग्वेज मॉडल को एक लाइटवेट स्टूडेंट मॉडल में डिस्टिल करता है ताकि बड़े पैमाने के प्रोडक्शन एनवायरनमेंट में काफी बेहतर सटीकता और कम कम्प्यूटेशनल लागत के साथ पुनरुत्पादित (reproduced) वीडियो कंटेंट की रियल-टाइम, हाई-थ्रूपुट पहचान सक्षम की जा सके।

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu2026-06-16
⚡ electrical engineering

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

यह शोध पत्र NeurMLLM का परिचय देता है, जो एक कुशल मल्टीमॉडल जनरेटिव फ्रेमवर्क है जो ब्रिज2एआई-वॉयस (Bridge2AI-Voice) डेटासेट पर अल्जाइमर और पार्किंसंस रोगों के लिए अत्याधुनिक स्टेजिंग सटीकता प्राप्त करने के लिए एक लार्ज लैंग्वेज मॉडल के भीतर ध्वनिक विशेषताओं और टेक्स्ट को एकीकृत करता है।

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong2026-06-16
🤖 AI

XFlow: An Executable Protocol Programming System for Reliable Multi-Agent Workflows

यह शोधपत्र XFlow प्रस्तुत करता है, जो एक निष्पादन योग्य प्रोटोकॉल प्रोग्रामिंग सिस्टम और इसकी डोमेन-विशिष्ट भाषा XPF है, जो महत्वपूर्ण प्रतिबद्धताओं को अस्पष्ट प्रॉम्प्ट्स से हटाकर एक संरचित, प्रवर्तनीय हार्नेस में स्थानांतरित करके, टाइप किए गए स्टेट सेल्स के माध्यम से अनिश्चितता को चरणबद्ध करके और एक्टर आउटपुट्स को मध्यस्थ बनाकर LLM-आधारित मल्टी-एजेंट वर्कफ़्लो की विश्वसनीयता को बढ़ाता है।

Hanqi Li, Jing Peng, Zijian Wang, Lu Chen, Kai Yu2026-06-16
🤖 AI

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

यह शोध पत्र एकीकृत मल्टीमॉडल मॉडलों के लिए एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो स्थानीयकृत संपादन के माध्यम से कुशल विज़ुअल रोलआउट्स को सक्षम करने के लिए डिस्क्रीट डिफ्यूजन मॉडलों का लाभ उठाता है और क्रॉस-मोडल हस्तक्षेप को समाप्त करने के लिए फैक्टराइज्ड रिवॉर्ड असाइनमेंट पेश करता है, जिससे ऑटोरिग्र्रेसिव बेसलाइन की तुलना में महत्वपूर्ण कम्प्यूटेशनल बचत और प्रदर्शन लाभ प्राप्त होता है।

Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai, Eunho Yang, Yuki Mitsufuji2026-06-16
💻 computer science

Knowledge-Based Zero-Replay Debugging of Multi-Agent LLM Traces

यह शोधपत्र मल्टी-एजेंट एलएलएम (LLM) प्रणालियों के लिए एक लागत-कुशल, ज़ीरो-रिप्ले (zero-replay) डिबगिंग फ्रेमवर्क पेश करता है जो निष्पादन ट्रेस (execution traces) को संरचित ज्ञान ग्राफों में संकलित करता है और 93% रिकॉल के साथ उच्च-प्रभाव वाले कारण संबंधी घटनाओं (causal events) की पहचान करने के लिए एक कैलिब्रेटेड लर्निंग-टू-रैंक प्रेडिक्टर का उपयोग करता है, जिससे व्यापक काउंटरफैक्चुअल रिप्ले (counterfactual replays) की रैखिक लागत समाप्त हो जाती है।

Dong Ho Kang, Hyeonjeong Cha, Daein Weon2026-06-16
💻 computer science

A Security Analysis of Long-Horizon Agentic AI Systems: Threats, Evaluation, and Framework Development

यह शोध पत्र मौजूदा खतरों और मूल्यांकन विधियों की समीक्षा करते हुए, एक नया खतरा वर्गीकरण (थ्रेट टैक्सोनॉमी) और एक अटैक प्रोपेगेशन फ्रेमवर्क प्रस्तावित करते हुए, लॉन्ग-होरिज़न एजेंटिक एआई सिस्टम में सुरक्षा चुनौतियों का एक संरचित विश्लेषण प्रस्तुत करता है।

Ahmed Mohammed Almalki, Mehedi Masud2026-06-16