🤖 AI

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models

यह शोध पत्र 'डिवाइड-एंड-डीनॉइज़' (Divide-and-Denoise) को प्रस्तुत करता है, जो एक गेम-थ्योoretic ढांचा है जो नमूने के क्षेत्रों को प्रत्येक मॉडल की विशेषज्ञता के आधार पर गतिशील रूप से आवंटित करके कई पूर्व-प्रशिक्षित डिफ्यूजन मॉडलों को निष्पक्ष रूप से समन्वित करता है, जिससे संघर्षों का समाधान होता है और मिश्रित छवि निर्माण की गुणवत्ता में सुधार होता है।

Abhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski, Tommi Jaakkola2026-06-16
🤖 machine learning

Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

यह शोध पत्र VIOLIN को प्रस्तुत करता है, जो एक हल्का (lightweight) मास्कड अटेंशन मैकेनिज्म है जो विजन ट्रांसफॉर्मर्स में स्पष्ट स्थानिक इंडक्टिव बायस (spatial inductive biases) को इंजेक्ट करने के लिए स्पेस फिलिंग कर्व्स (Space Filling Curves) का लाभ उठाता है, जिससे नगण्य कम्प्यूटेशनल ओवरहेड के साथ छोटे मॉडल और सीमित डेटा वाले परिदृश्यों में प्रदर्शन में उल्लेखनीय वृद्धि होती है।

Leyla Naz Candogan, Arshia Afzal, Pol Puigdemont, Volkan Cevher2026-06-16
🤖 AI

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

यह शोध पत्र एक एकीकृत सैद्धांतिक ढांचे और एक ज्यामितीय हस्तक्षेप जिसे ऑर्थोगोनल सिमेंटिक प्रोजेक्शन (OSP) कहा जाता है, प्रस्तुत करता है ताकि विजन-लैंग्वेज मॉडल स्पष्टीकरणों में सिमेंटिक मतिभ्रम (hallucinations) को गणितीय रूप से समझाने और कम करने के लिए क्वेरी वेक्टर्स को डिस्ट्रैक्टर अवधारणाओं के विरुद्ध ऑर्थोगोनलाइज़ किया जा सके ताकि सुदृढ़ व्याख्यात्मकता सुनिश्चित की जा सके।

Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi2026-06-16
🤖 AI

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis

यह शोध पत्र स्कैबी (Scribby) को प्रस्तुत करता है, जो एक बहु-स्तरीय एलएलएम (LLM) फ्रेमवर्क है जो विस्तृत संरचनात्मक अंतर्दृष्टि और प्रासंगिकता-आधारित विज़ुअलाइज़ेशन उत्पन्न करने के लिए माइक्रो-लेवल सिमेंटिक सेंटेंस ग्रुपिंग को मैक्रो-लेवल ट्रांसक्रिप्ट अंडरस्टैंडिंग के साथ जोड़कर दीर्घ-रूप वीडियो विश्लेषण को बढ़ाता है।

Julian Abelarde, Hugo Garrido-Lestache Belinchon2026-06-16
💻 computer science

Avoiding Exponential Blow-Up in Distributive Lattice Submodular Minimization

यह शोध पत्र एक सामान्य ढांचे का प्रस्ताव करता है जो डिस्ट्रीब्यूटिव लैटिस (distributive lattices) पर मौजूदा सबमॉड्यूलर फंक्शन मिनिमाइजेशन एल्गोरिदम के सीधे उपयोग को सक्षम बनाता है, जिससे बूलियन लैटिस (boolean lattices) में पारंपरिक रूपांतरणों के कारण होने वाले घातांकीय कम्प्यूटेशनल विस्फोट से बचा जा सकता है और रनिंग टाइम में महत्वपूर्ण सुधार किया जा सकता है।

Ishant Shanu2026-06-16
🤖 AI

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

यह शोध पत्र JoyAI-VL-Interaction को प्रस्तुत करता है, जो एक ओपन-सोर्स, 8B-स्केल विजन-लैंग्वेज मॉडल है जो पारंपरिक टर्न-आधारित प्रतिक्रियाओं से हटकर वास्तविक समय की स्वायत्त अंतःक्रिया की ओर बढ़ता है, जो यह निर्णय लेने के लिए निरंतर विजुअल इनपुट की निगरानी करता है कि कब बोलना है या कार्य सौंपना है, जिसके साथ एक पूर्ण रूप से तैनात करने योग्य सिस्टम और प्रशिक्षण रेसिपी भी है जो मानव मूल्यांकन में मौजूदा वीडियो-कॉल सहायकों से बेहतर प्रदर्शन करती है।

Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, S (…)2026-06-16
🤖 machine learning

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

यह शोध पत्र YTClickbait21K को प्रस्तुत करता है, जो 21,000 से अधिक यूट्यूब वीडियो वाला एक बड़े पैमाने का, मानव-एनोटेटेड मल्टीमॉडल डेटासेट है जिसमें कठोर लेबलिंग और विविध मेटाडेटा शामिल है, जिसे स्वचालित क्लिकबेट डिटेक्शन और कंटेंट मॉडरेशन अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene (…)2026-06-16
💻 computer science

Variational Deep Unfolding with Mamba-Based Nonlocal Modeling for Underwater Image Enhancement

यह शोधपत्र एक वैरेेशनल डीप अनफोल्डिंग नेटवर्क प्रस्तावित करता है जो अंडरवॉटर इमेज एन्हांसमेंट के लिए डीहैज़िंग-आधारित वैरेेशनल फॉर्मूलेशन को कुशल नॉनलोकल मॉडलिंग के लिए माम्बा लेयर्स के साथ एकीकृत करता है और बेहतर विजुअल एवं क्वांटिटेटिव प्रदर्शन प्राप्त करने के लिए एक प्रॉक्सिमल ट्रैजेक्टरी लॉस का उपयोग करता है।

Daniel Torres, Julia Navarro, Catalina Sbert, Joan Duran2026-06-16
🤖 AI

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite एक स्केलेबल, दो-चरणीय फ्रेमवर्क है जो एक उच्च-क्षमता वाले मल्टीमॉडल लार्ज लैंग्वेज मॉडल को एक लाइटवेट स्टूडेंट मॉडल में डिस्टिल करता है ताकि बड़े पैमाने के प्रोडक्शन एनवायरनमेंट में काफी बेहतर सटीकता और कम कम्प्यूटेशनल लागत के साथ पुनरुत्पादित (reproduced) वीडियो कंटेंट की रियल-टाइम, हाई-थ्रूपुट पहचान सक्षम की जा सके।

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu2026-06-16
💻 computer science

Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs

यह शोध पत्र छह वाणिज्यिक इमेज-टू-इमेज जनरेटिव मॉडलों के प्रशिक्षण-प्रतिमान-संचालित वर्गीकरण का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि वे फ्रोजन DINOv2 टोकन दूरियों द्वारा मापे गए कंटेंट-एडेप्टिव सब-JND एडवरसैरियल परटर्बेशन्स के प्रति अपनी प्रतिक्रियाओं के आधार पर दो विशिष्ट व्यवहारिक समूहों—एडिट-ट्रेन्ड बनाम सैंपलिंग-टाइम एडेप्टेड—में विभाजित होते हैं।

Hunter Hill2026-06-16