🤖 AI

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis

यह शोध पत्र स्कैबी (Scribby) को प्रस्तुत करता है, जो एक बहु-स्तरीय एलएलएम (LLM) फ्रेमवर्क है जो विस्तृत संरचनात्मक अंतर्दृष्टि और प्रासंगिकता-आधारित विज़ुअलाइज़ेशन उत्पन्न करने के लिए माइक्रो-लेवल सिमेंटिक सेंटेंस ग्रुपिंग को मैक्रो-लेवल ट्रांसक्रिप्ट अंडरस्टैंडिंग के साथ जोड़कर दीर्घ-रूप वीडियो विश्लेषण को बढ़ाता है।

Julian Abelarde, Hugo Garrido-Lestache Belinchon2026-06-16
💻 computer science

Avoiding Exponential Blow-Up in Distributive Lattice Submodular Minimization

यह शोध पत्र एक सामान्य ढांचे का प्रस्ताव करता है जो डिस्ट्रीब्यूटिव लैटिस (distributive lattices) पर मौजूदा सबमॉड्यूलर फंक्शन मिनिमाइजेशन एल्गोरिदम के सीधे उपयोग को सक्षम बनाता है, जिससे बूलियन लैटिस (boolean lattices) में पारंपरिक रूपांतरणों के कारण होने वाले घातांकीय कम्प्यूटेशनल विस्फोट से बचा जा सकता है और रनिंग टाइम में महत्वपूर्ण सुधार किया जा सकता है।

Ishant Shanu2026-06-16
🤖 AI

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

यह शोध पत्र JoyAI-VL-Interaction को प्रस्तुत करता है, जो एक ओपन-सोर्स, 8B-स्केल विजन-लैंग्वेज मॉडल है जो पारंपरिक टर्न-आधारित प्रतिक्रियाओं से हटकर वास्तविक समय की स्वायत्त अंतःक्रिया की ओर बढ़ता है, जो यह निर्णय लेने के लिए निरंतर विजुअल इनपुट की निगरानी करता है कि कब बोलना है या कार्य सौंपना है, जिसके साथ एक पूर्ण रूप से तैनात करने योग्य सिस्टम और प्रशिक्षण रेसिपी भी है जो मानव मूल्यांकन में मौजूदा वीडियो-कॉल सहायकों से बेहतर प्रदर्शन करती है।

Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, S (…)2026-06-16
🤖 machine learning

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

यह शोध पत्र YTClickbait21K को प्रस्तुत करता है, जो 21,000 से अधिक यूट्यूब वीडियो वाला एक बड़े पैमाने का, मानव-एनोटेटेड मल्टीमॉडल डेटासेट है जिसमें कठोर लेबलिंग और विविध मेटाडेटा शामिल है, जिसे स्वचालित क्लिकबेट डिटेक्शन और कंटेंट मॉडरेशन अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene (…)2026-06-16
💻 computer science

Variational Deep Unfolding with Mamba-Based Nonlocal Modeling for Underwater Image Enhancement

यह शोधपत्र एक वैरेेशनल डीप अनफोल्डिंग नेटवर्क प्रस्तावित करता है जो अंडरवॉटर इमेज एन्हांसमेंट के लिए डीहैज़िंग-आधारित वैरेेशनल फॉर्मूलेशन को कुशल नॉनलोकल मॉडलिंग के लिए माम्बा लेयर्स के साथ एकीकृत करता है और बेहतर विजुअल एवं क्वांटिटेटिव प्रदर्शन प्राप्त करने के लिए एक प्रॉक्सिमल ट्रैजेक्टरी लॉस का उपयोग करता है।

Daniel Torres, Julia Navarro, Catalina Sbert, Joan Duran2026-06-16
🤖 AI

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite एक स्केलेबल, दो-चरणीय फ्रेमवर्क है जो एक उच्च-क्षमता वाले मल्टीमॉडल लार्ज लैंग्वेज मॉडल को एक लाइटवेट स्टूडेंट मॉडल में डिस्टिल करता है ताकि बड़े पैमाने के प्रोडक्शन एनवायरनमेंट में काफी बेहतर सटीकता और कम कम्प्यूटेशनल लागत के साथ पुनरुत्पादित (reproduced) वीडियो कंटेंट की रियल-टाइम, हाई-थ्रूपुट पहचान सक्षम की जा सके।

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu2026-06-16
💻 computer science

Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs

यह शोध पत्र छह वाणिज्यिक इमेज-टू-इमेज जनरेटिव मॉडलों के प्रशिक्षण-प्रतिमान-संचालित वर्गीकरण का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि वे फ्रोजन DINOv2 टोकन दूरियों द्वारा मापे गए कंटेंट-एडेप्टिव सब-JND एडवरसैरियल परटर्बेशन्स के प्रति अपनी प्रतिक्रियाओं के आधार पर दो विशिष्ट व्यवहारिक समूहों—एडिट-ट्रेन्ड बनाम सैंपलिंग-टाइम एडेप्टेड—में विभाजित होते हैं।

Hunter Hill2026-06-16
🤖 AI

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

यह शोध पत्र एकीकृत मल्टीमॉडल मॉडलों के लिए एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो स्थानीयकृत संपादन के माध्यम से कुशल विज़ुअल रोलआउट्स को सक्षम करने के लिए डिस्क्रीट डिफ्यूजन मॉडलों का लाभ उठाता है और क्रॉस-मोडल हस्तक्षेप को समाप्त करने के लिए फैक्टराइज्ड रिवॉर्ड असाइनमेंट पेश करता है, जिससे ऑटोरिग्र्रेसिव बेसलाइन की तुलना में महत्वपूर्ण कम्प्यूटेशनल बचत और प्रदर्शन लाभ प्राप्त होता है।

Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai, Eunho Yang, Yuki Mitsufuji2026-06-16
💻 computer science

S23DR 2026: End-to-End 3D Wireframe Prediction via DETR-Style Set Prediction with Contrastive Denoising

यह शोध पत्र WireframeDETR प्रस्तुत करता है, जो S23DR 2026 चुनौती के लिए एक नवीन दृष्टिकोण है, जो अत्याधुनिक प्रदर्शन प्राप्त करने के लिए कंट्रास्टिव डीनॉइज़िंग, मल्टी-स्केल एनकोडिंग और प्रोग्रेसिव ऑक्सिलरी लॉस वेटिंग द्वारा संवर्धित एक DETR-शैली के सेट प्रेडिक्शन फ्रेमवर्क का उपयोग करके मल्टी-व्यू पॉइंट क्लाउड्स से सीधे 3D बिल्डिंग वायरफ्रेम की भविष्यवाणी करता है।

Nitiz Khanal2026-06-16
💻 computer science

An Ensemble Deep Learning Approach for Reliable and Scalable Lemon Leaf Disease Classification

यह शोध पत्र 1,354 छवियों के एक डेटासेट से नींबू के पत्तों की नौ श्रेणियों की बीमारियों को वर्गीकृत करने के लिए एडवरसैरियल ट्रेनिंग और ग्रेड-कैम (Grad-CAM) विज़ुअलाइज़ेशन के साथ इनसेप्शनवी3 (InceptionV3) और मोबाइलनेटवी2 (MobileNetV2) को संयोजित करने वाले एक सुदृढ़ और स्केलेबल एन्सेम्बल डीप लर्निंग फ्रेमवर्क का प्रस्ताव करता है, जो 99.27% सटीकता प्राप्त करता है।

Shayan Abrar, Sudeepta Mandal, Abdul Awal Yasir, Sonjoy Bhattacharjee, Sadman Haque Bhuiyan, Samanta Ghosh, Rafi Ahamed2026-06-16