💻 computer science

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

यह शोध पत्र S-OBI प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal Large Language Models) का मूल्यांकन करने के लिए स्पष्ट, मानकीकृत वाक्य-स्तरीय ओरकल बोन इनस्क्रिप्शन (Oracle Bone Inscription) उदाहरणों को संश्लेषित करने वाला एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल वर्ण-स्तर की पहचान और दृश्य धारणा संबंधी त्रुटियों के प्रसार पर अत्यधिक निर्भरता के कारण संरचित शिलालेख समझ में संघर्ष करते हैं।

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai2026-07-01
🤖 AI

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

यह शोध पत्र HealthAgentBench को प्रस्तुत करता है, जो विविध नैदानिक वर्कफ़्लो और माध्यमों में 54 यथार्थवादी, बहु-चरणीय स्वास्थ्य देखभाल कार्यों वाला एक व्यापक बेंचमार्क सुइट है, जो यह प्रकट करता है कि सबसे उन्नत फ्रंटियर एआई एजेंट भी वर्तमान में जटिल, एंड-टू-एंड चिकित्सा वातावरण में उच्च सफलता दर प्राप्त करने के लिए संघर्ष करते हैं।

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan (…)2026-07-01
💻 computer science

Learning to Deny: Action Denial in Multimodal Large Language Models

यह शोध पत्र UCF101-AD प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (LLMs) मजबूत प्रासंगिक संकेतों के बावजूद कार्यों को नकारने में संघर्ष करते हैं, और यह प्रदर्शित करता है कि कारण संबंधी तर्क (causal reasoning) को शामिल करने से यह सत्यापित करने की उनकी क्षमता में महत्वपूर्ण सुधार होता है कि क्या कार्य वास्तव में घटित हो रहे हैं।

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat2026-07-01
💻 computer science

ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling

exPLoRe एक नवीन मल्टी-ऑब्जेक्टिव मास्क्ड इमेज मॉडलिंग फ्रेमवर्क पेश करता है जो ग्रेडिएंट-कपल्ड डिस्पैच वेट्स के माध्यम से प्रति-पैच लॉस कोफिशिएंट्स को गतिशील रूप से रूट करने के लिए सॉफ्ट मिक्सचर ऑफ एक्सपर्ट्स का उपयोग करता है, जिससे स्थानिक विषमता (spatial heterogeneity) को संबोधित किया जाता है और ImageNet-1K एवं ADE20K बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

Konstantinos Georgiou, Maofeng Tang, Hairong Qi2026-07-01
💻 computer science

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

यह शोध पत्र AC3S प्रस्तुत करता है, जो एक डिफ्यूजन-आधारित फ्रेमवर्क है जो ओवर-कंडीशनिंग आर्टिफ़ेक्ट्स को रोकने के लिए एक सेल्फ-सुपरवाइज्ड विजुअल प्रॉम्प्ट मॉड्यूलेटर और 3D-अवेयर प्रॉम्प्ट कंपोजिशन के लिए एक मल्टी-एजेंट विजन लैंग्वेज मॉडल को संयोजित करता है, जिससे सटीक 3D संरचनात्मक संरेखण के साथ उच्च-गुणवत्ता वाले, फोटो-रियलिस्टिक सिंथेटिक डेटासेट के स्केलेबल उत्पादन को सक्षम बनाया जा सके।

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu2026-07-01
💻 computer science

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

यह शोध पत्र लंबे वीडियो में फ्यू-शॉट छिपी हुई भावनाओं की पहचान (few-shot hidden emotion recognition) के लिए XInsight Lab के प्रथम स्थान वाले समाधान को प्रस्तुत करता है, जो पहचान संबंधी पूर्वाग्रहों (identity biases) को समाप्त करने के लिए स्थिर पोज़ (static pose) और गतिशील सूक्ष्म-गति (dynamic micro-motion) विशेषताओं के बीच क्रॉस-अटेंशन का उपयोग करते हुए एक संक्षिप्त बहु-मोडल टेम्पोरल मॉडलिंग फ्रेमवर्क पेश करता है, साथ ही सूक्ष्म-गतिशील कार्यों (micro-dynamic tasks) में सामान्य विजन फाउंडेशन मॉडल्स के रिप्रजेंटेशन कोलैप्स (representation collapse) और शॉर्टकट लर्निंग (shortcut learning) के खतरों का आलोचनात्मक विश्लेषण करता है।

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo2026-07-01
💻 computer science

Editing Everything Everywhere All at Once

यह शोध पत्र MICE को प्रस्तुत करता है, जो मल्टीमॉडल डिफ्यूजन ट्रांसफॉर्मर्स के लिए एक प्रशिक्षण-मुक्त रणनीति है, जो अटेंशन मैकेनिज्म को नियंत्रित करके सिमेंटिक इंटरफेरेंस और एट्रिब्यूट लीकेज को रोकने के माध्यम से एकल फॉरवर्ड पास में स्केलेबल, उच्च-निष्ठा वाले मल्टी-इंस्टेंस इमेज एडिटिंग को सक्षम बनाता है।

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascian (…)2026-07-01
💻 computer science

Deep Spectral Models for Robust Dental Shape Generation

ToothForge एक डीप स्पेक्ट्रल जेनेरेटिव फ्रेमवर्क है जो मजबूत, कॉम्पैक्ट और व्याख्या योग्य आकार निर्माण प्राप्त करने के लिए सिंक्रोनाइज्ड स्पेक्ट्रल एम्बेडिंग्स का उपयोग करके 3D डेंटल क्राउन ज्योमेट्री को मॉडल करता है, जो विशेष रूप से मेडिकल अनुप्रयोगों में सीमित डेटासेट आकार और असंगत कनेक्टिविटी की चुनौतियों को संबोधित करता है।

Tibor Kubík, François Guibault, Michal Španěl, Hervé Lombaert2026-07-01
💻 computer science

Language-Assisted Super-Resolution from Real-World Low-Resolution Patches

यह शोधपत्र LA-SR का प्रस्ताव करता है, जो एक नवीन अनपेयर्ड (unpaired) सुपर-रिज़ॉल्यूशन फ्रेमवर्क है जो कम-रिज़ॉल्यूशन और उच्च-रिज़ॉल्यूशन वाली छवियों के बीच के अंतर को पाटने के लिए विज़न-लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे इस कार्य को एक सिमेंटिक लैंग्वेज स्पेस में पुनर्व्याख्यायित किया जाता है, और इस प्रकार सिंथेटिक प्रशिक्षण डेटा पर निर्भर किए बिना वास्तविक दुनिया के लो-रिज़ॉल्यूशन पैच से यथार्थवादी आउटपुट उत्पन्न करना सक्षम बनाया जाता है।

Joonkyu Park, Kyoung Mu Lee2026-07-01
💬 NLP

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

यह शोध पत्र विज़ुअल सिमेंटिक एंट्रॉपी (VSE) का प्रस्ताव करता है, जो एक नवीन अनिश्चितता अनुमान पद्धति है जो टेक्स्ट क्वेरीज़ को स्थिर रखते हुए केवल इमेज इनपुट्स को बाधित करके विज़ुअल अस्पष्टता को अलग करती है, जिससे मौजूदा एंट्रॉपी-आधारित दृष्टिकोणों की सीमाओं को दूर किया जा सके जो अत्यधिक आत्मविश्वासी विज़ुअल एम्बेडिंग्स द्वारा विकृत या टेक्स्टुअल विविधताओं द्वारा प्रभावित होते हैं।

Ta Duc Huy, Trang Nguyen, Townim Chowdhury, Ankit Yadav, Minh-Son To, Zhibin Liao, Johan W. Verjans, Vu Minh Hieu Phan2026-07-01