🤖 AI

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

यह शोध पत्र SAB-LVLM को प्रस्तुत करता है, जो लार्ज विजन-लैंग्वेज मॉडल्स के लिए एक नवीन बाइनराइजेशन फ्रेमवर्क है जो हेसियन-आधारित स्थानिक महत्व मानचित्रों (Hessian-based spatial significance maps) और एक मोडैलिटी-गाइडेड इंटीग्रेशन रणनीति का उपयोग करता है ताकि बाइनराइजेशन त्रुटियों को गतिशील रूप से पुनर्रweight किया जा सके, जिससे मौजूदा विधियों की तुलना में संसाधन-बाधित उपकरणों पर संपीड़न प्रदर्शन में महत्वपूर्ण सुधार होता है।

Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu (…)2026-07-03
🤖 machine learning

Rank-Then-Act: Reward-Free Control from Frame-Order Progress

यह शोध पत्र रैंक-देन-एक्ट (RTA) प्रस्तुत करता है, जो एक रिवॉर्ड-फ्री कंट्रोल फ्रेमवर्क है जो एक विजन-लैंग्वेज मॉडल को बिखरे हुए वीडियो फ्रेम्स से टेम्पोरल प्रोग्रेस सीखने के लिए प्रशिक्षित करता है और स्पष्ट एनवायरनमेंट रिवॉर्ड्स के बिना स्थिर पॉलिसी लर्निंग और क्रॉस-टास्क ट्रांसफर सक्षम करने के लिए स्पीरमैन रैंक कोरिलेशन-आधारित रिवॉर्ड सिग्नल का उपयोग करता है।

Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov2026-07-03
🤖 machine learning

Population-Based Multi-Objective Training of Discriminators for Semi-Supervised GANs

यह शोध पत्र सेमी-सुपरवाइज्ड GANs के लिए एक जनसंख्या-आधारित बहु-उद्देश्यीय विकासवादी प्रशिक्षण रणनीति प्रस्तावित करता है जो वर्गीकरण सटीकता और वास्तविक/नकली भेदभाव के बीच संतुलन तलाशने के लिए पारेटो डोमिनेंस द्वारा रैंक किए गए डिस्क्रिमिनेटर्स की एक जनसंख्या को बनाए रखता है, जिससे प्रशिक्षण की मजबूती में सुधार होता है और अत्याधुनिक बेसलाइनों की तुलना में बेहतर वर्गीकरण प्रदर्शन प्राप्त होता है।

Francisco Sedeño, Francisco Chicano, Jamal Toutouh2026-07-03
🤖 machine learning

Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits

यह शोध पत्र कंडीशनल को-एब्लेशन (CoAx) प्रस्तुत करता है, जो एक लेबल-मुक्त विधि है जो प्राथमिक घटकों को हटाने के बाद उनके महत्व में होने वाली वृद्धि को मापकर ट्रांसफॉर्मर सर्किटों में सुप्त बैकअप घटकों का पता लगाती है, जिससे आत्म-मरम्मत तंत्र (self-repair mechanisms) द्वारा उत्पन्न भ्रामक एट्रिब्यूशन पर विजय प्राप्त होती है और अधिक प्रभावी मॉडल प्रूनिंग और क्षमता नॉकआउट (capability knockout) सक्षम होता है।

Zhiren Gong, Zihao Zeng, Chau Yuen, Wei Yang Bryan Lim2026-07-03
🤖 machine learning

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

यह शोध पत्र MediMeta-C डेटासेट का उपयोग करके मेडिकल इमेज क्वालिटी असेसमेंट पर 16 विजन-लैंग्वेज मॉडल्स का बेंचमार्किंग करता है, जिससे यह पता चलता है कि हालांकि वे पिक्सेलेशन जैसे इमेज करप्शन के प्रति संवेदनशील हैं और टेक्स्टुअल मेटाडेटा से महत्वपूर्ण पूर्वाग्रह प्रदर्शित करते हैं, लेकिन गोपनीयता-विश्वसनीयता ट्रेड-ऑफ और वस्तुनिष्ठता के संबंध में उनकी वर्तमान सीमाएं तत्काल नैदानिक तैनाती में बाधा डालती हैं।

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer2026-07-03
🤖 AI

A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification

यह शोध पत्र DCASE 2026 चुनौती के लिए एक मल्टी-ब्रांच पदानुक्रम-जागरूक (hierarchy-aware) ढांचे को प्रस्तुत करता है जो विषम ऑडियो वर्गीकरण कार्यों पर अत्याधुनिक पदानुक्रमित F1 स्कोर प्राप्त करने के लिए CLAP-आधारित निरूपणों, संवर्धित प्रशिक्षण डेटा और KNN-आधारित पोस्ट-प्रोसेसिंग का लाभ उठाता है।

Beile Ning, Jiayi Yu, Zitong Wang, Yufei Hu, Wenjun Xu, Yuanhang Qian, Zhongxin Bai, Gongping Huang2026-07-03
🤖 AI

OntoLearner: A Modular Python Library for Ontology Learning with Large Language Models

यह शोध पत्र OntoLearner को प्रस्तुत करता है, जो एक मॉड्यूलर ओपन-सोर्स लाइब्रेरी है जो ऑन्टोलॉजी एक्सेस, LLM-संचालित लर्निंग पाइपलाइन्स और 22 डोमेन में मानकीकृत बेंचमार्किंग को एकीकृत करती है ताकि यह खुलासा किया जा सके कि ऑन्टोलॉजी लर्निंग में प्राथमिक बाधा मॉडल की क्षमता के बजाय मॉडल ज्ञान एनकोडिंग और ऑन्टोलॉजिकल संगठन के बीच एक संरचनात्मक बेमेल (structural mismatch) है।

Hamed Babaei Giglou, Jennifer D'Souza, Andrei Aioanei, Nandana Mihindukulasooriya, Sören Auer2026-07-03
🤖 AI

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

यह शोध पत्र ScopeEdit प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक ऑनलाइन एडिटर है जो अपडेट को ऑर्थोगोनल लो-रैंक स्पेस के भीतर मोडैलिटी-लोकल और एविडेंस-गेटेड शेयर्ड ब्रांचेस में विघटित करके एडिट-स्कोपेड जनरलाइजेशन प्राप्त करता है, जिससे स्थिर क्रॉस-मोडल नॉलेज ट्रांसफर सुनिश्चित होता है और साथ ही सिमेंटिक बाउंड्रीज़ को सख्ती से नियंत्रित करते हुए निरंतर कंप्यूटेशनल ओवरहेड बनाए रखा जाता है।

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li2026-07-03
🧬 biology

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

मोलसाइट (MolSight) एक नवीन ग्राफ-अवेयर विजन-लैंग्वेज मॉडल है जो रासायनिक-बंध आसन्नता (chemical-bond adjacency) के लिए एक मॉलिक्यूलर टोपोलॉजी मॉड्यूल और विजुअल-सिमेंटिक संरेखण (visual-semantic alignment) के लिए एक मॉलिक्यूलर ग्राउंडिंग मॉड्यूल को एकीकृत करके आणविक छवि समझ को बढ़ाता है, जिससे यह रासायनिक तर्क कार्यों में मौजूदा मॉडलों से काफी बेहतर प्रदर्शन करता है।

Wenda Wang, Yihan Tong, Yuwei Hu, Zhewei Wei2026-07-03
🤖 AI

Traceable Fault Diagnosis for Battery Energy Storage Systems via Retrieval-Augmented Multi-Agent O&M Assistant

यह शोध पत्र बड़े पैमाने के बैटरी ऊर्जा भंडारण प्रणालियों के लिए एक ट्रैसेबल दोष-निदान सहायक प्रस्तुत करता है जो व्याख्यात्मक ओ एंड एम (O&M) निर्णय लेने के लिए परिचालन डेटा, डोमेन ज्ञान और दृश्य साक्ष्य को एकीकृत करने हेतु रिट्रीवल-ऑगमेंटेड मल्टी-एजेंट रीजनिंग का लाभ उठाता है।

Jiangdi Ru, Bing Li, Yage Huang, Ding Wang, Keru Hua2026-07-03