💻 computer science

BioAutoML-NAS: An End-to-End AutoML Framework for Multimodal Insect Classification via Neural Architecture Search on Large-Scale Biodiversity Data

BioAutoML-NAS एक नवीन एंड-टू-एंड AutoML फ्रेमवर्क है जो बड़े पैमाने पर कीट वर्गीकरण में अत्याधुनिक सटीकता प्राप्त करने के लिए न्यूरल आर्किटेक्चर सर्च और छवियों एवं मेटाडेटा के मल्टीमॉडल फ्यूजन का लाभ उठाता है, जो BIOSCAN-5M जैसे जैव विविधता डेटासेट पर मौजूदा ट्रांसफर लर्निंग, ट्रांसफॉर्मर और AutoML विधियों से काफी बेहतर प्रदर्शन करता है।

Arefin Ittesafun Abian, Debopom Sutradhar, Md Rafi Ur Rashid, Reem E. Mohamed, Md Rafiqul Islam, Asif Karim, Kheng Cher (…)2026-06-16
💻 computer science

MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition

MIRAGE मल्टी-वेक्टर इमेज रिट्रीवल के लिए एक कुशल रनटाइम शेड्यूलिंग फ्रेमवर्क है जो क्वेरी-इमेज एलाइनमेंट को बढ़ाने और कम्प्यूटेशनल रेडंडेंसी को कम करने के लिए एक नवीन पदानुक्रमित अपघटन प्रतिमान (hierarchical decomposition paradigm) का उपयोग करता है, जिससे मौजूदा प्रणालियों की तुलना में गणना को 3.5 गुना तक कम करते हुए महत्वपूर्ण सटीकता सुधार प्राप्त होता है।

Maoliang Li, Ke Li, Yaoyang Liu, Jiayu Chen, Zihao Zheng, Yinjun Wu, Chenchen Liu, Xiang Chen2026-06-16
🤖 machine learning

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

CoIRL-AD एक सहयोगात्मक-प्रतिस्पर्धी ढांचा है जो एंड-टू-एंड स्वायत्त ड्राइविंग की मजबूती और सामान्यीकरण को बढ़ाने के लिए, विशेष रूप से लॉन्ग-टेल परिदृश्यों और क्रॉस-सिटी सेटिंग्स में, लेटेंट वर्ल्ड मॉडल्स के भीतर इमिटेशन और रीइन्फोर्समेंट लर्निंग को एकीकृत करता है, जो उद्देश्यों को अलग करने और ऑफलाइन प्रशिक्षण के लिए इमेजिन्ड रोलआउट्स का लाभ उठाने के माध्यम से किया जाता है।

Xiaoji Zheng, Ziyuan Yang, Yanhao Chen, Yuhang Peng, Yuanrong Tang, Gengyuan Liu, Bokui Chen, Jiangtao Gong2026-06-16
🤖 AI

Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?

यह शोध पत्र एक तंत्रिका विज्ञान-प्रेरित टोपोलॉजिकल रेगुलेराइजेशन फ्रेमवर्क पेश करता है जो मॉडल की उपयोगिता को तुलनीय बनाए रखते हुए, मेंबरशिप इन्फरेंस प्राइवेसी हमलों के विरुद्ध मल्टी-मोडल विजन-लैंग्वेज मॉडल्स की लचीलेपन को महत्वपूर्ण रूप से बढ़ाता है।

David Amebley, Sayanton Dibbo2026-06-16
💻 computer science

CropTrack: A Tracking with Re-Identification Framework for Precision Agriculture

क्रॉपट्रैक (CropTrack) सटीक कृषि के लिए एक नवीन मल्टीपल-ऑब्जेक्ट ट्रैकिंग फ्रेमवर्क है जो मोशन डेटा को रेंकिंग-एन्हांस्ड, अपीयरेंस-आधारित एसोसिएशन रणनीति के साथ एकीकृत करके दोहराव वाले पैटर्न और बार-बार होने वाले अवरोधों जैसी चुनौतियों पर विजय प्राप्त करता है, जिससे पारंपरिक मोशन-ओनली विधियों की तुलना में पहचान संरक्षण में उल्लेखनीय सुधार होता है और पहचान स्विच (identity switches) कम होते हैं।

Md Ahmed Al Muzaddid, Jordan A. James, William J. Beksi2026-06-16
💻 computer science

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

यह शोध पत्र CASHEW, जो एक इन्फरेंस-टाइम फ्रेमवर्क है, और CASHEW-RL, जो ग्रुप सीक्वेंस पॉलिसी ऑप्टिमाइज़ेशन के साथ प्रशिक्षित एक सीखा हुआ वेरिएंट है, को पेश करता है, जो कैंडिडेट ट्राजेक्टरीज को इटरेटिव रूप से एग्रीगेट करके और विजुअल वेरिफिकेशन के माध्यम से हैलुसिनेशन को फ़िल्टर करके मल्टीमॉडल रीजनिंग को स्थिर करता है, जिससे 13 इमेज और वीडियो अंडरस्टैंडिंग बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Chaoyu Li, Deeparghya Dutta Barua, Fei Tao, Pooyan Fazli2026-06-16
🤖 AI

When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs

यह शोध पत्र "अटेंशन डिस्ट्रैक्शन" (Attention Distraction) को रिट्रीवल-ऑगमेंटेड लार्ज विजन-लैंग्वेज मॉडल्स में एक नवीन विफलता मोड के रूप में पहचानता है जहाँ प्रासंगिक रिट्रीव्ड टेक्स्ट विजुअल अटेंशन को दबा देता है, और MAD-RAG का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री विधि है जो विजुअल ग्राउंडिंग को कॉन्टेक्स्ट इंटीग्रेशन से अलग करके इस समस्या को महत्वपूर्ण रूप से कम करती है।

Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li2026-06-16
🤖 AI

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

यह शोध पत्र UniT को पेश करता है, जो एक ऐसा ढांचा है जो एकीकृत मल्टीमॉडल मॉडलों को बहु-चरणीय तर्क (multi-round reasoning), सत्यापन और परिशोधन के माध्यम से पुनरावृत्ति परीक्षण-समय स्केलिंग (iterative test-time scaling) करने में सक्षम बनाता है, यह प्रदर्शित करते हुए कि लघु तर्क प्रक्षेप पथों (short reasoning trajectories) पर प्रशिक्षण प्रभावी रूप से लंबे अनुमान श्रृंखलाओं (longer inference chains) तक सामान्यीकृत होता है और जटिल दृश्य समझ एवं निर्माण कार्यों में महत्वपूर्ण सुधार करता है।

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Y (…)2026-06-16
⚡ electrical engineering

FireRed-Image-Edit-1.0 Technical Report

यह शोध पत्र FireRed-Image-Edit को प्रस्तुत करता है, जो एक अत्याधुनिक डिफ्यूजन ट्रांसफार्मर है जो निर्देश-आधारित इमेज एडिटिंग के लिए एक सावधानीपूर्वक क्यूरेट किए गए 100M-सैंपल प्रशिक्षण कॉर्पस, डेटा दक्षता और नियंत्रणीयता के लिए नवीन तकनीकों वाले मल्टी-स्टेज ऑप्टिमाइज़ेशन पाइपलाइन, और विविध एडिटिंग कार्यों में उत्कृष्ट प्रदर्शन प्राप्त करने के लिए व्यापक REDEdit-Bench का लाभ उठाता है।

Super Intelligence Team, Changhao Qiao, Chao Hui, Chen Li, Cunzheng Wang, Dejia Song, Jiale Zhang, Jing Li, Qiang Xiang (…)2026-06-16
💻 computer science

ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT

ToaSt एक डिकपल्ड (decoupled) फ्रेमवर्क है जो अटेंशन मॉड्यूल्स के लिए कपल्ड हेड-वाइज स्ट्रक्चर्ड प्रूनिंग को फीड-फॉरवर्ड नेटवर्क्स के लिए एक ट्रेनिंग-फ्री टोकन चैनल सिलेक्शन पद्धति के साथ जोड़कर विजन ट्रांसफार्मर की दक्षता को बढ़ाता है, जिससे विविध मॉडलों और कार्यों में बेहतर सटीकता-दक्षता ट्रेड-ऑफ प्राप्त होता है।

Hyunchan Moon, Cheonjun Park, Steven L. Waslander2026-06-16