💻 computer science

Complex Layout Classification in the Wild: A Low-Resource Approach with Layout-Preserving Augmentations

यह शोध पत्र एक हस्तनिर्मित डेटासेट और एक नवीन सीएनएन-आधारित (CNN-based) प्रशिक्षण रणनीति को पेश करते हुए, डेटा की अत्यधिक कमी के तहत जटिल दस्तावेज़ लेआउट को वर्गीकृत करने की चुनौती का समाधान करता है, जो मॉडल के सामान्यीकरण को बढ़ाने के लिए अनिसोट्रोपिक गौसियन मास्किंग (anisotropic Gaussian masking) और परावर्तन-प्रेरित लेबल रूपांतरण (reflection-induced label transformations) जैसे डोमेन-जागरूक संवर्द्धनों का लाभ उठाता है।

Sharva Gogawale, Iddo Hakim, Gal Grudka, Mohammad Suliman, Omer Ventura, Daria Vasyutinsky-Shapira, Berat Kurar-Barakat (…)2026-06-17
🤖 machine learning

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

यह शोध पत्र DriveJudge को प्रस्तुत करता है, जो एक नवीन स्वायत्त ड्राइविंग मूल्यांकन एजेंट है जो मानव-संरेखित बेंचमार्क कार्यों पर श्रेष्ठ, व्याख्यात्मक और संदर्भ-जागरूक प्रदर्शन प्राप्त करने के लिए विजन-लैंग्वेज मॉडल तर्क (Vision-Language Model reasoning) को भौतिक रूप से-आधारित नियम फलनों (physically-grounded rule functions) के साथ एकीकृत करता है।

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Al (…)2026-06-17
💻 computer science

Improving and Evaluating Hand-Object Interaction Detection

यह शोध पत्र HOI-DETR प्रस्तुत करता है, जो हैंड-ऑब्जेक्ट इंटरेक्शन डिटेक्शन के लिए एक अत्याधुनिक फ्रेमवर्क है, जो कई विविध डेटासेट्स पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करने के लिए एक उन्नत Co-DETR आर्किटेक्चर और एक व्यापक मूल्यांकन सुइट का लाभ उठाता है।

Ahmad Darkhalil, Dima Damen, David Fouhey2026-06-17
🤖 AI

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations

TerraTransfer एक एंड-टू-एंड स्वायत्त ड्राइविंग फ्रेमवर्क पेश करता है जो पॉलिसी लर्निंग को विजुअल परसेप्शन से अलग करके विशेषज्ञ प्रदर्शनों की आवश्यकता को समाप्त करता है, जो वेक्टरकृत सिम्युलेटर्स में सेल्फ-प्ले का उपयोग करके एक ड्राइविंग पॉलिसी उत्पन्न करता है जिसे बाद में केवल युग्मित (इमेज, सीन-स्टेट) डेटा का उपयोग करके एक प्री-ट्रेन्ड विजन बैकबोन के साथ संरेखित किया जाता है।

Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan2026-06-17
🤖 machine learning

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

यह शोधपत्र LeaP को प्रस्तुत करता है, जो एक सीखने योग्य सोर्स प्रायर (source prior) है जो जनरेटिव रोबोटिक पॉलिसियों में मानक गॉसियन इनिशियलाइजेशन (Gaussian initialization) के स्थान पर प्रोप्रियोसेप्शन-कंडीशन्ड (proprioception-conditioned) वितरण को प्रतिस्थापित करता है, जिससे सिमुलेशन और वास्तविक दुनिया के मैनिपुलेशन कार्यों दोनों में सफलता दर और अभिसरण (convergence) में महत्वपूर्ण सुधार होता है।

Meipo Dai, Qiyuan Zhuang, He-Yang Xu, Ying-Jie Shuai, Yijun Wang, Qi Dou, Xiu-Shen Wei2026-06-17
💻 computer science

Attention Alignment Between Humans and Vision-Language Models

यह अध्ययन प्रकट करता है कि जहाँ विजन-लैंग्वेज मॉडल्स में LSTM-आधारित डिकोडर्स, ट्रांसफॉर्मर डिकोडर्स की तुलना में मानव स्थानिक ध्यान (spatial attention) के साथ बेहतर संरेखण प्राप्त करते हैं, वहीं बाद वाले अधिक तीक्ष्ण स्थानिक एकाग्रता और बेहतर कार्य विभेदन प्रदर्शित करते हैं, जिसमें एक ऐसा ट्रेड-ऑफ उभरता है जहाँ कम फिक्सेशन संरेखण (CNN-Transformers) वाले मॉडल प्रारंभिक दृश्य प्रांतस्था (early visual cortex) में सिंथेटिक तंत्रिका गतिविधि की बेहतर भविष्यवाणी करते हैं।

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano2026-06-17
💻 computer science

Impact of Hand Impairment and Occlusions on Hand Pose Estimation Accuracy in Augmented Reality Applications

यह अध्ययन प्रदर्शित करता है कि होलोलेंस 2 (HoloLens 2) और अत्याधुनिक पोज़ एस्टिमेशन एल्गोरिदम, स्पष्ट और अपारदर्शी दोनों प्रकार की वस्तुओं के साथ बातचीत के दौरान सर्वाइकल स्पाइनल कॉर्ड इंजरी वाले व्यक्तियों और बिना चोट वाले नियंत्रण समूहों के लिए तुलनीय सटीकता बनाए रखते हैं, जो संवर्धित वास्तविकता (ऑगमेंटेड रियलिटी) आधारित हैंड रिहैबिलिटेशन अनुप्रयोगों के लिए उनकी व्यवहार्यता की पुष्टि करता है।

Damian M. Manzone, Mathew Szymanowski, Olga Taran, Shuo Cai, Melissa Marquez-Chin, Tammy Zeng, Hardeep Singh, Cesar Marq (…)2026-06-17
🤖 AI

Spatio-Temporal Fusion Model for Standard View Classification of Echocardiographic Videos

इकोकार्डियोग्राफिक व्यू वर्गीकरण में डेटा की कमी और फ्रेम गुणवत्ता के विविधताओं जैसी चुनौतियों को संबोधित करने के लिए, यह शोध पत्र सबसे बड़े सार्वजनिक रूप से उपलब्ध डेटासेट (EV9V) और एक नवीन स्पैटियो-टेम्पोरल फ्यूजन मॉडल (STFM) को प्रस्तुत करता है जो मजबूत वीडियो वर्गीकरण के लिए स्थानिक शारीरिक संरचनाओं को टेम्पोरल कार्डियक डायनेमिक्स के साथ प्रभावी ढंग से संयोजित करने हेतु अनसर्टेन्टी-अवेयर लर्निंग का लाभ उठाता है।

Bo Gou, Jicheng Zhang, Jianlong Xiong, Tao He, Bentian Liu, Hai Wu, Yijiao Wang, Yu Zhang, Yujia Yang, Yun Dai, Jian Liu (…)2026-06-17
💻 computer science

SPHINX: First Explain, Then Explore

SPHINX एक क्लोज्ड-लूप फ्रेमवर्क है जो प्रतिकूल ड्राइविंग परिदृश्यों को उत्पन्न करने के लिए, पहले नीति विफलताओं (policy failures) का निदान करने हेतु व्याख्यात्मक एआई (explainable AI) का उपयोग करता है और फिर उन विशिष्ट कमजोरियों के आधार पर लक्षित परिदृश्यों का पता लगाने और उन्हें संश्लेषित करने के लिए एक विजन-लैंग्वेज मॉडल का लाभ उठाता है, जिससे स्वायत्त वाहनों की मजबूती में सुधार होता है।

Nguyen Do, Tue M. Cao, Tien Van Do, András Hajdu, Tamás Bérczes, My T. Thai2026-06-17
⚡ electrical engineering

Two-Stage Fine-Tuning of ResNet50 for High-Sensitivity Melanoma Detection on Dermoscopic Images

यह शोध पत्र ResNet50 के लिए एक दो-चरणीय फाइन-ट्यूनिंग रणनीति का प्रस्ताव और सत्यापन करता है जो प्रभावी रूप से क्लास इम्बैलेंस (वर्ग असंतुलन) को संबोधित करती है और कैटास्ट्रोफिक फॉरगेटिंग (विनाशकारी विस्मृति) को रोकता है, जिससे डर्मोस्कोपिक छवियों पर उच्च-संवेदनशीलता वाला मेलानोमा डिटेक्शन (87.56% संवेदनशीलता, 0.9559 AUC) प्राप्त होता है और यह सिंगल-स्टेज दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Aryan Bhagat2026-06-17