🤖 machine learning

LEMUR 2: Unlocking Neural Network Diversity for AI

LEMUR 2 एक बड़े पैमाने के, विस्तार योग्य ढांचे को पेश करता है जो 14,000 से अधिक विविध न्यूरल आर्किटेक्चर को व्यापक प्रदर्शन मेटाडेटा के साथ उत्पन्न करने के लिए जनरेटिव, इवैलुएटिव और डिप्लॉयमेंट पाइपलाइनों को एकीकृत करता है, जिससे मल्टीमॉडल कार्यों और हेटेरोजेनियस हार्डवेयर में पुनरुत्पादक, डेटा-संचालित एआई डिज़ाइन और एलएलएम-संचालित ऑटोएमएल के लिए एक नया आधार स्थापित होता है।

Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvv (…)2026-07-09
💻 computer science

Gen4U: Unifying Video Generation and Understanding via Diffusion

यह शोध पत्र Gen4U को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो वीडियो जनरेशन और समझ को एकीकृत करने के लिए फ्रोजन (frozen), बड़े पैमाने के वीडियो डिफ्यूजन मॉडल्स के स्ट्रक्चर्ड लेटेंट स्पेस का लाभ उठाता है, जिससे बिना फाइन-ट्यूनिंग के और जेनेरेटिव क्षमताओं को सुरक्षित रखते हुए विविध परसेप्शन कार्यों में प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Michael King, Aravindh Mahendran, Matthew Koichi Grimes, Fedor Kitashov, Adham Elarabawy, Pedro Velez, Maks Ovsjanikov (…)2026-07-09
💻 computer science

Geometric Collapse: When Vision Models Fail to Verify Physical Causality

यह शोध पत्र "स्कैम्बल्ड एजेस" (Scrambled Edges) प्रस्तुत करता है, जो एक काउंटरफैक्टुअल बेंचमार्क है और यह दर्शाता है कि वर्तमान डेंस ज्योमेट्रिक प्रेडिक्टर्स "जियोमेट्रिक कोलैप्स" (Geometric Collapse) का शिकार होते हैं क्योंकि वे भौतिक रूप से अवास्तविक एज क्यूज़ (edge cues) और वैध क्यूज़ के बीच अंतर करने में विफल रहते हैं, जिससे वैश्विक भविष्यवाणी त्रुटियां होती हैं जिन्हें दूषित क्षेत्रों के ज्ञान के साथ भी आसानी से सुधारा नहीं जा सकता है।

Wentao Zhang, Jinhu Qi, Weiqiang Jin, Yifei Zhang, Chan-Tong Lam, Irwin King2026-07-09
💻 computer science

Ensemble Deep Learning Approaches for AI-Altered Video Detection

यह शोध पत्र एक सुदृढ़ मल्टीमॉडल एंसेम्बल डीप लर्निंग सिस्टम का प्रस्ताव करता है जो AI-संशोधित वीडियो के लिए सामान्यीकरण और पहचान सटीकता में सुधार करने हेतु फ्यूजन रणनीतियों के साथ ऑडियो (AASIST) और विजुअल (EfficientNet, XceptionNet, MesoNet) विश्लेषण को संयोजित करता है, हालांकि यह उल्लेख करता है कि अनदेखी हेरफेर पर उच्च प्रदर्शन प्राप्त करना एक महत्वपूर्ण चुनौती बनी हुई है जिसमें औसत सटीकता लगभग 70% है।

Laiba Khan, Hung-Mao Wu, Wei Lin, Frank Bi, Yousef Abdelhadi, Joshua Jung2026-07-09
💻 computer science

Bi-PT: Bidirectional Cross-Attention Point Transformers for Four-Chamber Heart Reconstruction from Sparse Cardiac MRI Data

यह शोध पत्र Bi-PT का प्रस्ताव करता है, जो एक नवीन पाइपलाइन है जो विरल क्लिनिकल कार्डिएक एमआरआई डेटा से सटीक रूप से 3D फोर-चैंबर हार्ट मेश को पुनर्गठित करने के लिए द्विदिश क्रॉस-अटेंशन (bidirectional cross-attention) और न्यूरल ऑर्डिनरी डिफरेंशियल इक्वेशंस (Neural Ordinary Differential Equations) का उपयोग करता है, जिससे मजबूत पॉइंट फीचर्स को सीखना और डिफियोमॉर्फिक विरूपण (diffeomorphic deformations) सुनिश्चित करना संभव होता है।

Chenchuhui Hu, Shaoming Pan, Leon Axel, Meng Ye2026-07-09
💻 computer science

Ego-Human Motion Prediction with 3D-Aware LLM

यह शोध पत्र Ego3DLM पेश करता है, जो एक नवीन ढांचा है जो स्थानिक दृश्य समझ को क्रॉस-मोडल निरंतरता के साथ समग्र रूप से एकीकृत करने के माध्यम से एक विशेष तीन-चरणीय प्रशिक्षण योजना द्वारा एगोसेंट्रिक परिप्रेक्ष्य से भविष्य की मानव गति और संबंधित वर्णन को एक साथ पूर्वानुमान लगाने के लिए 3D-सचेत लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon2026-07-09
💻 computer science

TRACE-Seg3D: Counterfactual Context Auditing For Robust 3D Glioma Segmentation Under Institutional Shift

TRACE-Seg3D एक काउंटरफैक्चुअल कॉन्टेक्स्ट ऑडिटिंग फ्रेमवर्क है जो इमेजिंग कॉन्टेक्स्ट को व्यवस्थित रूप से बदलकर 3D ग्लियोमा सेगमेंटेशन की भविष्यवाणी स्थिरता को मापने और उन विफलता मोड को उजागर करने के लिए संस्थागत बदलावों के तहत इसकी मजबूती और विश्वसनीयता को बढ़ाता है जिन्हें पारंपरिक मेट्रिक्स नहीं पकड़ पाते हैं।

Nguyen Linh Dan Le, Nguyen Pham Hoang Le, Tran Dang Khoi2026-07-09
🤖 AI

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

यह शोध पत्र टेक्स्ट-टू-इमेज इन-कॉन्टेक्स्ट लर्निंग के लिए एक ट्री-ऑफ-थॉट्स रीजनिंग फ्रेमवर्क का प्रस्ताव करता है जो अतिरिक्त प्रशिक्षण की आवश्यकता के बिना संरचनात्मक अस्पष्टता को हल करने और छवि संश्लेषण की गुणवत्ता में सुधार करने के लिए एक बहु-चरणीय पीढ़ी, मूल्यांकन और चयन प्रक्रिया का उपयोग करता है।

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee2026-07-09
💻 computer science

Sparse Attention for Dense Open-Vocabulary Prediction in CLIP

यह शोध पत्र CLIP के अंतिम विज़ुअल सेल्फ-अटेंशन लेयर्स में मानक सॉफ्टमैक्स (softmax) को स्पार्स α\alpha-एंटमैक्स (sparse α\alpha-entmax) ट्रांसफॉर्म से बदलने का प्रस्ताव देता है ताकि अप्रासंगिक टोकन से होने वाले शोर को समाप्त किया जा सके, जिससे सिमेंटिक सेगमेंटेशन और फाइन-ग्रैन्ड रिट्रीवल जैसे डेंस ओपन-वोकैबुलरी प्रेडिक्शन कार्यों पर प्रदर्शन में उल्लेखनीय सुधार होता है।

Fatimah Zohra, Chen Zhao, Shuming Liu, Bernard Ghanem2026-07-09
⚡ electrical engineering

Prior-matched evaluation of operational Earth-observation classifiers: a three-number reporting method demonstrated on Sentinel-1 internal-wave detection

यह शोध पत्र एक गलत क्लास प्रायर (class prior) पर रिपोर्टिंग के कारण दुर्लभ-घटना पृथ्वी-अवलोकन क्लासिफायर में प्रेसिजन (precision) के व्यवस्थित अति-अनुमान की समस्या को संबोधित करता है, जिसमें एक तीन-संख्या वाली रिपोर्टिंग पद्धति और एक प्रिसिजन-प्रथम विकास चक्र का प्रस्ताव दिया गया है जिसने सेंटिनल-1 डेटा से आंतरिक तरंगों (internal waves) के परिचालन पता लगाने की सटीकता को 0.192 से 0.927 तक सफलतापूर्वक सुधारा है।

Joao Pinelo, Joao Goncalves, Arun Shukla, Adriana Santos-Ferreira2026-07-09