🤖 AI

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

यह शोध पत्र ईगो-व्यू (ego-view) ट्रैफ़िक दुर्घटना वीडियो में उत्तरदायता वितरण अनुमान (responsibility distribution estimation) के नवीन कार्य को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि फाइन-ट्यून्ड मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स ड्राइवर के प्रत्यक्ष दृश्य परिप्रेक्ष्य का लाभ उठाकर एजेंट की उत्तरदायता प्रतिशत को प्रभावी ढंग से अनुमानित कर सकते हैं।

Ryosei Tamura, Andrew Shin2026-07-07
⚡ electrical engineering

An Interpretable Deep Learning Framework for Discovery and Clinical Validation of Deep Radiomic Signatures in Tumor Classification

यह शोध पत्र एक व्याख्यात्मक (interpretable) डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है जो पारंपरिक होल-ट्यूमर रेडियोमिक्स की तुलना में कई मेडिकल इमेजिंग डेटासेट्स पर बेहतर ट्यूमर वर्गीकरण प्रदर्शन और जैविक अंतर्दृष्टि प्रदर्शित करते हुए, पुनरुत्पादनीय मात्रात्मक इमेजिंग बायोमार्कर निकालने और उन्हें मान्य करने के लिए सेगमेंटेशन, ग्रेड-कैम-गाइडेड सिग्नेचर डिस्कवरी और शैप-आधारित विश्लेषण को एकीकृत करता है।

Chengkun Sun, Jinqian Pan, Renjie Liang, Zhengkang Fan, Xin Miao, Yi Guo, Mei Liu, Muxuan Liang, Russell Terry, Jie Xu2026-07-07
🤖 AI

Token-Based Affordance Grounding with Large Vision-Language Models

यह शोध पत्र TokAG का प्रस्ताव करता है, जो एक ज़ीरो-शॉट अफोर्डेंस ग्राउंडिंग फ्रेमवर्क है जो लार्ज विज़न-लैंग्वेज मॉडल्स से ऑब्जेक्ट-केंद्रित अटेंशन मैप्स निकालने के लिए एक स्थानिक-जागरूक टोकन-चयन तंत्र का लाभ उठाता है, जिससे बाहरी पर्यवेक्षण के बिना क्रिया-प्रासंगिक क्षेत्रों को स्थानीयकृत करने में पूर्व कमजोर रूप से पर्यवेक्षित विधियों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Seung Il Lee, Qinqian Lei, Daguang Xu, Dong Yang, Robby T. Tan, Yixin Chen, Bo Wang2026-07-07
💬 NLP

They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) अपने हिडन स्टेट्स (hidden states) के भीतर उपयोगकर्ता के संप्रेषणात्मक इरादे (communicative intent) को मजबूती से एनकोड करते हैं, जो अक्सर एक रीडआउट लैग (readout lag) के कारण उस पर कार्य करने में विफल रहते हैं जिसे सतही-स्तर के प्रॉम्प्ट्स पर निर्भर रहने के बजाय एक विशिष्ट कॉज़ल दिशा (causal direction) के साथ मॉडल को स्टीयर करके हल किया जा सकता है।

Alex Kwon2026-07-07
🤖 AI

RADIO1D: Elastic Representations for Condensed Vision Modeling

यह शोध पत्र RADIO1D को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो फिक्स्ड 2D पैच-आधारित फीचर्स पर निर्भरता को चुनौती देता है, और नॉलेज डिस्टिलेशन एवं ऑटोएनकोडिंग के माध्यम से छवियों को कॉम्पैक्ट, परिवर्तनीय-लंबाई वाले 1D टोकन अनुक्रमों में संकुचित करता है, जिससे लचीले सटीकता-दक्षता ट्रेड-ऑफ और विजन-लैंग्वेज मॉडल्स में श्रेष्ठ प्रदर्शन सक्षम होता है।

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao (…)2026-07-07
🤖 AI

The Role of Rigor in Artificial Intelligence

यह शोध पत्र आर्टिफिशियल इंटेलिजेंस के अद्वितीय "कीमियाई" (alchemical) प्रक्षेपवक्र का विश्लेषण करने के लिए वैचारिक, ज्ञानमीमांसीय और परिचालन कठोरता के एक त्रि-आयामी ढांचे का प्रस्ताव करता है, और यह तर्क देता है कि सैद्धांतिक आधारों पर परिचालन कठोरता का वर्तमान प्रभुत्व इसके तीव्र अनुभवजन्य सफलताओं और निरंतर वैज्ञानिक अनिश्चितताओं, दोनों की व्याख्या करता है।

Timothy Nguyen2026-07-07
📊 statistics

An AI-Assisted Solution to the Signed BAR Conjecture: Uniqueness in the Harrison--Reiman Class and a Completely-S\mathcal{S} Class Obstruction

यह शोध पत्र एक ChatGPT-सहायता प्राप्त पाथवाइज डिफरेंशिएबिलिटी (pathwise differentiability) तर्क का उपयोग करते हुए, नॉनसिंगुलर MM-मैट्रिक्स रिफ्लेक्शन मैट्रिसेस वाले स्थिर हैरिसन-रीमैन डेटा (Harrison–Reiman data) के लिए विशिष्टता को सिद्ध करके 35 साल पुराने हस्ताक्षरित BAR विशिष्टता (signed BAR uniqueness) की समस्या को हल करता है, जबकि साथ ही यह भी प्रदर्शित करता है कि यह विशिष्टता सिंगुलर प्रिंसिपल ब्लॉक्स से जुड़े संरचनात्मक अवरोधों के कारण व्यापक कंप्लीटली-S\mathcal{S} (completely-S\mathcal{S}) वर्ग में विफल हो जाती है।

Yiping Lu, Youheng Zhu2026-07-07
🤖 AI

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

यह शोध पत्र मूनस्टोन (Moonstone) को प्रस्तुत करता है, जो चंद्र रिमोट सेंसिंग के लिए पहला मल्टीमॉडल फाउंडेशन मॉडल बेंचमार्क है, जिसमें एक व्यापक 28-चैनल वैश्विक डेटासेट और एक नवीन मोडैलिटी-ग्रुपड मास्क ऑटोएनकोडर (MG-MAE) शामिल है जो छह डाउनस्ट्रीम कार्यों में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Ayush Prasad, Swarnalee Mazumder2026-07-07
🤖 AI

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

यह शोध पत्र ViPo-MLLM प्रस्तुत करता है, जो एक नवीन ढांचा है जो PHOENIX14T और CSL-Daily डेटासेट पर अत्याधुनिक ग्लॉस-मुक्त संकेत भाषा अनुवाद (Sign Language Translation) प्राप्त करने के लिए एक लार्ज लैंग्वेज मॉडल के साथ स्थानिक-कालिक (spatio-temporal) RGB और मानव मुद्रा (human pose) विशेषताओं को एकीकृत करता है, जो प्रभावी रूप से ग्लॉस-आधारित दृष्टिकोणों को टक्कर देता है।

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman2026-07-07
🤖 AI

Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

PivoARL एक LLM एजेंटों के लिए एक सेल्फ-फीडबैक रिट्राय फ्रेमवर्क है जो कुशल स्थानीय पुनरावृत्तियों (local retries) को सक्षम करने के लिए महत्वपूर्ण त्रुटिपूर्ण टर्न की पहचान करता है, जिससे अनुभव संकेतों को केंद्रित करना, अनावश्यक इंटरैक्शन को कम करना और विभिन्न कार्यों में निर्णय लेने के प्रदर्शन में महत्वपूर्ण सुधार करना संभव होता है।

Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li2026-07-07