🤖 AI

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

यह शोध पत्र मूनस्टोन (Moonstone) को प्रस्तुत करता है, जो चंद्र रिमोट सेंसिंग के लिए पहला मल्टीमॉडल फाउंडेशन मॉडल बेंचमार्क है, जिसमें एक व्यापक 28-चैनल वैश्विक डेटासेट और एक नवीन मोडैलिटी-ग्रुपड मास्क ऑटोएनकोडर (MG-MAE) शामिल है जो छह डाउनस्ट्रीम कार्यों में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Ayush Prasad, Swarnalee Mazumder2026-07-07
🤖 AI

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

यह शोध पत्र ViPo-MLLM प्रस्तुत करता है, जो एक नवीन ढांचा है जो PHOENIX14T और CSL-Daily डेटासेट पर अत्याधुनिक ग्लॉस-मुक्त संकेत भाषा अनुवाद (Sign Language Translation) प्राप्त करने के लिए एक लार्ज लैंग्वेज मॉडल के साथ स्थानिक-कालिक (spatio-temporal) RGB और मानव मुद्रा (human pose) विशेषताओं को एकीकृत करता है, जो प्रभावी रूप से ग्लॉस-आधारित दृष्टिकोणों को टक्कर देता है।

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman2026-07-07
🤖 AI

Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

PivoARL एक LLM एजेंटों के लिए एक सेल्फ-फीडबैक रिट्राय फ्रेमवर्क है जो कुशल स्थानीय पुनरावृत्तियों (local retries) को सक्षम करने के लिए महत्वपूर्ण त्रुटिपूर्ण टर्न की पहचान करता है, जिससे अनुभव संकेतों को केंद्रित करना, अनावश्यक इंटरैक्शन को कम करना और विभिन्न कार्यों में निर्णय लेने के प्रदर्शन में महत्वपूर्ण सुधार करना संभव होता है।

Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li2026-07-07
🤖 AI

Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives

यह अध्ययन प्रदर्शित करता है कि संवादात्मक लौकिक गतिशीलता (conversational temporal dynamics), विशेष रूप से द्वैत टर्न-पेयर टाइमिंग (dyadic turn-pair timing) का मॉडलिंग करना, एक हल्के और व्याख्या योग्य मोडैलिटी के रूप में कार्य करता है जो पारंपरिक ध्वनिक और अर्थ संबंधी बेसलाइन से बेहतर प्रदर्शन करता है और नैदानिक साक्षात्कारों में स्व-पर्यवेक्षित एनकोडर (self-supervised encoders) के साथ फ्यूज होने पर अवसाद का पता लगाने की सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

Hanie Kang, Huang-Cheng Chou, Sudarsana Reddy Kadiri, Shrikanth Narayanan2026-07-07
💬 NLP

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

यह शोध पत्र EmCom-Diffusion को प्रस्तुत करता है, जो एक जनरेटिव मूल्यांकन ढांचा (generative evaluation framework) है जो संदेशों से इनपुट छवियों को पुनर्गठित करने के लिए एक टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल को फाइनट्यून करके उभरती भाषाओं (emergent languages) के दृश्य प्रतिबिंब को सीधे मापता है, जिससे मौजूदा अप्रत्यक्ष मेट्रिक्स की सीमाओं को दूर किया जा सके।

Haruumi Omoto, Tadahiro Taniguchi2026-07-07
🤖 AI

Self-Improving Diffusion Classifiers with Minority Preference Optimization

यह शोध पत्र MiPO को प्रस्तुत करता है, जो एक ऐसी विधि है जो अतिरिक्त इमेज डेटा या बाहरी रिवॉर्ड मॉडल की आवश्यकता के बिना, अल्पसंख्यकीय डेटा वितरण के प्रति धारणा में सुधार करने के लिए अल्पसंख्यक प्राथमिकता अनुकूलन (minority preference optimization) के साथ पूर्व-प्रशिक्षित मॉडलों को फाइन-ट्यून करके डिफ्यूजन मॉडल्स के अल्पसंख्यक क्षेत्रों में ज़ीरो-शॉट वर्गीकरण प्रदर्शन को बढ़ाता है।

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim2026-07-07
🤖 AI

SkillFab: An Agent-Native Skill Production Platform

स्किलफैब (SkillFab) एक एजेंट-नेटिव प्लेटफॉर्म है जो मानवों, स्क्रिप्ट्स और एजेंटों के लिए गिट-एकीकृत वर्कफ़्लो और एकीकृत इंटरफेस के माध्यम से मांग-संचालित विकास जीवनचक्र को व्यवस्थित करके अपूर्ण क्षमताओं को समीक्षा योग्य, पुन: प्रयोज्य एजेंट स्किल्स में बदल देता है।

Anjie Xu, Yifeng Cai, Yi Li, Zixing Wang, Zhiyu Zhang, Jingfan Chen, Ruohan Xu, Leye Wang2026-07-07
🤖 AI

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

यह शोध पत्र HetDPT को प्रस्तुत करता है, जो एक विषमता-जागरूक (heterogeneity-aware) डेप्थ प्रूनिंग विधि है जो इंटर-लेयर विषमता को संबोधित करके मौजूदा दृष्टिकोणों की सटीकता रिकवरी चुनौतियों पर विजय प्राप्त करती है, जिससे कई बेंचमार्क पर विजन ट्रांसफॉर्मर (Vision Transformers) पर न्यूनतम सटीकता हानि के साथ महत्वपूर्ण गति वृद्धि प्राप्त होती है।

Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang2026-07-07
🧬 biology

Folding, Reasoning, and Scaling with Open-source Drug Discovery Engine

यह शोध पत्र OpenDDE को प्रस्तुत करता है, जो एक ओपन-सोर्स, ऑल-एटम बायोमॉलिक्यूलर फाउंडेशन मॉडल है जो उन्नत ड्रग डिस्कवरी क्षमताओं तक पहुंच को लोकतांत्रिक बनाने के लिए को-फोल्डिंग (co-folding) को एक स्केलेबल स्ट्रक्चरल रीजनिंग लेयर के रूप में उपयोग करता है, जो न केवल सटीक कॉम्प्लेक्स स्ट्रक्चर प्रेडिक्शन को सक्षम बनाता है बल्कि डी नोवो डिज़ाइन, एफिनिटी एस्टीमेशन और चिकित्सीय अनुकूलन के लिए एक फाउंडेशनल प्लेटफॉर्म के रूप में भी कार्य करता है।

Aureka AI OpenDDE project2026-07-07
💬 NLP

Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks

यह शोध पत्र प्रदर्शित करता है कि एक डिस्क्रिमिनेटिव क्लासिफिकेशन हेड के साथ छोटे भाषा मॉडलों (3B पैरामीटर्स से कम) को फाइन-ट्यून करना लेबल जनरेशन दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है, जो मल्टी-चॉइस बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करता है और बहुत बड़े ज़ीरो-शॉट मॉडलों का मुकाबला करता है।

Bhavesh Sood, Jaromir Savelka2026-07-07