🤖 AI

Can Conversational Temporal Dynamics Improve Depression Detection in Dyads? A Preliminary Investigation in Multi-Modality Perspectives

यह अध्ययन प्रदर्शित करता है कि संवादात्मक लौकिक गतिशीलता (conversational temporal dynamics), विशेष रूप से द्वैत टर्न-पेयर टाइमिंग (dyadic turn-pair timing) का मॉडलिंग करना, एक हल्के और व्याख्या योग्य मोडैलिटी के रूप में कार्य करता है जो पारंपरिक ध्वनिक और अर्थ संबंधी बेसलाइन से बेहतर प्रदर्शन करता है और नैदानिक साक्षात्कारों में स्व-पर्यवेक्षित एनकोडर (self-supervised encoders) के साथ फ्यूज होने पर अवसाद का पता लगाने की सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

Hanie Kang, Huang-Cheng Chou, Sudarsana Reddy Kadiri, Shrikanth Narayanan2026-07-07
💬 NLP

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

यह शोध पत्र EmCom-Diffusion को प्रस्तुत करता है, जो एक जनरेटिव मूल्यांकन ढांचा (generative evaluation framework) है जो संदेशों से इनपुट छवियों को पुनर्गठित करने के लिए एक टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल को फाइनट्यून करके उभरती भाषाओं (emergent languages) के दृश्य प्रतिबिंब को सीधे मापता है, जिससे मौजूदा अप्रत्यक्ष मेट्रिक्स की सीमाओं को दूर किया जा सके।

Haruumi Omoto, Tadahiro Taniguchi2026-07-07
🤖 AI

Self-Improving Diffusion Classifiers with Minority Preference Optimization

यह शोध पत्र MiPO को प्रस्तुत करता है, जो एक ऐसी विधि है जो अतिरिक्त इमेज डेटा या बाहरी रिवॉर्ड मॉडल की आवश्यकता के बिना, अल्पसंख्यकीय डेटा वितरण के प्रति धारणा में सुधार करने के लिए अल्पसंख्यक प्राथमिकता अनुकूलन (minority preference optimization) के साथ पूर्व-प्रशिक्षित मॉडलों को फाइन-ट्यून करके डिफ्यूजन मॉडल्स के अल्पसंख्यक क्षेत्रों में ज़ीरो-शॉट वर्गीकरण प्रदर्शन को बढ़ाता है।

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim2026-07-07
🤖 AI

SkillFab: An Agent-Native Skill Production Platform

स्किलफैब (SkillFab) एक एजेंट-नेटिव प्लेटफॉर्म है जो मानवों, स्क्रिप्ट्स और एजेंटों के लिए गिट-एकीकृत वर्कफ़्लो और एकीकृत इंटरफेस के माध्यम से मांग-संचालित विकास जीवनचक्र को व्यवस्थित करके अपूर्ण क्षमताओं को समीक्षा योग्य, पुन: प्रयोज्य एजेंट स्किल्स में बदल देता है।

Anjie Xu, Yifeng Cai, Yi Li, Zixing Wang, Zhiyu Zhang, Jingfan Chen, Ruohan Xu, Leye Wang2026-07-07
🤖 AI

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

यह शोध पत्र HetDPT को प्रस्तुत करता है, जो एक विषमता-जागरूक (heterogeneity-aware) डेप्थ प्रूनिंग विधि है जो इंटर-लेयर विषमता को संबोधित करके मौजूदा दृष्टिकोणों की सटीकता रिकवरी चुनौतियों पर विजय प्राप्त करती है, जिससे कई बेंचमार्क पर विजन ट्रांसफॉर्मर (Vision Transformers) पर न्यूनतम सटीकता हानि के साथ महत्वपूर्ण गति वृद्धि प्राप्त होती है।

Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang2026-07-07
🧬 biology

Folding, Reasoning, and Scaling with Open-source Drug Discovery Engine

यह शोध पत्र OpenDDE को प्रस्तुत करता है, जो एक ओपन-सोर्स, ऑल-एटम बायोमॉलिक्यूलर फाउंडेशन मॉडल है जो उन्नत ड्रग डिस्कवरी क्षमताओं तक पहुंच को लोकतांत्रिक बनाने के लिए को-फोल्डिंग (co-folding) को एक स्केलेबल स्ट्रक्चरल रीजनिंग लेयर के रूप में उपयोग करता है, जो न केवल सटीक कॉम्प्लेक्स स्ट्रक्चर प्रेडिक्शन को सक्षम बनाता है बल्कि डी नोवो डिज़ाइन, एफिनिटी एस्टीमेशन और चिकित्सीय अनुकूलन के लिए एक फाउंडेशनल प्लेटफॉर्म के रूप में भी कार्य करता है।

Aureka AI OpenDDE project2026-07-07
💬 NLP

Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks

यह शोध पत्र प्रदर्शित करता है कि एक डिस्क्रिमिनेटिव क्लासिफिकेशन हेड के साथ छोटे भाषा मॉडलों (3B पैरामीटर्स से कम) को फाइन-ट्यून करना लेबल जनरेशन दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है, जो मल्टी-चॉइस बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करता है और बहुत बड़े ज़ीरो-शॉट मॉडलों का मुकाबला करता है।

Bhavesh Sood, Jaromir Savelka2026-07-07
🤖 AI

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

CineMobile एक ऑन-डिवाइस इमेज-टू-वीडियो डिफ्यूजन फ्रेमवर्क है जो एक बड़े DiT मॉडल को 1GB से कम के जनरेटर में कंप्रेस करने के लिए डिस्टिलेशन-गाइडेड प्रूनिंग, रीइन्फोर्समेंट लर्निंग-आधारित डिस्टिलेशन और हाइब्रिड क्वांटाइजेशन का उपयोग करता है, जो मोबाइल हार्डवेयर पर सिनेमैटिक वीडियो बनाने के लिए 40x की गति वृद्धि और कम लेटेंसी सक्षम करता है।

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng2026-07-07
⚡ electrical engineering

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

यह शोध पत्र प्रदर्शित करता है कि CLAP ऑडियो एम्बेडिंग विशिष्ट रैखिक और गैर-रैखिक व्यवस्थाओं के माध्यम से गूँज (reverberation), तीव्रता (loudness) और पिच जैसे मौलिक ध्वनिक गुणों को विश्वसनीय रूप से एनकोड करती है, जो डेटासेट में ज्यामितीय निरंतरता और ध्वनिक विवरणों के टेक्स्ट एम्बेडिंग के साथ संरेखण को प्रकट करती है।

Héctor Martel, Joe Hennessy-Priest, Taemin Cho2026-07-07✓ Author reviewed
🤖 AI

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

यह शोध पत्र डिफ्यूजन क्लासिफायर (diffusion classifiers) का तीन पूर्वाग्रह आयामों (bias dimensions) के आधार पर मूल्यांकन करने के लिए ASOB-Bench प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ वे एट्रिब्यूट बाइंडिंग (attribute binding) में विजन-लैंग्वेज बेसलाइन से बेहतर प्रदर्शन करते हैं, वहीं वे साइज-ऑर्डर शॉर्टकट्स (size-order shortcuts) और बैकग्राउंड डिपेंडेंसी (background dependency) के प्रति विशिष्ट और गंभीर कमजोरियां प्रदर्शित करते हैं, जिनके विफलता तंत्र (failure mechanisms) टेक्स्ट-टू-इमेज जनरेशन की मजबूती (robustness) के बारे में भी जानकारी देते हैं।

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi2026-07-07