⚡ electrical engineering

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

यह शोध पत्र AVI-Bench को प्रस्तुत करता है, जो एक संज्ञानात्मक रूप से प्रेरित बेंचमार्क है जिसमें एक तीन-चरणीय मूल्यांकन ढांचा और एक प्रिमिटिव सेंसेशन एक्सटेंशन (AVI-Bench-PriSe) शामिल है, जो Omni-MLLMs की ऑडियो-विजुअल इंटेलिजेंस में वर्तमान सीमाओं का व्यवस्थित रूप से आकलन और निदान करने के लिए है, और अंततः भविष्य के मॉडल विकास को निर्देशित करने के लिए एक चार-स्तरीय वर्गीकरण प्रस्तावित करता है।

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fe (…)2026-06-09
🤖 AI

FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction

FineGen एक VLM-आधारित मल्टी-एजेंट फ्रेमवर्क है जो एक सहयोगात्मक जनरेशन-वेरिफिकेशन-करेक्शन पाइपलाइन के माध्यम से उच्च-गुणवत्ता वाले, विशेषता-विशिष्ट हार्ड नेगेटिव डेटासेट के निर्माण को स्वचालित करता है, जो डाउनस्ट्रीम विजन-लैंग्वेज कार्यों में सूक्ष्म-स्तरीय धारणा क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Chang Kong, Yuebing Li, Peng Mo, Haigang Zhang, Qiuming Luo2026-06-09
🤖 AI

DOME: Learning Transferable Domain Variables from Sparse Supervision for Test-Time Adaptation

यह शोध पत्र DOME का प्रस्ताव करता है, जो एक टेस्ट-टाइम अडैप्टेशन विधि है जो एक स्पार्स डोमेन बैंक के माध्यम से नमूना-विशिष्ट डोमेन चरों (sample-specific domain variables) को स्पष्ट रूप से मॉडल करने के लिए विजन-लैंग्वेज प्रीट्रेनिंग का लाभ उठाता है, जिससे सरल एंट्रॉपी-मिनिमाइजेशन रणनीतियों को भी विविध दूषित और शिफ्ट किए गए डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम बनाया जा सके।

Xiaoran Xu, Yifan Xu, Yupeng Wu, Xiaoshan Yang, Changsheng Xu2026-06-09
🤖 AI

ViMax: Agentic Video Generation

विमैक्स (ViMax) एक एजेंटिक वीडियो जनरेशन फ्रेमवर्क है जो लंबी अवधि के, कथा-संरचित वीडियो बनाने में वर्तमान विधियों की सीमाओं को दूर करने के लिए समन्वित बहु-एजेंट सहयोग, एक पदानुक्रमित नैरेटिव इंजन और निर्भरता-जागरूक दृश्य निरंतरता तंत्र का उपयोग करता है ताकि पात्र और पर्यावरणीय सुसंगतता को बनाए रखा जा सके।

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang2026-06-09
🤖 AI

Liquid Neural Networks as a Drop-in Continuous-Time Deformation Field for Dynamic 3D Gaussian Splatting

यह शोध पत्र डायनेमिक 3D गॉसियन स्प्लेटिंग (Dynamic 3D Gaussian Splatting) में मानक MLP को बदलने के लिए क्लोज्ड-फॉर्म कंटीन्यूअस-टाइम सेल्स (Closed-form Continuous-time cells) का उपयोग करते हुए एक लिक्विड न्यूरल नेटवर्क-आधारित विरूपण क्षेत्र (deformation field) प्रस्तावित करता है, जिससे बिना किसी संख्यात्मक सॉल्वर (numerical solvers) की आवश्यकता के स्पष्ट टेम्पोरल स्मूथनेस (temporal smoothness) लागू होती है और उच्च-आवृत्ति वाली आर्टिकुलेटेड मोशन (high-frequency articulated motion) के लिए पुनर्निर्माण गुणवत्ता में सुधार होता है।

Mingzhao Li, Arghya Pal, Guan Yuan Tan2026-06-09
🤖 AI

A Hierarchical Feature Engineering Framework for Automated Classification of Phonotraumatic and Non-Phonotraumatic Vocal Hyperfunction

यह अध्ययन एक पदानुक्रमित फीचर इंजीनियरिंग फ्रेमवर्क प्रस्तावित करता है जो एम्बुलेटरी नेक-सरफेस एक्सेलेरेशन डेटा का उपयोग करके स्वस्थ नियंत्रणों से फोनोट्राउमैटिक और नॉन-फोनोट्राउमैटिक वोकल हाइपरफंक्शन को प्रभावी ढंग से अलग करने के लिए कपलिंग फीचर्स का लाभ उठाता है, जिससे नॉन-लीनियर फीचर इंटरैक्शन के माध्यम से विशेष रूप से नॉन-फोनोट्राउमैटिक सबटाइप के लिए मजबूत वर्गीकरण प्रदर्शन प्राप्त होता है।

June-Woo Kim, Kangwook Jang, Minu Kim, Hyunju Lee2026-06-09
🧬 biology

Single-Cell Cross-Modal Transfer by Adversarial Fine-Tuning of Foundation Models

यह शोध पत्र एक ऐसी विधि प्रस्तावित करता है जो अनपेयर्ड (unpaired) स्थानिक ट्रांसक्रिप्टोमिक्स और सिंगल-सेल आरएनए सीक्वेंसिंग डेटा के बीच क्रॉस-मोडल ट्रांसलेशन करने के लिए सिंगल-सेल फाउंडेशन मॉडल के एडवरसेरियल फाइन-ट्यूनिंग का लाभ उठाती है, जो विसंघटित कोशिकाओं (dissociated cells) से इन सीटू (in situ) पड़ोस की जानकारी को प्रभावी ढंग से पुनर्प्राप्त करती है।

Joseph Boyd, Matthew Lyon, Martino Mansoldo, Christian Hurry, Finnian Firth2026-06-09
🤖 machine learning

DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

DOG-DPO एक प्रशिक्षण-मुक्त डेटा चयन ढांचा है जो प्राथमिकता युग्मों (preference pairs) को ज्यामितीय संकेतों के रूप में मानता है ताकि मल्टी-डेटासेट संरेखण दिशाओं को वैश्विक और अवशिष्ट उप-स्थानों (global and residual subspaces) में विघटित किया जा सके, जिससे बड़े भाषा मॉडल केवल 11% प्राथमिकता डेटा के साथ बेहतर उपयोगिता-मजबूती संतुलन बनाए रखते हुए मजबूत सुरक्षा संरेखण प्राप्त करने में सक्षम होते हैं।

Yi Nian, Tiankai Yang, Yudi Zhang, Qi Pan, Zelong Xu, Shenzhe Zhu, Qingqing Luan, Yue Huang, Xiangliang Zhang, Yue Zhao2026-06-09
🤖 AI

Systematic LLM Translation of Legacy Scientific Code to Differentiable Frameworks: Application to a Land Surface Model

यह शोध पत्र एक पांच-चरणीय LLM-आधारित एजेंटिक पाइपलाइन प्रस्तुत करता है जो 19,000-लाइन वाले एक लेगेसी फोर्ट्रान लैंड सरफेस मॉडल को सफलतापूर्वक एक डिफरेंशिएबल JAX फ्रेमवर्क में अनुवादित करता है, जिससे स्वचालित त्रुटि सुधार और सत्यापन के माध्यम से संख्यात्मक समानता सुनिश्चित करते हुए पैरामीटर रिकवरी और कम्प्यूटेशनल गति में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Aya Lahlou, Linnia Hawkins, Pierre Gentine2026-06-09
🤖 machine learning

Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching

यह शोध पत्र सिमेंटिक कैश डिस्टिलेशन (SCD) का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो कच्चे KV कैश के बजाय कॉम्पैक्ट सिमेंटिक कोड प्रसारित करके विसेग्रिगेटेड (disaggregated) LLM सर्विंग को त्वरित करता है, जिससे लो-रैंक रिकंस्ट्रक्शन और चयनात्मक त्रुटि सुधार के माध्यम से जनरेशन की गुणवत्ता बनाए रखते हुए टाइम-टू-फर्स्ट-टोकन को महत्वपूर्ण रूप से कम किया जाता है।

Qianli Ma, Zhiqing Tang, Hanshuai Cui, Zhi Yao, Weijia Jia2026-06-09