🤖 AI

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

CineMobile एक ऑन-डिवाइस इमेज-टू-वीडियो डिफ्यूजन फ्रेमवर्क है जो एक बड़े DiT मॉडल को 1GB से कम के जनरेटर में कंप्रेस करने के लिए डिस्टिलेशन-गाइडेड प्रूनिंग, रीइन्फोर्समेंट लर्निंग-आधारित डिस्टिलेशन और हाइब्रिड क्वांटाइजेशन का उपयोग करता है, जो मोबाइल हार्डवेयर पर सिनेमैटिक वीडियो बनाने के लिए 40x की गति वृद्धि और कम लेटेंसी सक्षम करता है।

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng2026-07-07
⚡ electrical engineering

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

यह शोध पत्र प्रदर्शित करता है कि CLAP ऑडियो एम्बेडिंग विशिष्ट रैखिक और गैर-रैखिक व्यवस्थाओं के माध्यम से गूँज (reverberation), तीव्रता (loudness) और पिच जैसे मौलिक ध्वनिक गुणों को विश्वसनीय रूप से एनकोड करती है, जो डेटासेट में ज्यामितीय निरंतरता और ध्वनिक विवरणों के टेक्स्ट एम्बेडिंग के साथ संरेखण को प्रकट करती है।

Héctor Martel, Joe Hennessy-Priest, Taemin Cho2026-07-07✓ Author reviewed
🤖 AI

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

यह शोध पत्र डिफ्यूजन क्लासिफायर (diffusion classifiers) का तीन पूर्वाग्रह आयामों (bias dimensions) के आधार पर मूल्यांकन करने के लिए ASOB-Bench प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ वे एट्रिब्यूट बाइंडिंग (attribute binding) में विजन-लैंग्वेज बेसलाइन से बेहतर प्रदर्शन करते हैं, वहीं वे साइज-ऑर्डर शॉर्टकट्स (size-order shortcuts) और बैकग्राउंड डिपेंडेंसी (background dependency) के प्रति विशिष्ट और गंभीर कमजोरियां प्रदर्शित करते हैं, जिनके विफलता तंत्र (failure mechanisms) टेक्स्ट-टू-इमेज जनरेशन की मजबूती (robustness) के बारे में भी जानकारी देते हैं।

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi2026-07-07
💬 NLP

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

यह शोध पत्र इंटरप्रेस-पैरेलल-कॉर्पस (Interpres-Parallel-Corpus) डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि मध्यकालीन लैटिन पांडुलिपियों के अनुवाद के लिए, एक विशेष ओसीआर (OCR) को विजन लैंग्वेज मॉडल (Vision Language Model) के साथ संयोजित करने वाला एक सरल पाइपलाइन, त्रुटि प्रसार (error propagation) और प्रॉम्प्ट संतृप्ति (prompt saturation) से बचकर अधिक जटिल बहु-घटक दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz, Mufti Mahmud2026-07-07
💬 NLP

Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth

यह शोध पत्र SALT प्रस्तुत करता है, जो दीर्घ-रूप (long-form) LLM जनरेशन के मूल्यांकन के लिए नियत ग्राउंड ट्रुथ्स (deterministic ground truths) वाला एक बेंचमार्क है, जो यह प्रकट करता है कि जहाँ तर्क (reasoning) सटीकता में सुधार करता है, वहीं यह आत्मविश्वास रैंकिंग (confidence ranking) को कम करता है, और त्रुटि प्रसार (error propagation) भ्रष्ट प्रीफिक्स (corrupted prefixes) और बढ़ते उत्तर-संदर्भ लंबाई (answer-context length) दोनों से प्रेरित होता है।

Ido Amit, Ido Galil, Ran El-Yaniv2026-07-07
🤖 AI

Next-Gen Sponsored Search: Crafting the Perfect Query with Inventory-Aware RAG (InvAwr-RAG) Based GenAI

यह शोध पत्र InvAwr-RAG को प्रस्तुत करता है, जो एक इन्वेंटरी-अवेयर (Inventory-Aware) RAG-आधारित जनरेटिव एआई मॉडल है जो वास्तविक समय की विज्ञापन इन्वेंटरी के अनुरूप प्रासंगिक क्वेरीज़ को गतिशील रूप से उत्पन्न करके प्रायोजित खोज (sponsored search) को अनुकूलित करता है, जिसके परिणामस्वरूप वॉलमार्ट के प्लेटफॉर्म पर फिल रेट में 68% की वृद्धि और राजस्व एवं उपयोगकर्ता अनुभव में सुधार हुआ है।

Md Omar Faruk Rokon, Weizhi Du, Zhaodong Wang, Musen Wen2026-07-07
🤖 AI

Enhancement of E-commerce Sponsored Search Relevancy with LLM

यह शोध पत्र एक नवीन ई-कॉमर्स प्रायोजित खोज प्रासंगिकता मॉडल प्रस्तुत करता है जो विज्ञापन-क्वेरी प्रासंगिकता को वर्गीकृत करने में 89.43% सटीकता प्राप्त करने के लिए लो-रैंक अडैप्टेशन (LoRA) का उपयोग करके LLAMA2 7B भाषा मॉडल को फाइन-ट्यून करता है, जो परिचालन दक्षता और गोपनीयता को बढ़ाते हुए बेसलाइन और GPT-4 मॉडलों से बेहतर प्रदर्शन करता है।

Md Omar Faruk Rokon, Andrei Simion, Weizhi Du, Musen Wen, Hong Yao, Kuang-chih Lee2026-07-07
⚡ electrical engineering

TokAN: Accent Normalization Using Self-Supervised Speech Tokens

TokAN एक स्व-पर्यवेक्षित (self-supervised), टोकन-आधारित लहजा सामान्यीकरण ढांचा है जो एक ऑटोरेग्रेसिव एनकोडर-डिकोडर और सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके गैर-नेटिव भाषण को मानक लहजों में परिवर्तित करता है, जो समानांतर प्रशिक्षण डेटा या सिंथेटिक लक्ष्यों की आवश्यकता के बिना बेहतर बोधगम्यता और लहजा कमी प्राप्त करता है।

Qibing Bai, Shuai Wang, Yuhan Du, Bohan Li, Yannan Wang, Haizhou Li2026-07-07
🔢 mathematics

Online Linear Programming for Multi-Objective Routing in LLM Serving

यह शोध पत्र LLM सर्विंग में मल्टी-ऑब्जेक्टिव रूटिंग को अनुकूलित करने के लिए बिड-प्राइस कंट्रोल और वॉर्म-स्टार्टेड ड्यूल अपडेट्स के साथ एक विज्ञान-आधारित ऑनलाइन लीनियर प्रोग्रामिंग फ्रेमवर्क प्रस्तावित करता है, जो पारंपरिक ह्यूरिस्टिक दृष्टिकोणों की तुलना में बेहतर लेटेंसी और थ्रूपुट प्रदर्शन प्रदर्शित करता है।

Zixi Chen, Yinyu Ye, Zijie Zhou2026-07-07
⚡ electrical engineering

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

यह शोध पत्र अनसुपरवाइज्ड शब्दांश टोकेनाइजेशन (syllabic tokenization) के लिए एक स्पीकर-डिसेन्टैंगल्ड चंक-वाइज़ रिग्रेशन विधि प्रस्तावित करता है जो HuBERT-आधारित डिस्टिलेशन में स्पीकर आइडेंटिटी लीकेज पर विजय प्राप्त करता है, जिससे स्टेट-ऑफ-द-आर्ट शब्दांश डिटेक्शन प्राप्त होता है और डाउनस्ट्रीम स्पीच लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki2026-07-07