💬 NLP

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

यह शोध पत्र इंटरप्रेस-पैरेलल-कॉर्पस (Interpres-Parallel-Corpus) डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि मध्यकालीन लैटिन पांडुलिपियों के अनुवाद के लिए, एक विशेष ओसीआर (OCR) को विजन लैंग्वेज मॉडल (Vision Language Model) के साथ संयोजित करने वाला एक सरल पाइपलाइन, त्रुटि प्रसार (error propagation) और प्रॉम्प्ट संतृप्ति (prompt saturation) से बचकर अधिक जटिल बहु-घटक दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz, Mufti Mahmud2026-07-07
💬 NLP

Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth

यह शोध पत्र SALT प्रस्तुत करता है, जो दीर्घ-रूप (long-form) LLM जनरेशन के मूल्यांकन के लिए नियत ग्राउंड ट्रुथ्स (deterministic ground truths) वाला एक बेंचमार्क है, जो यह प्रकट करता है कि जहाँ तर्क (reasoning) सटीकता में सुधार करता है, वहीं यह आत्मविश्वास रैंकिंग (confidence ranking) को कम करता है, और त्रुटि प्रसार (error propagation) भ्रष्ट प्रीफिक्स (corrupted prefixes) और बढ़ते उत्तर-संदर्भ लंबाई (answer-context length) दोनों से प्रेरित होता है।

Ido Amit, Ido Galil, Ran El-Yaniv2026-07-07
🤖 AI

Next-Gen Sponsored Search: Crafting the Perfect Query with Inventory-Aware RAG (InvAwr-RAG) Based GenAI

यह शोध पत्र InvAwr-RAG को प्रस्तुत करता है, जो एक इन्वेंटरी-अवेयर (Inventory-Aware) RAG-आधारित जनरेटिव एआई मॉडल है जो वास्तविक समय की विज्ञापन इन्वेंटरी के अनुरूप प्रासंगिक क्वेरीज़ को गतिशील रूप से उत्पन्न करके प्रायोजित खोज (sponsored search) को अनुकूलित करता है, जिसके परिणामस्वरूप वॉलमार्ट के प्लेटफॉर्म पर फिल रेट में 68% की वृद्धि और राजस्व एवं उपयोगकर्ता अनुभव में सुधार हुआ है।

Md Omar Faruk Rokon, Weizhi Du, Zhaodong Wang, Musen Wen2026-07-07
🤖 AI

Enhancement of E-commerce Sponsored Search Relevancy with LLM

यह शोध पत्र एक नवीन ई-कॉमर्स प्रायोजित खोज प्रासंगिकता मॉडल प्रस्तुत करता है जो विज्ञापन-क्वेरी प्रासंगिकता को वर्गीकृत करने में 89.43% सटीकता प्राप्त करने के लिए लो-रैंक अडैप्टेशन (LoRA) का उपयोग करके LLAMA2 7B भाषा मॉडल को फाइन-ट्यून करता है, जो परिचालन दक्षता और गोपनीयता को बढ़ाते हुए बेसलाइन और GPT-4 मॉडलों से बेहतर प्रदर्शन करता है।

Md Omar Faruk Rokon, Andrei Simion, Weizhi Du, Musen Wen, Hong Yao, Kuang-chih Lee2026-07-07
⚡ electrical engineering

TokAN: Accent Normalization Using Self-Supervised Speech Tokens

TokAN एक स्व-पर्यवेक्षित (self-supervised), टोकन-आधारित लहजा सामान्यीकरण ढांचा है जो एक ऑटोरेग्रेसिव एनकोडर-डिकोडर और सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके गैर-नेटिव भाषण को मानक लहजों में परिवर्तित करता है, जो समानांतर प्रशिक्षण डेटा या सिंथेटिक लक्ष्यों की आवश्यकता के बिना बेहतर बोधगम्यता और लहजा कमी प्राप्त करता है।

Qibing Bai, Shuai Wang, Yuhan Du, Bohan Li, Yannan Wang, Haizhou Li2026-07-07
🔢 mathematics

Online Linear Programming for Multi-Objective Routing in LLM Serving

यह शोध पत्र LLM सर्विंग में मल्टी-ऑब्जेक्टिव रूटिंग को अनुकूलित करने के लिए बिड-प्राइस कंट्रोल और वॉर्म-स्टार्टेड ड्यूल अपडेट्स के साथ एक विज्ञान-आधारित ऑनलाइन लीनियर प्रोग्रामिंग फ्रेमवर्क प्रस्तावित करता है, जो पारंपरिक ह्यूरिस्टिक दृष्टिकोणों की तुलना में बेहतर लेटेंसी और थ्रूपुट प्रदर्शन प्रदर्शित करता है।

Zixi Chen, Yinyu Ye, Zijie Zhou2026-07-07
⚡ electrical engineering

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

यह शोध पत्र अनसुपरवाइज्ड शब्दांश टोकेनाइजेशन (syllabic tokenization) के लिए एक स्पीकर-डिसेन्टैंगल्ड चंक-वाइज़ रिग्रेशन विधि प्रस्तावित करता है जो HuBERT-आधारित डिस्टिलेशन में स्पीकर आइडेंटिटी लीकेज पर विजय प्राप्त करता है, जिससे स्टेट-ऑफ-द-आर्ट शब्दांश डिटेक्शन प्राप्त होता है और डाउनस्ट्रीम स्पीच लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki2026-07-07
📊 statistics

Fixed-Confidence Best-Arm Identification for Causal Mediation Analysis

यह शोध पत्र कॉज़ल मीडिएशन एनालिसिस (causal mediation analysis) में अपेक्षित नेचुरल डायरेक्ट पोटेंशियल आउटकम (expected natural direct potential outcome) को अधिकतम करने वाले ट्रीटमेंट की कुशलतापूर्वक पहचान करने के लिए 'ट्रैक-एंड-स्टॉप' (Track-and-Stop) फ्रेमवर्क पर आधारित एक फिक्स्ड-कॉन्फिडेंस बेस्ट-आर्म आइडेंटिफिकेशन एल्गोरिदम प्रस्तावित करता है, जो एसिम्प्टोटिक ऑप्टिमलिटी (asymptotic optimality) प्राप्त करता है और एक बड़े पैमाने के वास्तविक विज्ञापन डेटासेट पर मान्य किया गया है।

Harsh Shrivastava, Yuta Kawakami, Junpei Komiyama, Jin Tian2026-07-07
🔢 mathematics

Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning

यह शोध पत्र यह पहचान करता है कि सहकारी मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) में LLM-जनित रिवॉर्ड वेट्स को गतिशील रूप से अपडेट करना स्टेशनैरिटी मान्यताओं का उल्लंघन करता है और प्रशिक्षण को अस्थिर करता है, तथा तीन अलग-अलग श्रेणियों में, जो बेसलाइन एजेंट की सक्षमता द्वारा परिभाषित हैं, प्रदर्शन को प्रभावी ढंग से स्थिर करने के लिए फेज-बेस्ड फ्रीज (Phase-Based Freeze) और EMA स्मूथिंग रणनीतियों का प्रस्ताव करता है।

Faid Keddouri, Sohaib Houhou, Aissa Boulmerka, Nadir Farhi2026-07-07
🔢 mathematics

Two Black Boxes, One Solver: Encoder Probing and Decoder Attribution for Neural Multi-Attribute VRP under Hard-Mask and Recourse Decoders

यह शोध पत्र एनकोडर प्रोबिंग और डिकोडर एट्रिब्यूशन तकनीकों को संयोजित करके न्यूरल मल्टी-एट्रीब्यूट व्हीकल रूटिंग प्रॉब्लम सॉल्वर्स की व्याख्या करने के लिए एक एकीकृत प्रोटोकॉल प्रस्तुत करता है, जो यह प्रकट करता है कि ग्राफ इंडक्टिव बायस और रिसोर्स ट्रेनिंग रिजीम्स, बाधाओं की प्रतिनिधिक स्पष्टता और अव्यवहार्य निर्णयों के लिए कार्रवाई योग्य, काउंटरफैक्चुअल स्पष्टीकरणों के निर्माण, दोनों को महत्वपूर्ण रूप से बढ़ाते हैं।

Sohaib Afifi2026-07-07