🤖 machine learning

ParetoBandit: Budget-Paced Adaptive Routing for Non-Stationary LLM Serving

ParetoBandit एक ओपन-सोर्स, अडैप्टिव रूटिंग सिस्टम है जो नॉन-स्टेशनरी LLM सर्विंग के लिए डिज़ाइन किया गया है, जो डॉलर-निर्धारित बजट को गतिशील रूप से लागू करने के लिए ऑनलाइन प्रिमल-डुअल पेसिंग और ज्योमेट्रिक फॉरगेटिंग के साथ कॉस्ट-अवेयर कॉन्टेक्स्टुअल बैंडिट्स का उपयोग करता है, ताकि मॉडल की कीमत और गुणवत्ता में बदलाव या रनटाइम पर नए मॉडल्स को न्यूनतम लेटेंसी के साथ तेजी से अनुकूलित किया जा सके।

Annette Taberner-Miller2026-04-02
🤖 AI

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX एक सुदृढीकरण लर्निंग (reinforcement learning) पर आधारित स्वचालित सहकर्मी समीक्षा प्रणाली है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन और पत्राचार-जागरूक रिवॉर्ड फंक्शनों का लाभ उठाकर चित्रों और बाहरी संकेतों जैसे सहायक संदर्भों को एकीकृत करती है, जिससे कई वैज्ञानिक विषयों में बड़े वाणिज्यिक मॉडलों और अन्य बेसलाइन दोनों की तुलना में बेहतर समीक्षा गुणवत्ता और प्रासंगिक आधार प्राप्त होता है।

Pawin Taechoyotin, Daniel E. Acuna2026-04-02
📊 statistics

Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning

एजेंट Q-Mix एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो QMIX वैल्यू फैक्टराइजेशन के माध्यम से विकेंद्रीकृत संचार टोपोलॉजी सीखकर मल्टी-एजेंट समन्वय को अनुकूलित करता है, और मौजूदा तरीकों की तुलना में विविध रीजनिंग और कोडिंग बेंचमार्क में बेहतर सटीकता, टोकन दक्षता और मजबूती प्राप्त करता है।

Eric Hanchen Jiang, Levina Li, Rui Sun, Xiao Liang, Yubei Li, Yuchen Wu, Haozheng Luo, Hengli Li, Zhi Zhang, Zhaolu Kang (…)2026-04-02
🤖 AI

Polysemanticity or Polysemy? Lexical Identity Confounds Superposition Metrics

यह शोध पत्र यह प्रदर्शित करता है कि भाषा मॉडलों में स्पष्ट न्यूरल सुपरपोजिशन (neural superposition) का एक महत्वपूर्ण हिस्सा वास्तव में एक लेक्सिकल कन्फाउंड (lexical confound) के कारण होता है जहाँ न्यूरॉन्स असंबंधित अवधारणाओं के संपीड़न के बजाय "bank" जैसे साझा शब्द रूपों के लिए सक्रिय होते हैं, एक ऐसा निष्कर्ष है जो, सुधार किए जाने पर, शब्द अर्थ विसंकेतन (word sense disambiguation) और ज्ञान संपादन की चयनात्मकता में सुधार करता है।

Iyad Ait Hou, Rebecca Hwa2026-04-02
🤖 AI

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

यह शोध पत्र फर्स्ट लॉजिट बूस्टिंग (FLB) का प्रस्ताव करता है, जो एक सरल, प्रशिक्षण-मुक्त तकनीक है जो दीर्घकालिक क्षय (long-term decay) का मुकाबला करने के लिए पीढ़ी के दौरान प्रारंभिक दृश्य जानकारी को सुरक्षित रखकर लार्ज विजन-लैंग्वेज मॉडल्स में ऑब्जेक्ट हेलुसिनेशन (वस्तु मतिभ्रम) को कम करती है, और यह सब नगण्य इन्फरेंस ओवरहेड के साथ किया जाता है।

Jiwoo Ha, Jongwoo Baek, Jinhyun So2026-04-02
🤖 AI

Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation

ऑप्टिमाइज़सिन (Optimsyn) एक अनुकूलन-आधारित ढांचा है जो सिंथेटिक डेटा की प्रशिक्षण उपयोगिता को मापने के लिए प्रभाव अनुमान (influence estimation) का लाभ उठाता है, जिससे विविध ज्ञान-गहन डोमेन में कार्य-विशिष्ट ट्यूनिंग की आवश्यकता के बिना डाउनस्ट्रीम मॉडल प्रदर्शन को सुधारने के लिए जनरेशन रूब्रिक्स के सुदृढीकरण शिक्षण (reinforcement learning) आधारित अनुकूलन को निर्देशित किया जा सके।

Zhiting Fan, Ruizhe Chen, Tianxiang Hu, Ru Peng, Zenan Huang, Haokai Xu, Yixin Chen, Jian Wu, Junbo Zhao, Zuozhu Liu2026-04-02
🤖 AI

Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems: A Neurosymbolic Architecture for Domain-Grounded AI Agents

यह शोध पत्र फाउंडेशन एजेंटिकओएस (Foundation AgenticOS) प्लेटफॉर्म के भीतर एक न्यूरोसिम्बोलिक आर्किटेक्चर प्रस्तुत करता है जो बड़े भाषा मॉडल (LLM) एजेंटों को नियंत्रित करने के लिए एक त्रि-स्तरीय ऑन्टोलॉजिकल ढांचे का उपयोग करता है, जो इनपुट और आउटपुट दोनों पर औपचारिक सिमेंटिक ग्राउंडिंग को लागू करके उनकी सटीकता, नियामक अनुपालन और भूमिका निरंतरता में महत्वपूर्ण सुधार करता है—विशेष रूप से सीमित प्रशिक्षण डेटा वाले डोमेन में।

Thanh Luong Tuan2026-04-02
📊 statistics

Common TF-IDF variants arise as key components in the test statistic of a penalized likelihood-ratio test for word burstiness

यह शोध पत्र प्रदर्शित करता है कि TF-IDF जैसे टर्म-वेटिंग स्कोर स्वाभाविक रूप से शब्द की बर्स्टिनेस (burstiness) का पता लगाने के लिए डिज़ाइन किए गए एक दंडित लाइक्लीहुड-अनुपात परीक्षण (penalized likelihood-ratio test) के टेस्ट स्टैटिस्टिक से उभरते हैं, जो शास्त्रीय सूत्र के लिए एक सांख्यिकीय आधार प्रदान करता है और दस्तावेज़ वर्गीकरण कार्यों में इसके तुलनीय प्रदर्शन को दर्शाता है।

Zeyad Ahmed, Paul Sheridan, Michael McIsaac, Aitazaz A. Farooque2026-04-02
⚡ electrical engineering

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

OmniVoice एक अत्याधुनिक, विशाल बहुभाषी ज़ीरो-शॉट टेक्स्ट-टू-स्पीच मॉडल है जो एक नवीन डिफ्यूजन लैंग्वेज मॉडल-शैली के डिस्क्रीट नॉन-ऑटोरिग्रेसिव आर्किटेक्चर का उपयोग करके 60 टेक्स्ट से अधिक भाषाओं तक स्केल करता है ताकि सीधे टेक्स्ट को ध्वनिक टोकन (acoustic tokens) में मैप किया जा सके, जिससे एक पूर्ण-कोडबुक रैंडम मास्किंग रणनीति और प्री-ट्रेन्ड एलएलएम (LLM) इनिशियलाइज़ेशन के माध्यम से उत्कृष्ट स्पष्टता और व्यापक भाषा कवरेज प्राप्त होता है।

Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Pove (…)2026-04-02
🤖 AI

To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining

यह शोधपत्र विभिन्न मॉडल पैमानों (scales) में प्रीट्रेनिंग डेटा और रिट्रीवल कॉर्पस के आकार के बीच के ट्रेड-ऑफ की जांच करता है, जो ज्ञान-गहन कार्यों में भाषा मॉडल के प्रदर्शन को अधिकतम करने के लिए इष्टतम डेटा बजट आवंटन निर्धारित करने हेतु एक त्रि-आयामी स्केलिंग ढांचे का प्रस्ताव करता है।

Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng2026-04-02