💻 computer science

STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

STELLAR-E एक पूर्णतः स्वचालित, दो-चरणीय ढांचा है जो LLM अनुप्रयोग मूल्यांकन के लिए उच्च-गुणवत्ता वाले, अनुकूलन योग्य सिंथेटिक डेटासेट उत्पन्न करता है, जो मौजूदा बेंचमार्क के समान मूल्यांकन गुणवत्ता प्राप्त करते हुए मैनुअल डेटा संग्रह का एक स्केलेबल और कुशल विकल्प प्रदान करता है।

Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky2026-04-28
💻 computer science

FastOMOP: A Foundational Architecture for Reliable Agentic Real-World Evidence Generation on OMOP CDM data

FastOMOP एक ओपन-सोर्स, मल्टी-एजेंट आर्किटेक्चर है जो नियतात्मक गवर्नेंस (deterministic governance), ऑब्जर्वेबिलिटी और ऑर्केस्ट्रेशन लेयर्स को प्लगेबल एजेंट टीमों से अलग करके, OMOP CDM डेटा से सुरक्षित, लचीला और ऑडिट करने योग्य रियल-वर्ल्ड एविडेंस सुनिश्चित करता है, जिससे अंतर्निहित लैंग्वेज मॉडल्स से स्वतंत्र होकर उच्च विश्वसनीयता और पूर्ण सुरक्षा ब्लॉक दर प्राप्त की जा सकती है।

Niko Moeller-Grell, Shihao Shenzhang, Zhangshu Joshua Jiang, Richard JB Dobson, Vishnu V Chandrabalan2026-04-28
🔭 astrophysics

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

यह शोध पत्र AstroVLBench प्रस्तुत करता है, जो एक व्यापक बहु-मोडल बेंचमार्क है जो खगोलीय तर्क कार्यों पर अत्याधुनिक विजन-लैंग्वेज मॉडलों का मूल्यांकन करता है, और यह प्रकट करता है कि हालांकि ये मॉडल आशाजनक दिखते हैं, वे विशेष विधियों की तुलना में काफी कम प्रदर्शन करते हैं और विश्वसनीय वैज्ञानिक सटीकता प्राप्त करने के लिए स्पष्ट भौतिक आधार और संख्यात्मक डेटा की आवश्यकता होती है।

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang2026-04-28
🔢 mathematics

NeSyCat: A Monad-Based Categorical Semantics of the Neurosymbolic ULLER Framework

यह शोध पत्र **NeSyCat** का प्रस्ताव करता है, जो एक श्रेणीबद्ध ढांचा (categorical framework) है जो ULLER न्यूरोसिम्बोलिक भाषा के विजातीय शास्त्रीय, फजी और संभाव्य अर्थों (semantics) को एक एकल मॉड्यूलर प्रणाली में एकीकृत करने के लिए मोनाड्स (monads) का उपयोग करता है, जो विभिन्न अर्थ संबंधी मॉडलों के बीच आसान विस्तार और अनुवाद की अनुमति देता है।

Daniel Romero Schellhorn, Till Mossakowski2026-04-28
💻 computer science

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

CF-VLA एक कोर्स-टू-फाइन (coarse-to-fine) दो-चरणीय ढांचे को पेश करता है जो गैर-सूचनात्मक गाऊसी शोर (uninformative Gaussian noise) को एक संरचित एक्शन इनिशियलाइजेशन में और उसके बाद सिंगल-स्टेप रिफाइनमेंट में परिवर्तित करता है, जो फ्लो-आधारित विजन-लैंग्वेज-एक्शन पॉलिसियों के दक्षता-प्रदर्शन ट्रेड-ऑफ में महत्वपूर्ण सुधार करता है और काफी कम सैंपलिंग लेटेंसी के साथ स्टेट-ऑफ-द-आर्ट रियल-रोबोट सफलता दर प्राप्त करता है।

Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He2026-04-28
🤖 machine learning

XGRAG: A Graph-Native Framework for Explaining KG-based Retrieval-Augmented Generation

XGRAG एक नवीन ढांचा है जो ग्राफ-आधारित विक्षोभ रणनीतियों (graph-based perturbation strategies) का उपयोग करके ग्राफ-आधारित रिट्रीवल-ऑगमेंटेड जनरेशन (GraphRAG) की पारदर्शिता और विश्वसनीयता को बढ़ाता है, जिससे ऐसे कारण-आधारित स्पष्टीकरण उत्पन्न होते हैं जो मॉडल के अंतिम उत्तर में विशिष्ट नॉलेज ग्राफ घटकों के योगदान को परिमाणित करते हैं।

Zhuoling Li, Ha Linh Hong Tran Nguyen, Valeria Bladinieres, Maxim Romanovsky2026-04-28
💻 computer science

Less Is More: Engineering Challenges of On-Device Small Language Model Integration in a Mobile Application

यह शोध पत्र एक प्रोडक्शन एंड्रॉइड ऐप में ऑन-डिवाइस स्मॉल लैंग्वेज मॉडल्स को एकीकृत करने के एक अनुदैर्ध्य केस स्टडी (longitudinal case study) को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि यह व्यवहार्य है, सफल एकीकरण के लिए एक व्यावहारिक वास्तुशिल्प परिवर्तन की आवश्यकता होती है जहाँ LLM की जिम्मेदारियों को न्यूनतम किया जाता है और आउटपुट उल्लंघन और लेटेंसी जैसी विशिष्ट इंजीनियरिंग चुनौतियों से निपटने के लिए मजबूत रक्षात्मक रणनीतियों को नियोजित किया जाता है।

William Oliveira2026-04-28
💻 computer science

DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference

DepthKV एक नवीन लेयर-डिपेंडेंट KV कैश प्रूनिंग फ्रेमवर्क है जो परतों की व्यक्तिगत प्रूनिंग संवेदनशीलता के आधार पर एक निश्चित वैश्विक मेमोरी बजट को गतिशील रूप से आवंटित करके लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को अनुकूलित करता है, जिससे यह पारंपरिक यूनिफॉर्म प्रूनिंग विधियों से बेहतर प्रदर्शन करता है।

Zahra Dehghanighobadi, Asja Fischer2026-04-28
🔬 physics

Information bottleneck for learning the phase space of dynamics from high-dimensional experimental data

यह शोधपत्र DySIB (डायनामिकल सिमेट्रिक इंफॉर्मेशन बॉटलनेक) प्रस्तुत करता है, जो एक ऐसी विधि है जो अवलोकन पुनर्निर्माण (observation reconstruction) की आवश्यकता के बिना, एक लेटेंट स्पेस में भविष्य कहनेवाला पारस्परिक सूचना (predictive mutual information) को अधिकतम करके उच्च-आयामी प्रयोगात्मक डेटा से व्याख्या योग्य, निम्न-आयामी गतिशील अवस्था चर (dynamical state variables) को पुनर्प्राप्त करती है।

K. Michael Martini, Eslam Abdelaleem, Paarth Gulati, Ilya Nemenman2026-04-28
🤖 machine learning

The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications

यह शोधपत्र एजेंटिक वित्तीय एलएलएम (LLM) अनुप्रयोगों में चापलूसी (sycophancy) की जांच करता है, यह पाते हुए कि जहाँ मॉडल प्रत्यक्ष उपयोगकर्ता विरोधाभासों के प्रति अप्रत्याशित लचीलापन दिखाते हैं, वहीं वे अक्सर तब विफल हो जाते हैं जब उन्हें ऐसी उपयोगकर्ता प्राथमिकताएं प्रस्तुत की जाती हैं जो सही उत्तरों के साथ संघर्ष करती हैं, और इसके बाद यह इनपुट फ़िल्टरिंग जैसे रिकवरी तरीकों का बेंचमार्क करता है।

Zhenyu Zhao, Aparna Balagopalan, Adi Agrawal, Dilshoda Yergasheva, Waseem Alshikh, Daniel M. Bikel2026-04-28