💻 computer science

AI to Learn 2.0: A Deliverable-Oriented Governance Framework and Maturity Rubric for Opaque AI in Learning-Intensive Domains

यह शोध पत्र "AI टू लर्न 2.0" (AI to Learn 2.0) का प्रस्ताव करता है, जो एक डिलिवरेबल-उन्मुख शासन ढांचा और परिपक्वता रूब्रिक है, जिसे सीखने-गहन क्षेत्रों में जनरेटिव एआई की "प्रॉक्सी विफलता" (proxy failure) को संबोधित करने के लिए डिज़ाइन किया गया है, ताकि यह सुनिश्चित किया जा सके कि अंतिम आउटपुट मूल एआई मॉडलों पर निर्भर हुए बिना उपयोगी, ऑडिट योग्य और न्यायसंगत बना रहे, जिससे मानवीय क्षमता और जवाबदेही सुरक्षित रहे।

Seine A. Shintani2026-04-23
💻 computer science

Soft-Label Governance for Distributional Safety in Multi-Agent Systems

यह शोध पत्र SWARM को प्रस्तुत करता है, जो एक ऐसा सिमुलेशन फ्रेमवर्क है जो बाइनरी सुरक्षा वर्गीकरणों को सॉफ्ट प्रोबेबिलिस्टिक लेबल से बदल देता है ताकि यह प्रकट किया जा सके कि मल्टी-एजेंट सिस्टम में सख्त शासन अक्सर सुरक्षा में सुधार किए बिना कल्याण को नाटकीय रूप से कम कर देता है, जिससे सुरक्षा और सिस्टम वैल्यू के बीच संतुलन बनाने के लिए निरंतर जोखिम मेट्रिक्स और कैलिब्रेटेड गवर्नेंस लीवर्स की महत्वपूर्ण आवश्यकता सिद्ध होती है।

Aizierjiang Aiersilan, Raeli Savitt2026-04-23
💻 computer science

Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks

यह शोध पत्र एक व्याख्यात्मक एंटी-मनी लॉन्ड्रिंग (AML) ट्राइएज फ्रेमवर्क प्रस्तावित करता है जो निर्णय ऑडिटेबिलिटी में सुधार करने, मतिभ्रम (hallucinations) को कम करने और सख्त नियामक अनुपालन बनाए रखते हुए बेहतर प्रदर्शन प्राप्त करने के लिए रिट्रीवल-ऑगमेंटेड एविडेंस बंडलिंग, स्ट्रक्चर्ड साइटेशन-कंस्ट्रेंड एलएलएम (LLM) आउटपुट और काउंटरफैक्चुअल वैलिडेशन को एकीकृत करता है।

Dorothy Torres, Wei Cheng, Ke Hu2026-04-23
🤖 machine learning

WorkflowGen:an adaptive workflow generation mechanism driven by trajectory experience

WorkflowGen एक अनुकूलन योग्य ढांचा है जो एक क्लोज्ड-लूप तंत्र और तीन-स्तरीय रूटिंग रणनीति के माध्यम से प्रक्षेपवक्र अनुभव (trajectory experience) का लाभ उठाकर वर्कफ़्लो को गतिशील रूप से उत्पन्न और अनुकूलित करता है, जो बड़े एनोटेटेड डेटासेट की आवश्यकता के बिना जटिल LLM एजेंट कार्यों के लिए टोकन की खपत को काफी कम करता है और सफलता दर में सुधार करता है।

Ruocan Wei, Shufeng Wang, Ziwei Shi2026-04-23
🤖 machine learning

Transparent Screening for LLM Inference and Training Impacts

यह शोध पत्र एक पारदर्शी, ऑडिट योग्य ढांचे को प्रस्तुत करता है जो प्राकृतिक-भाषा अनुप्रयोग विवरणों को सीमित पर्यावरणीय अनुमानों में परिवर्तित करता है ताकि बड़े भाषा मॉडलों के इन्फरेंस और प्रशिक्षण प्रभावों का तुलनात्मक विश्लेषण सक्षम किया जा सके, विशेष रूप से उन अपारदर्शी मालिकाना सेवाओं के लिए जहाँ प्रत्यक्ष माप उपलब्ध नहीं है।

Arnault Pachot, Thierry Petit2026-04-23
💻 computer science

ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models

यह शोध पत्र ThermoQA को प्रस्तुत करता है, जो CoolProp 7.2.0 ग्राउंड ट्रुथ के विरुद्ध मूल्यांकित 293 ऊष्मागतिकी (thermodynamics) समस्याओं का एक तीन-स्तरीय ओपन-सोर्स बेंचमार्क है, जो यह प्रकट करता है कि जबकि फ्रंटियर LLMs उच्च सटीकता प्राप्त करते हैं, उनकी तर्क करने की क्षमता कार्य की जटिलता के साथ काफी कम हो जाती है और रन के दौरान उल्लेखनीय परिवर्तनशीलता प्रदर्शित करती है।

Kemal Düzkar2026-04-23
💬 NLP

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में पहचाने गए "हैलुसिनेशन न्यूरॉन्स" विभिन्न ज्ञान डोमेन में सामान्यीकृत नहीं होते हैं, जो यह प्रकट करता है कि हैलुसिनेशन तंत्र सार्वभौमिक होने के बजाय डोमेन-विशिष्ट हैं और डोमेन-कैलिब्रेटेड डिटेक्टरों की आवश्यकता को अनिवार्य बनाते हैं।

Snehit Vaddi, Pujith Vaddi2026-04-23
🤖 machine learning

Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि PayPal के कॉमर्स एजेंट पर एक फाइन-ट्यून्ड नेमेट्रॉन (Nemotron) मॉडल के साथ EAGLE3 स्पेकुलेटिव डिकोडिंग को लागू करने से आउटपुट गुणवत्ता बनाए रखते हुए थ्रूपुट और लेटेंसी में महत्वपूर्ण सुधार प्राप्त होता है, जो अंततः मानक NVIDIA NIM डिप्लॉयमेंट की तुलना में GPU लागत में 50% की कमी सक्षम करता है।

Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan2026-04-23
💬 NLP

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models

PR-CAD एक प्रगतिशील परिशोधन ढांचे (progressive refinement framework) को पेश करता है जो एक उच्च-निष्ठा वाले इंटरेक्शन डेटासेट और सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाकर टेक्स्ट-टू-सीएडी (text-to-CAD) जनरेशन और संपादन को एक एकल, नियंत्रणीय एजेंट में एकीकृत करता है ताकि सीएडी मॉडलिंग में अत्याधुनिक निष्ठा और दक्षता प्राप्त की जा सके।

Jiyuan An, Jiachen Zhao, Fan Chen, Liner Yang, Zhenghao Liu, Hongyan Wang, Weihua An, Meishan Zhang, Erhong Yang2026-04-23
💻 computer science

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

यह शोध पत्र एक कॉन्फॉर्मल इंटरप्रिटेबिलिटी फ्रेमवर्क पेश करता है जो स्टेप-वाइज रिवॉर्ड मॉडलिंग को कॉन्फॉर्मल प्रेडिक्शन के साथ जोड़ता है ताकि एलएलएम (LLM) एजेंटों के भीतर रैखिक रूप से विभाज्य टेम्पोरल कॉन्सेप्ट्स की पहचान और नियंत्रण किया जा सके, जिससे जटिल संवादात्मक वातावरण में प्रारंभिक विफलता का पता लगाना और प्रदर्शन में सुधार करना सक्षम हो सके।

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. (…)2026-04-23