🤖 AI

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

यह शोध पत्र CircuChain पेश करता है, जो इलेक्ट्रिकल सर्किट विश्लेषण के लिए एक नैदानिक बेंचमार्क है जो एक "अनुपालन-क्षमता विचलन" (Compliance-Competence Divergence) को प्रकट करता है जहाँ उन्नत LLMs अक्सर स्पष्ट उपयोगकर्ता बाधाओं के बजाय प्राकृतिक प्रशिक्षण पूर्वग्रहों (training priors) को प्राथमिकता देते हैं, यह प्रदर्शित करते हुए कि बढ़ी हुई मॉडल क्षमता गणितीय रूप से कठोर डोमेन में बेहतर निर्देश पालन की गारंटी नहीं देती है।

Mayank Ravishankara2026-04-23
💬 NLP

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

यह शोधपत्र CAST को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एल्गोरिद्मिक प्रॉम्प्टिंग और स्पष्ट मध्यवर्ती तर्क का उपयोग करके सारांश और टैगिंग जैसे टेक्स्ट विश्लेषण कार्यों में लार्ज लैंग्वेज मॉडल्स के आउटपुट की स्थिरता को बढ़ाता है, जिससे गुणवत्ता से समझौता किए बिना स्थिरता में महत्वपूर्ण सुधार प्राप्त होता है।

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang2026-04-23
💻 computer science

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

यह शोध पत्र "ज्ञान संबंधी ज्ञानमीमांसीय भ्रम" (knowledge epistemic illusion) और केवल परिणाम-आधारित पुरस्कार संरचनाओं के कारण एलएलएम (LLMs) में एक व्यापक समस्या के रूप में "टूल के अत्यधिक उपयोग" (tool overuse) की पहचान करता है, और अनावश्यक टूल कॉल्स को काफी कम करने के साथ-साथ सटीकता को सुधारने या बनाए रखने के लिए ज्ञान-जागरूक संरेखण (knowledge-aware alignment) और संतुलित पुरस्कार संकेतों का प्रस्ताव करता है।

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Ca (…)2026-04-23
💻 computer science

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging

यह शोध पत्र GUI इंटरैक्शन और विज़ुअल स्ट्रक्चर के मूल्यांकन के लिए एक नया बेंचमार्क, InteractGUI Bench पेश करता है, और VF-Coder का प्रस्ताव देता है, जो एक विज़न-फीडबैक-आधारित मल्टी-एजेंट सिस्टम है जो मानव जैसी विज़ुअल धारणा और इंटरैक्शन का अनुकरण करके GUI कोड जनरेशन और डिबगिंग सफलता दर में महत्वपूर्ण सुधार करता है।

Zhilin Liu, Ye Huang, Ting Xie, Ruizhi Zhang, Wen Li, Lixin Duan2026-04-23
💻 computer science

AI to Learn 2.0: A Deliverable-Oriented Governance Framework and Maturity Rubric for Opaque AI in Learning-Intensive Domains

यह शोध पत्र "AI टू लर्न 2.0" (AI to Learn 2.0) का प्रस्ताव करता है, जो एक डिलिवरेबल-उन्मुख शासन ढांचा और परिपक्वता रूब्रिक है, जिसे सीखने-गहन क्षेत्रों में जनरेटिव एआई की "प्रॉक्सी विफलता" (proxy failure) को संबोधित करने के लिए डिज़ाइन किया गया है, ताकि यह सुनिश्चित किया जा सके कि अंतिम आउटपुट मूल एआई मॉडलों पर निर्भर हुए बिना उपयोगी, ऑडिट योग्य और न्यायसंगत बना रहे, जिससे मानवीय क्षमता और जवाबदेही सुरक्षित रहे।

Seine A. Shintani2026-04-23
💻 computer science

Soft-Label Governance for Distributional Safety in Multi-Agent Systems

यह शोध पत्र SWARM को प्रस्तुत करता है, जो एक ऐसा सिमुलेशन फ्रेमवर्क है जो बाइनरी सुरक्षा वर्गीकरणों को सॉफ्ट प्रोबेबिलिस्टिक लेबल से बदल देता है ताकि यह प्रकट किया जा सके कि मल्टी-एजेंट सिस्टम में सख्त शासन अक्सर सुरक्षा में सुधार किए बिना कल्याण को नाटकीय रूप से कम कर देता है, जिससे सुरक्षा और सिस्टम वैल्यू के बीच संतुलन बनाने के लिए निरंतर जोखिम मेट्रिक्स और कैलिब्रेटेड गवर्नेंस लीवर्स की महत्वपूर्ण आवश्यकता सिद्ध होती है।

Aizierjiang Aiersilan, Raeli Savitt2026-04-23
💻 computer science

Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks

यह शोध पत्र एक व्याख्यात्मक एंटी-मनी लॉन्ड्रिंग (AML) ट्राइएज फ्रेमवर्क प्रस्तावित करता है जो निर्णय ऑडिटेबिलिटी में सुधार करने, मतिभ्रम (hallucinations) को कम करने और सख्त नियामक अनुपालन बनाए रखते हुए बेहतर प्रदर्शन प्राप्त करने के लिए रिट्रीवल-ऑगमेंटेड एविडेंस बंडलिंग, स्ट्रक्चर्ड साइटेशन-कंस्ट्रेंड एलएलएम (LLM) आउटपुट और काउंटरफैक्चुअल वैलिडेशन को एकीकृत करता है।

Dorothy Torres, Wei Cheng, Ke Hu2026-04-23
🤖 machine learning

WorkflowGen:an adaptive workflow generation mechanism driven by trajectory experience

WorkflowGen एक अनुकूलन योग्य ढांचा है जो एक क्लोज्ड-लूप तंत्र और तीन-स्तरीय रूटिंग रणनीति के माध्यम से प्रक्षेपवक्र अनुभव (trajectory experience) का लाभ उठाकर वर्कफ़्लो को गतिशील रूप से उत्पन्न और अनुकूलित करता है, जो बड़े एनोटेटेड डेटासेट की आवश्यकता के बिना जटिल LLM एजेंट कार्यों के लिए टोकन की खपत को काफी कम करता है और सफलता दर में सुधार करता है।

Ruocan Wei, Shufeng Wang, Ziwei Shi2026-04-23
🤖 machine learning

Transparent Screening for LLM Inference and Training Impacts

यह शोध पत्र एक पारदर्शी, ऑडिट योग्य ढांचे को प्रस्तुत करता है जो प्राकृतिक-भाषा अनुप्रयोग विवरणों को सीमित पर्यावरणीय अनुमानों में परिवर्तित करता है ताकि बड़े भाषा मॉडलों के इन्फरेंस और प्रशिक्षण प्रभावों का तुलनात्मक विश्लेषण सक्षम किया जा सके, विशेष रूप से उन अपारदर्शी मालिकाना सेवाओं के लिए जहाँ प्रत्यक्ष माप उपलब्ध नहीं है।

Arnault Pachot, Thierry Petit2026-04-23
💻 computer science

ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models

यह शोध पत्र ThermoQA को प्रस्तुत करता है, जो CoolProp 7.2.0 ग्राउंड ट्रुथ के विरुद्ध मूल्यांकित 293 ऊष्मागतिकी (thermodynamics) समस्याओं का एक तीन-स्तरीय ओपन-सोर्स बेंचमार्क है, जो यह प्रकट करता है कि जबकि फ्रंटियर LLMs उच्च सटीकता प्राप्त करते हैं, उनकी तर्क करने की क्षमता कार्य की जटिलता के साथ काफी कम हो जाती है और रन के दौरान उल्लेखनीय परिवर्तनशीलता प्रदर्शित करती है।

Kemal Düzkar2026-04-23