💻 computer science

Responsible Agentic AI Requires Explicit Provenance

यह शोध पत्र यह तर्क देता है कि संपूर्ण एजेंटिक एआई (agentic AI) जीवनचक्र में स्पष्ट, मात्रात्मक और पता लगाने योग्य उत्पत्ति (provenance) स्थापित करना जिम्मेदारी को गणनीय (computable) और कार्रवाई योग्य बनाने के लिए एक आवश्यक पूर्व शर्त है, जिससे जटिल, बहु-पक्षीय एजेंट संरचनाओं में होने वाले नुकसान के लिए जवाबदेही निर्धारित करने में असमर्थता के कारण उत्पन्न वर्तमान विश्वास संकट का समाधान किया जा सके।

Jinwei Hu, Xinmiao Huang, Qisong He, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
💻 computer science

OpenJarvis: Personal AI, On Personal Devices

OpenJarvis एक विखंडित (decomposed), टाइप किया गया व्यक्तिगत AI आर्किटेक्चर पेश करता है जो क्लाउड-स्तरीय सटीकता के साथ ऑन-डिवाइस सिस्टम को सक्षम बनाने के लिए LLM-निर्देशित स्पेक सर्च का लाभ उठाते हुए पांच स्वतंत्र प्रिमिटिव्स को अनुकूलित करता है, जिससे API लागत और विलंबता (latency) में भारी कमी आती है।

Jon Saad-Falcon, Avanika Narayan, Robby Manihani, Tanvir Bhathal, Herumb Shandilya, Hakki Orhun Akengin, Gabriel Bo, And (…)2026-05-19
💬 NLP

Why Do Safety Guardrails Degrade Across Languages?

यह शोध पत्र विभिन्न भाषाओं में लार्ज लैंग्वेज मॉडल्स (LLMs) में सुरक्षा क्षरण (safety degradation) को चलाने वाले विशिष्ट कारकों को अलग करने और उनका विश्लेषण करने के लिए एक मल्टी-ग्रुप आइटम रिस्पांस थ्योरी फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि सुरक्षा विफलताएं मुख्य रूप से एकआयामी हैं, अक्सर कम-संसाधन वाली भाषाओं की तुलना में अंग्रेजी में अधिक गंभीर होती हैं, और केवल अनुवाद की गुणवत्ता के बजाय भौतिक हानि और सांस्कृतिक बेमेल से संबंधित प्रॉम्प्ट-विशिष्ट क्रॉस-लिंगुअल अंतराल से महत्वपूर्ण रूप से प्रभावित होती हैं।

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo2026-05-19
💻 computer science

CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning

यह शोधपत्र CAREBench को प्रस्तुत करता है, जो मूल्यांकन सिद्धांत (appraisal theory) पर आधारित एक नवीन बेंचमार्क है, जो केवल लेबल भविष्यवाणी के बजाय संज्ञानात्मक तर्क श्रृंखलाओं (cognitive reasoning chains) के माध्यम से LLMs की भावना समझ का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल कुछ कार्यों पर मानव प्रदर्शन के स्तर तक पहुँचने के बावजूद, मूल्यांकन तर्क (appraisal reasoning) और सकारात्मक भावनाओं की पहचान करने में संघर्ष करते हैं।

Zhaoyue Sun, Hainiu Xu, Andero Uusberg, James J. Gross, Petr Slovak, Yulan He2026-05-19
💻 computer science

MusicSynth: An Automated Pipeline for Generating Violin Fingerboard Animations from Sheet Music Using Optical Music Recognition

MusicSynth एक ओपन-सोर्स, ब्राउज़र-आधारित पाइपलाइन है जो ऑप्टिकल म्यूजिक रिकग्निशन, MusicXML पार्सिंग और एक कस्टम नोट-टू-पोजीशन लुकअप टेबल को एकीकृत करके शीट म्यूजिक छवियों या डिजिटल फाइलों से स्वचालित रूप से वायलिन फिंगरबोर्ड एनिमेशन ट्यूटोरियल उत्पन्न करती है।

Abhimanyu Kaushik2026-05-19✓ Author reviewed
💻 computer science

Drift Flow Matching

यह शोध पत्र ड्रिफ्ट फ्लो मैचिंग (DFM) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो कुशल वन-स्टेप ड्रिफ्ट मॉडल्स और लचीले मल्टी-स्टेप फ्लो मैचिंग मेथड्स के बीच के अंतर को पाटता है, जिससे डायरेक्ट ट्रांसपोर्ट मैप्स को इटरेटिव इन्फरेंस स्टेप्स के माध्यम से रिफाइन करने की अनुमति देकर एडेप्टिव जनरेशन क्वालिटी सक्षम होती है।

Chenrui Ma, Xi Xiao, Lin Zhao, Tianyang Wang, Ferdinando Fioretto, Yanning Shen2026-05-19
💻 computer science

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

यह शोधपत्र CAM-Bench प्रस्तुत करता है, जो कम्प्यूटेशनल और अनुप्रयुक्त गणित में 1,000 औपचारिक समस्याओं वाला एक नया Lean 4 बेंचमार्क है, जो पाठ्यपुस्तकीय अभ्यासों को अनुकूलित करने के लिए एक डिपेंडेंसी-रिकवरी पाइपलाइन का उपयोग करके और स्थानीय संदर्भ ट्रैकिंग तथा प्रारंभिक प्रमेय अनुप्रयोग की आवश्यकताओं वाले कार्यों पर लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का विश्लेषण करके मौजूदा मूल्यांकनों में इन डोमेन के कम प्रतिनिधित्व को संबोधित करता है।

Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen2026-05-19
⚡ electrical engineering

Latency-Aware Deep Learning Benchmark for Real-Time Cyber-Physical Attack and Fault Classification in Inverter-Dominated Power Grids

यह शोध पत्र एक विलंबता-जागरूक (latency-aware) बेंचमार्किंग फ्रेमवर्क प्रस्तुत करता है जो इनवर्टर-प्रधान पावर ग्रिड में वास्तविक समय के दोष और साइबर-हमले के वर्गीकरण के लिए आठ डीप लर्निंग आर्किटेक्चर का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि मॉडल सब-साइकिल निर्णय समय प्राप्त करते हैं, लेकिन उनकी एंड-टू-एंड इन्फरेंस विलंबता (50-90 ms) वर्तमान में सुरक्षा-ग्रेड आवश्यकताओं से अधिक है, जो एल्गोरिदम प्रदर्शन और तैनात करने योग्य हार्डवेयर समाधानों के बीच एक महत्वपूर्ण अंतर को उजागर करती है।

Emad Abukhousa, Saman Zonouz, A. P. Sakis Meliopoulos2026-05-19
💻 computer science

State-of-the-Art Claims Require State-of-the-Art Evidence

यह शोध पत्र तर्क देता है कि एआई अनुसंधान में 'स्टेट-ऑफ-द-आर्ट' के दावे अक्सर बेंचमार्क साक्ष्यों द्वारा समर्थित नहीं होते हैं, क्योंकि कुल स्कोर में सुधार अक्सर निरंतर और सुदृढ़ श्रेष्ठता के बजाय आउटलेर्स (outliers) पर निर्भर करते हैं, जो मॉडल के प्रदर्शन की अधिक ईमानदार और सटीक रिपोर्टिंग को आवश्यक बनाता है।

YongKyung Oh2026-05-19
💻 computer science

How Do Electrocardiogram Models Scale?

यह शोध पत्र विभिन्न आकारों और प्रतिमानों (paradigms) में 120 मॉडलों को प्रशिक्षित करके इलेक्ट्रोकार्डियोग्राम (ECG) मॉडलों के लिए स्केलिंग लॉ (scaling laws) की व्यवस्थित रूप से जांच करता है, जिससे यह पता चलता है कि जबकि स्व-पर्यवेक्षित शिक्षण (self-supervised learning) बेहतर डेटा और ट्रांसफर दक्षता प्रदान करता है, प्रभावी ECG फाउंडेशन मॉडलों का इष्टतम मार्ग केवल ब्रूट-फोर्स स्केलिंग पर निर्भर करने के बजाय आर्किटेक्चर (ResNet बनाम Transformer) को प्री-ट्रेनिंग प्रतिमान के साथ रणनीतिक रूप से संरेखित करने पर निर्भर करता है।

Jiawei Li, Fabio Bonassi, Ming Jin, Stefan Gustafsson, Johan Sundström, Thomas B. Schön, Antônio H. Ribeiro2026-05-19