💻 computer science

A Subjective Logic-based method for runtime confidence updates in safety arguments

यह शोध पत्र एक सब्जेक्टिव लॉजिक-आधारित विधि प्रस्तुत करता है जो सुरक्षा प्रदर्शन संकेतकों के निरंतर मूल्यांकन के माध्यम से रनटाइम पर कॉन्फिडेंस लेवल को गतिशील रूप से अपडेट करके स्टैटिक सेफ्टी केसेज को बेहतर बनाता है, जो सटीक बेयसियन इन्फरेंस के बजाय सुरक्षा-प्रासंगिक प्रतिक्रियाशीलता को प्राथमिकता देता है।

Benjamin Herd, Jessica Kelly, Clarissa Heinemann, João-Vitor Zacchi2026-05-22
💻 computer science

TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

यह शोध पत्र टर्मिनलवर्ल्ड (TerminalWorld) का परिचय देता है, जो एक स्केलेबल डेटा इंजन है जो एआई एजेंटों के बेंचमार्किंग के लिए 80,870 वास्तविक दुनिया की रिकॉर्डिंग से 1,530 उच्च-सटीकता वाले टर्मिनल कार्यों को स्वचालित रूप से रिवर्स-इंजीनियर करता है, जिससे यह पता चलता है कि वर्तमान फ्रंटियर मॉडल प्रामाणिक वर्कफ़्लो के साथ संघर्ष करते हैं और मौजूदा विशेषज्ञ-क्यूरेटेड बेंचमार्क की तुलना में खराब प्रदर्शन करते हैं।

Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica (…)2026-05-22
💻 computer science

Dynamic Hypergraph Representation Learning for Multivariate Time Series without Prior Knowledge

यह शोध पत्र एक नवीन मॉडल का प्रस्ताव करता है जो पूर्व ज्ञान के बिना कम्युनिटी डिटेक्शन और अटेंशन मैकेनिज्म का लाभ उठाकर मल्टीवेरिएट टाइम सीरीज़ से डायनेमिक हाइपरग्राफ्स का निर्माण करता है, जिन्हें फिर भविष्यवाणी कार्यों के लिए उच्च-क्रम संबंधों को प्रभावी ढंग से कैप्चर करने हेतु एक डायनेमिक हाइपरग्राफ अटेंशन कन्वोल्यूशन नेटवर्क (DHACN) द्वारा संसाधित किया जाता है।

Marco Gregnanin, Johannes De Smedt, Giorgio Gnecco, Maurizio Parton2026-05-22
💻 computer science

Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard

यह शोध पत्र तीन महत्वपूर्ण कमजोरियों—बेंचमार्क भेद्यता, सामयिक पुरानापन (टेम्पोरल स्टेलेनेस), और रनटाइम अनिश्चितता—की पहचान करता है जो एआई एजेंटों के वर्तमान सुरक्षा मूल्यांकनों को कमजोर करती हैं और अधिक सुदृढ़ एवं विश्वसनीय ढांचे विकसित करने के लिए व्यावहारिक दिशाएं प्रस्तावित करता है।

Sahar Abdelnabi, Chris Hicks, Konrad Rieck, Ahmad-Reza Sadeghi2026-05-22
💬 NLP

Beyond Temperature: Hyperfitting as a Late-Stage Geometric Expansion

यह शोध पत्र प्रकट करता है कि LLMs में "हाइपरफिटिंग" (Hyperfitting) की घटना केवल लो-एन्ट्रॉपी शार्पनिंग का परिणाम नहीं है, बल्कि यह अंतिम ट्रांसफार्मर ब्लॉक में एक गतिशील, संदर्भ-निर्भर ज्यामितीय विस्तार से उत्पन्न होती है जो डीप-टेल टोकन्स को बढ़ावा देती है, एक ऐसी प्रक्रिया जिसे केवल अंतिम पाँच परतों को अपडेट करने वाली एक लक्षित "लेट-स्टेज लोरा" (Late-Stage LoRA) रणनीति का उपयोग करके कुशलतापूर्वक पुनरुत्पादित किया जा सकता है।

Meimingwei Li, Yuanhao Ding, Esteban Garces Arias, Christian Heumann2026-05-22
💻 computer science

MoSA: Motion-constrained Stress Adaptation for Mitigating Real-to-Sim Gap in Continuum Dynamics via Learning Residual Anisotropy

MoSA एक मोशन-कंस्ट्रेंड स्ट्रेस अडैप्टेशन फ्रेमवर्क है जो एक आइसोट्रोपिक मॉडल को भौतिक पूर्ववर्ती (फिजिक्स प्रायर) के रूप में उपयोग करके रेसिडुअल स्ट्रेस ऑपरेटर्स को सीखने के माध्यम से निरंतर गतिशीलता (कंटीन्यूम डायनेमिक्स) में रियल-टू-सिम गैप को पाटता है, जो हल्के एनिसोट्रॉपी और विषमता को कैप्चर करता है, जिससे रोबोट मैनिपुलेशन में बेहतर सटीकता, सामान्यीकरण और सिम-टू-रियल ट्रांसफर प्राप्त होता है।

Jiaxu Wang, Junhao He, Jingkai Sun, Yi Gu, Yunyang Mo, Jiahang Cao, Qiang Zhang, Renjing Xu2026-05-22
💻 computer science

Think Thrice Before You Speak: Dual knowledge-enhanced Theory-of-Mind Reasoning for Persuasive Agents

यह शोध पत्र मौजूदा LLMs की थ्योरी-ऑफ़-माइंड (ToM) तर्क क्षमता की सीमाओं को संबोधित करने के लिए ToM-PD कार्य और ToM-BPD डेटासेट प्रस्तुत करता है, जो "थिंक थ्राइस बिफोर यू स्पीक" (TTBYS) फ्रेमवर्क का प्रस्ताव देता है जो इच्छाओं, विश्वासों और प्रेरक रणनीतियों की भविष्यवाणी करने में GPT-5 से काफी बेहतर प्रदर्शन करने के लिए दोहरे ज्ञान का लाभ उठाता है।

Minghui Ma, Bin Guo, Runze Yang, Mengqi Chen, Yan Liu, Jingqi Liu, Yahan Pei, Xuehao Ma, Qiuyun Zhang, Zhiwen Yu2026-05-22
💻 computer science

Innovations in Cardless Artificial Intelligence Banking: A Comprehensive Framework for Cyber Secure and Fraud Mitigation using Machine Learning Algorithms

यह शोध पत्र कार्डलेस एआई बैंकिंग के लिए एक व्यापक ढांचे का प्रस्ताव करता है जो साइबर सुरक्षा को बढ़ाने, लेनदेन को प्रमाणित करने और धोखाधड़ी के जोखिमों को सक्रिय रूप से कम करने के लिए मशीन लर्निंग एल्गोरिदम, एआई-संचालित डेटा क्रिप्टोग्राफी और ऑटो-जेनरेटेड वर्चुअल कार्डों का लाभ उठाता है।

Md Israfeel2026-05-22✓ Author reviewed
💻 computer science

Healthcare LLM Benchmarks Are Only as Good as Their Explicit Assumptions

यह शोध पत्र तर्क देता है कि स्वास्थ्य सेवा (हेल्थकेयर) LLM बेंचमार्क प्रदर्शन और वास्तविक दुनिया में तैनाती के बीच का अंतर उपयोगकर्ता व्यवहार के अप्रमाणित अंतर्निहित धारणाओं से उत्पन्न होता है, जो इन धारणाओं को वर्गीकृत करने के लिए एक रूपरेखा प्रस्तावित करता है और उन्हें व्यवस्थित रूप से संबोधित करने के लिए "बेंचमार्ककार्ड्स" (BenchmarkCards) और चरणबद्ध मूल्यांकन पेश करता है।

Naveen Raman, Santiago Cortes-Gomez, Mateo Dulce Rubio, Fei Fang, Bryan Wilder2026-05-22
💻 computer science

Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents

यह शोध पत्र "कॉन्ट्रैक्चुअल स्किल्स" (contractual skills) पेश करता है, जो एक GovernSpec-प्रेरित ढांचा है जो एंटरप्राइज एआई एजेंट निर्देशों को पठनीय कार्य अनुबंधों के रूप में व्यवस्थित करता है ताकि लक्ष्यों, सीमाओं और गुणवत्ता मानदंडों की निरीक्षण क्षमता को बढ़ाया जा सके, और प्रयोगों के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण एक स्टैंडअलोन सुरक्षा तंत्र के रूप में कार्य करने के बजाय शासन और रखरखाव क्षमता में सुधार करता है।

Ting Liu2026-05-22